Đề 8 – Đề thi, câu hỏi trắc nghiệm online Dữ liệu lớn (BigData)

Đề 8 - Đề thi, câu hỏi trắc nghiệm online Dữ liệu lớn (BigData)

1. Kafka là một hệ thống message queue phân tán. Mục đích chính của việc sử dụng Kafka là gì?
2. Khi thiết kế một hệ thống Big Data, yếu tố nào sau đây cần được ưu tiên để đảm bảo khả năng mở rộng (scalability)?
3. Trong kiến trúc Lambda, lớp Batch Layer có vai trò gì?
4. Trong ngữ cảnh Big Data, 'Data Lakehouse' kết hợp những ưu điểm của Data Lake và Data Warehouse như thế nào?
5. Trong Big Data, thuật ngữ 'Schema on Read' liên quan đến cách tiếp cận nào trong xử lý dữ liệu?
6. Trong Big Data, thuật ngữ 'Data Silos' đề cập đến vấn đề gì?
7. Oozie là một hệ thống workflow scheduler trong hệ sinh thái Hadoop. Chức năng chính của Oozie là gì?
8. Thuật ngữ 'Data Lake' khác biệt so với 'Data Warehouse' như thế nào?
9. Trong ngữ cảnh Big Data, 'Data Mining' được hiểu là gì?
10. Công cụ nào sau đây thường được sử dụng để xây dựng các ứng dụng Machine Learning trên nền tảng Spark?
11. Ưu điểm chính của việc sử dụng các định dạng dữ liệu cột (columnar data formats) như Parquet hoặc ORC trong Big Data là gì?
12. Trong ngữ cảnh Big Data, 'Data Streaming' đề cập đến điều gì?
13. Công cụ nào sau đây thường được sử dụng để truy vấn và phân tích dữ liệu trong Hadoop sử dụng cú pháp giống SQL?
14. Công cụ nào sau đây thường được sử dụng để trực quan hóa dữ liệu lớn (Big Data)?
15. Khi nào nên sử dụng kiến trúc Kappa thay vì kiến trúc Lambda trong xử lý dữ liệu lớn?
16. YARN (Yet Another Resource Negotiator) là một thành phần quan trọng trong Hadoop 2.0. Vai trò chính của YARN là gì?
17. Công cụ nào sau đây thường được sử dụng để chuyển dữ liệu giữa Hadoop và các hệ quản trị cơ sở dữ liệu quan hệ (RDBMS)?
18. Hadoop là một framework mã nguồn mở được sử dụng rộng rãi trong Big Data. Thành phần chính nào của Hadoop chịu trách nhiệm lưu trữ dữ liệu?
19. Công nghệ nào sau đây được sử dụng để xử lý các luồng sự kiện phức tạp (Complex Event Processing - CEP) trong thời gian thực?
20. Đâu là thách thức lớn nhất khi làm việc với dữ liệu lớn (Big Data)?
21. Thuật ngữ 'Dark Data' trong Big Data đề cập đến loại dữ liệu nào?
22. Trong ngữ cảnh Big Data, 'Data Governance' đề cập đến điều gì?
23. Hadoop MapReduce hoạt động dựa trên nguyên tắc nào?
24. Trong kiến trúc Lambda, lớp (layer) nào chịu trách nhiệm xử lý dữ liệu theo thời gian thực (real-time processing)?
25. HBase là một hệ quản trị cơ sở dữ liệu NoSQL được xây dựng trên Hadoop. Đặc điểm chính của HBase là gì?
26. Công cụ nào sau đây thường được sử dụng để thu thập và tải dữ liệu log từ nhiều nguồn khác nhau vào Hadoop?
27. Trong Big Data, kỹ thuật 'Data Wrangling' (hoặc Data Munging) đề cập đến hoạt động nào?
28. Trong lĩnh vực Big Data, thuật ngữ 'CAP theorem' đề cập đến những thuộc tính nào mà một hệ thống phân tán phải cân bằng?
29. Spark là một engine xử lý dữ liệu lớn. Ưu điểm chính của Spark so với MapReduce là gì?
30. Trong bối cảnh Big Data, thuật ngữ 'Velocity' đề cập đến khía cạnh nào?