[Cánh diều] Trắc nghiệm Khoa học máy tính 12 bài 4: Thực hành phân tích dữ liệu

[Cánh diều] Trắc nghiệm Khoa học máy tính 12 bài 4: Thực hành phân tích dữ liệu

1. Thư viện nào trong Python thường được sử dụng cho các phép tính số học và thao tác trên mảng đa chiều, là nền tảng cho nhiều thư viện khoa học dữ liệu khác?
2. Khi làm sạch dữ liệu, việc phát hiện và xử lý các giá trị bị thiếu (missing values) là rất cần thiết. Phương pháp nào KHÔNG PHẢI là cách tiếp cận phổ biến để xử lý giá trị thiếu?
3. Khi so sánh phân phối của hai biến định lượng, biểu đồ nào sau đây thường được sử dụng để xem xét mối quan hệ giữa chúng và phát hiện các cụm (clusters)?
4. Trong ngữ cảnh phân tích dữ liệu, data wrangling (sắp xếp dữ liệu) bao gồm các hoạt động nào?
5. Trong phân tích dữ liệu, correlation (tương quan) đo lường điều gì?
6. Mục tiêu chính của việc data validation (xác thực dữ liệu) là gì?
7. Công cụ nào dưới đây thường được sử dụng để biểu diễn dữ liệu dưới dạng biểu đồ, đồ thị nhằm giúp người xem dễ dàng nắm bắt xu hướng và mối quan hệ giữa các biến số?
8. Ngôn ngữ lập trình nào được sử dụng phổ biến nhất hiện nay trong lĩnh vực khoa học dữ liệu và phân tích dữ liệu nhờ vào hệ sinh thái thư viện phong phú?
9. Mục tiêu của data cleaning (làm sạch dữ liệu) không bao gồm hành động nào?
10. Trong phân tích dữ liệu, feature engineering (kỹ thuật đặc trưng) là quá trình gì?
11. Để phân tích xu hướng của một biến định lượng theo thời gian, loại biểu đồ nào sau đây là phù hợp nhất?
12. Khi phân tích dữ liệu về phản hồi của khách hàng, loại biến nào sau đây là biến định tính (qualitative variable)?
13. Một tập dữ liệu có cột Ngày (Date) và cột Doanh thu (Revenue). Để xem doanh thu trung bình theo tháng, ta cần thực hiện hành động gì với cột Ngày?
14. Khi làm việc với dữ liệu dạng bảng (tabular data), thuật ngữ outlier (ngoại lai) thường đề cập đến loại giá trị nào?
15. Phân tích dữ liệu Big Data khác biệt với phân tích dữ liệu truyền thống chủ yếu ở điểm nào?
16. Phân tích nào tập trung vào việc mô tả đặc điểm của dữ liệu hiện có, như giá trị trung bình, độ lệch chuẩn, tần suất xuất hiện?
17. Thư viện Pandas trong Python cung cấp cấu trúc dữ liệu chính nào để làm việc với dữ liệu có cấu trúc dạng bảng?
18. Phân tích khám phá dữ liệu (Exploratory Data Analysis - EDA) có vai trò gì chính trong quy trình phân tích dữ liệu?
19. Trong phân tích dữ liệu, khái niệm dimensionality reduction (giảm chiều dữ liệu) thường được áp dụng khi nào?
20. Trong quá trình phân tích dữ liệu, bước nào thường được xem là quan trọng nhất để đảm bảo chất lượng và độ tin cậy của kết quả cuối cùng?
21. Khi làm sạch dữ liệu, việc chuẩn hóa (normalization) và co giãn (scaling) thường được áp dụng cho các biến định lượng có ý nghĩa gì?
22. Khi làm việc với dữ liệu văn bản (text data), bước tiền xử lý nào là quan trọng để giảm số lượng từ vựng và loại bỏ các từ ít mang ý nghĩa?
23. Trong kỹ thuật one-hot encoding được sử dụng cho biến định tính, mỗi giá trị duy nhất của biến gốc sẽ được biểu diễn bằng:
24. Phân tích nào nhằm mục đích giải thích tại sao một sự kiện hoặc một kết quả xảy ra, thường tìm kiếm nguyên nhân và mối quan hệ nhân quả?
25. Khi bạn muốn so sánh sự phân bố của một biến định lượng giữa nhiều nhóm khác nhau, biểu đồ nào là lựa chọn tốt nhất?