[Chân trời] Trắc nghiệm Khoa học máy tính 12 bài F17: Hoạt động trải nghiệm về Khoa học dữ liệu

[Chân trời] Trắc nghiệm Khoa học máy tính 12 bài F17: Hoạt động trải nghiệm về Khoa học dữ liệu

1. Một nhà khoa học dữ liệu muốn xác định mối quan hệ giữa số giờ học và điểm thi của sinh viên. Loại phân tích nào phù hợp nhất cho mục tiêu này?
2. Một nhà khoa học dữ liệu đang xây dựng một mô hình dự đoán giá nhà. Yếu tố diện tích (square footage) của căn nhà sẽ thuộc loại thuộc tính nào?
3. Trong Kỹ thuật tiền xử lý dữ liệu, chuẩn hóa (Normalization) thường được áp dụng cho các thuộc tính số có phạm vi giá trị khác nhau như thế nào?
4. Trong học máy, mô hình dự đoán (Predictive Model) được sử dụng để làm gì?
5. Một công ty muốn dự đoán khả năng một khách hàng sẽ ngừng sử dụng dịch vụ của họ. Loại bài toán học máy nào phù hợp nhất cho mục tiêu này?
6. Trong xử lý ngôn ngữ tự nhiên (NLP), tokenization là bước đầu tiên quan trọng, có nghĩa là gì?
7. Trong Khoa học dữ liệu, data governance (quản trị dữ liệu) đề cập đến các yếu tố nào?
8. Khi đánh giá mô hình hồi quy, chỉ số R-squared (hệ số xác định) cho biết điều gì?
9. Trong Khoa học dữ liệu, A/B Testing (Thử nghiệm A/B) là một phương pháp được sử dụng để làm gì?
10. Quá trình thu thập dữ liệu từ các nguồn khác nhau, bao gồm web, cơ sở dữ liệu, cảm biến, mạng xã hội, được gọi là gì trong Khoa học dữ liệu?
11. Khi phân tích dữ liệu về hành vi khách hàng, phân tích giỏ hàng (Market Basket Analysis) thường được sử dụng để tìm ra gì?
12. Khi đánh giá hiệu suất của một mô hình phân loại, chỉ số Precision đo lường điều gì?
13. Một nhà khoa học dữ liệu muốn xây dựng hệ thống gợi ý phim cho người dùng dựa trên lịch sử xem phim của họ. Thuật toán Collaborative Filtering (Lọc cộng tác) hoạt động dựa trên nguyên tắc nào?
14. Trong lĩnh vực Khoa học dữ liệu, thuật ngữ Big Data thường ám chỉ tập dữ liệu có đặc điểm nào sau đây, vượt xa khả năng xử lý của các công cụ truyền thống?
15. Khi một mô hình học máy có hiệu suất rất cao trên dữ liệu huấn luyện nhưng lại kém trên dữ liệu mới chưa từng thấy, hiện tượng này được gọi là gì?
16. Trong Khoa học dữ liệu, Big Data Analytics tập trung vào việc gì?
17. Thuật toán K-Means thuộc loại thuật toán nào trong Học máy?
18. Trong Khoa học dữ liệu, model deployment (triển khai mô hình) là giai đoạn nào?
19. Trong Khoa học dữ liệu, Exploratory Data Analysis (EDA - Phân tích Khám phá Dữ liệu) là một giai đoạn nhằm mục đích gì?
20. Tại sao việc làm sạch dữ liệu (Data Cleaning) lại quan trọng trong phân tích Khoa học dữ liệu?
21. Khi làm việc với dữ liệu chuỗi thời gian (Time Series Data), mục tiêu chính của Forecasting (Dự báo) là gì?
22. Một nhà khoa học dữ liệu sử dụng thuật toán Decision Tree (Cây quyết định) để phân loại khách hàng có khả năng mua sản phẩm hay không. Cấu trúc của Cây quyết định bao gồm các thành phần chính nào?
23. Trong Khoa học dữ liệu, thuật ngữ feature engineering (kỹ thuật đặc trưng) có nghĩa là gì?
24. Trong xử lý ảnh bằng Khoa học dữ liệu, Image Segmentation (Phân đoạn ảnh) là quá trình gì?
25. Thuật ngữ trực quan hóa dữ liệu (Data Visualization) đề cập đến việc gì trong Khoa học dữ liệu?