[Cánh diều] Trắc nghiệm Khoa học máy tính 12 bài 2: Giới thiệu về khoa học dữ liệu

[Cánh diều] Trắc nghiệm Khoa học máy tính 12 bài 2: Giới thiệu về khoa học dữ liệu

1. Khi dữ liệu có quá nhiều chiều (high dimensionality), vấn đề nào thường nảy sinh và cần được xử lý?
2. Trong Khoa học dữ liệu, giai đoạn tiền xử lý dữ liệu (data preprocessing) có vai trò gì?
3. Đâu là yếu tố cốt lõi tạo nên sự khác biệt và sức mạnh của Khoa học dữ liệu so với các ngành phân tích dữ liệu truyền thống?
4. Yếu tố nào sau đây KHÔNG thuộc về Dữ liệu lớn (Big Data) theo định nghĩa 3V truyền thống?
5. Vai trò của nhà khoa học dữ liệu (Data Scientist) là gì trong một tổ chức?
6. Trong mô hình CRISP-DM (Cross-Industry Standard Process for Data Mining), giai đoạn Đánh giá (Evaluation) thường diễn ra khi nào?
7. Khái niệm Khoa học dữ liệu (Data Science) có thể được mô tả chính xác nhất như thế nào trong bối cảnh công nghệ hiện đại?
8. Khái niệm quá khớp (overfitting) trong Khoa học dữ liệu xảy ra khi nào?
9. Mục tiêu chính của việc khám phá dữ liệu (exploratory data analysis - EDA) trong Khoa học dữ liệu là gì?
10. Yếu tố nào sau đây là quan trọng nhất trong việc lựa chọn thuật toán phù hợp cho một bài toán Khoa học dữ liệu?
11. Quy trình làm việc điển hình trong Khoa học dữ liệu thường bắt đầu bằng bước nào sau đây?
12. Ngôn ngữ lập trình nào được sử dụng phổ biến nhất trong lĩnh vực Khoa học dữ liệu hiện nay nhờ hệ sinh thái thư viện phong phú?
13. Mục đích chính của việc trực quan hóa dữ liệu (data visualization) trong Khoa học dữ liệu là gì?
14. Khái niệm học sâu (Deep Learning) liên quan mật thiết đến Khoa học dữ liệu như thế nào?
15. Vai trò của kỹ sư dữ liệu (Data Engineer) trong một dự án Khoa học dữ liệu là gì?
16. Khi nói về dữ liệu lớn (Big Data), yếu tố nào sau đây thường KHÔNG được xem là đặc trưng chính?
17. Trong Khoa học dữ liệu, khái niệm tính năng (feature) thường đề cập đến điều gì?
18. Trong quá trình đánh giá mô hình (model evaluation), chỉ số nào thường được sử dụng để đo lường hiệu suất của một bài toán phân loại?
19. Công cụ nào thường được sử dụng để trực quan hóa dữ liệu một cách tương tác và tạo báo cáo động trong Khoa học dữ liệu?
20. Thuật toán nào sau đây thuộc nhóm thuật toán học không giám sát (Unsupervised Learning)?
21. Trong chu trình sống của một dự án Khoa học dữ liệu, sau khi xây dựng và đánh giá mô hình, bước tiếp theo thường là gì?
22. Khái niệm tính năng kỹ thuật (feature engineering) trong Khoa học dữ liệu là gì?
23. Công nghệ nào sau đây KHÔNG phải là một công cụ hoặc kỹ thuật phổ biến trong Khoa học dữ liệu?
24. Thuật toán nào sau đây thuộc nhóm thuật toán học có giám sát (Supervised Learning)?
25. Đâu là một ví dụ về bài toán phân loại (classification) trong Khoa học dữ liệu?