Đề 5 – Đề thi, câu hỏi trắc nghiệm online Khai phá dữ liệu

Đề 5 - Đề thi, câu hỏi trắc nghiệm online Khai phá dữ liệu

1. Phương pháp nào sau đây được sử dụng để chuẩn hóa dữ liệu (data normalization) trong quá trình tiền xử lý dữ liệu?
2. Thuật toán nào sau đây thường được sử dụng để xây dựng mô hình phân lớp dựa trên việc phân chia dữ liệu thành các nhánh cây?
3. Trong khai phá dữ liệu, 'confidence' của một luật kết hợp (association rule) được định nghĩa là gì?
4. Trong khai phá dữ liệu, kỹ thuật 'cross-validation' (kiểm định chéo) được sử dụng để làm gì?
5. Trong khai phá dữ liệu, 'lift' trong luật kết hợp (association rule) được định nghĩa là gì?
6. Trong khai phá dữ liệu, việc sử dụng một tập dữ liệu lớn và đa dạng thường giúp cải thiện điều gì ở mô hình học máy?
7. Kỹ thuật nào sau đây được sử dụng để phân tích chuỗi thời gian (time series analysis) trong khai phá dữ liệu?
8. Trong khai phá dữ liệu, thuật ngữ 'overfitting' (quá khớp) mô tả hiện tượng gì?
9. Trong khai phá dữ liệu, kỹ thuật nào sau đây được sử dụng để dự đoán giá trị của một biến số dựa trên giá trị của các biến số khác?
10. Trong khai phá dữ liệu, thuật ngữ 'ensemble learning' (học tập hợp) đề cập đến phương pháp nào?
11. Trong khai phá dữ liệu, kỹ thuật nào được sử dụng để nhóm các khách hàng có hành vi mua hàng tương tự nhau?
12. Trong khai phá dữ liệu, thuật ngữ 'bias-variance tradeoff' (đánh đổi giữa độ chệch và phương sai) đề cập đến điều gì?
13. Trong khai phá dữ liệu, thuật ngữ 'outlier' (điểm ngoại lệ) được định nghĩa là gì?
14. Phương pháp nào sau đây được sử dụng để giảm thiểu overfitting trong mô hình học máy?
15. Thuật toán nào sau đây thường được sử dụng để phân cụm dữ liệu dựa trên khoảng cách giữa các điểm dữ liệu?
16. Kỹ thuật nào sau đây được sử dụng để chuyển đổi dữ liệu định tính (categorical data) thành dữ liệu định lượng (numerical data) để sử dụng trong các thuật toán khai phá dữ liệu?
17. Trong khai phá dữ liệu, kỹ thuật nào thường được sử dụng để giảm số lượng thuộc tính của dữ liệu, đồng thời giữ lại thông tin quan trọng nhất?
18. Phương pháp nào sau đây được sử dụng để giảm số lượng chiều dữ liệu trong khi vẫn giữ lại phần lớn thông tin quan trọng?
19. Thuật toán nào sau đây thường được sử dụng để tìm các tập mục phổ biến (frequent itemsets) trong khai phá dữ liệu?
20. Trong khai phá dữ liệu, kỹ thuật nào được sử dụng để tìm ra các mối quan hệ giữa các biến trong một tập dữ liệu?
21. Trong khai phá dữ liệu, 'precision' (độ chính xác) và 'recall' (độ phủ) là gì?
22. Phương pháp nào sau đây được sử dụng để đánh giá hiệu quả của một mô hình phân lớp trong khai phá dữ liệu?
23. Trong bối cảnh khai phá dữ liệu, thuật ngữ 'curse of dimensionality' (lời nguyền chiều dữ liệu) đề cập đến vấn đề gì?
24. Trong khai phá dữ liệu, 'support' của một tập hợp mục (itemset) được định nghĩa là gì?
25. Phương pháp nào sau đây được sử dụng để đánh giá mô hình hồi quy trong khai phá dữ liệu?
26. Thuật toán nào sau đây thường được sử dụng để xây dựng mô hình phân lớp dựa trên việc tìm đường biên phân chia tối ưu giữa các lớp?
27. Trong khai phá dữ liệu, kỹ thuật nào được sử dụng để tìm các mẫu (pattern) trong dữ liệu trình tự (sequential data), ví dụ như hành vi của khách hàng trên trang web?
28. Thuật toán nào sau đây thường được sử dụng để phân tích tình cảm (sentiment analysis) trong khai phá dữ liệu văn bản?
29. Kỹ thuật nào sau đây được sử dụng để xử lý dữ liệu bị thiếu trong quá trình tiền xử lý dữ liệu?
30. Kỹ thuật nào sau đây được sử dụng để khám phá các mối quan hệ giữa các thực thể và thuộc tính của chúng trong một cơ sở dữ liệu đồ thị (graph database)?