Dùng để cải thiện cách chọn hành động, lấy phần thưởng làm manh mối
Đúng như tên gọi, dùng cho bài toán hồi quy, xuất ra chính giá trị liên tục
Trái với tên gọi, dùng cho bài toán phân loại, xuất ra xác suất thuộc về một lớp
Dùng để tìm cụm dữ liệu mà không cần dữ liệu có giám sát
Đáp ánC. Trái với tên gọi, dùng cho bài toán phân loại, xuất ra xác suất thuộc về một lớp
Hồi quy logistic tuy có chữ "hồi quy" trong tên gọi, nhưng là phương pháp phân loại, chuyển kết quả tính tuyến tính thành dạng xác suất để phán định lớp. Dự đoán chính giá trị liên tục là công việc của các phương pháp bài toán hồi quy như hồi quy tuyến tính, và việc bị tên gọi dẫn dắt để chọn nhầm cái này là lỗi điển hình. Tìm cụm mà không cần dữ liệu có giám sát là phân cụm, thuộc chủ đề học không giám sát; cải thiện hành động bằng phần thưởng là chủ đề học tăng cường; cả hai đều nằm ở mục khác.
Câu 2 | Hồi quy và phân loại
Đâu là sự khác biệt giữa bài toán hồi quy và bài toán phân loại trong học có giám sát?
Bài toán hồi quy dùng dữ liệu giám sát, bài toán phân loại chỉ học bằng phần thưởng làm manh mối
Bài toán hồi quy dự đoán lớp rời rạc, bài toán phân loại dự đoán giá trị liên tục
Bài toán hồi quy dự đoán giá trị liên tục, bài toán phân loại dự đoán lớp rời rạc
Bài toán hồi quy chỉ dùng đặc trưng, bài toán phân loại dùng cả đặc trưng lẫn dữ liệu giám sát
Đáp ánC. Bài toán hồi quy dự đoán giá trị liên tục, bài toán phân loại dự đoán lớp rời rạc
Bài toán hồi quy dự đoán giá trị liên tục như doanh số hay nhiệt độ, còn bài toán phân loại dự đoán lớp rời rạc như có phải thư rác hay không. Mô tả đổi chỗ hai cái này là lỗi thường gặp nhất. Học có giám sát ở cả hai loại bài toán đều cần cặp đặc trưng và dữ liệu giám sát, nên không có chuyện chỉ một bên cần đặc trưng là đủ. Chỉ dùng phần thưởng làm manh mối là học tăng cường, không phải mô tả của học có giám sát.
Câu 3 | Hồi quy đơn và hồi quy bội
Đâu là sự khác biệt phù hợp giữa phân tích hồi quy đơn và phân tích hồi quy bội?
Hồi quy đơn không cần dữ liệu giám sát, hồi quy bội cần dữ liệu giám sát
Hồi quy đơn có nhiều biến giải thích, hồi quy bội có 1 biến giải thích
Hồi quy đơn có 1 biến giải thích, hồi quy bội có nhiều biến giải thích
Hồi quy đơn dùng cho phân loại, hồi quy bội dùng cho dự đoán giá trị liên tục
Đáp ánC. Hồi quy đơn có 1 biến giải thích, hồi quy bội có nhiều biến giải thích
Loại có 1 biến giải thích là phân tích hồi quy đơn, loại có 2 biến giải thích trở lên là phân tích hồi quy bội. Vì chữ "đơn" và "bội" thể hiện trực tiếp số lượng biến giải thích, nên mô tả đổi chỗ là sai. Cả hai đều là phương pháp hồi quy dự đoán giá trị liên tục, nên mô tả một bên là phân loại cũng không đúng. Ngoài ra phân tích hồi quy là học có giám sát, cần dữ liệu giám sát bất kể số lượng biến.
Câu 4 | Tối đa hóa biên
Đâu là cách nghĩ mà Support Vector Machine (SVM) dùng để quyết định ranh giới?
Vẽ lại ranh giới trong khi tăng trọng số của dữ liệu bị phân loại sai
Vẽ ranh giới đi qua trung điểm của đoạn thẳng nối trọng tâm các lớp
Vẽ ranh giới tại vị trí khoảng cách tới điểm dữ liệu gần nhất là lớn nhất
Vẽ ranh giới theo hướng phương sai của biến giải thích là lớn nhất
Đáp ánC. Vẽ ranh giới tại vị trí khoảng cách tới điểm dữ liệu gần nhất là lớn nhất
SVM tối đa hóa biên (margin), tức vẽ ranh giới tại vị trí mà khoảng cách tới điểm dữ liệu gần nhất là lớn nhất. Điểm gần nhất này được gọi là support vector. Việc tăng dần trọng số của dữ liệu bị phân loại sai rồi cộng dồn các bộ học là ý tưởng của boosting; tìm hướng phương sai lớn nhất là ý tưởng của phân tích thành phần chính (PCA); cả hai đều không phải mô tả của SVM. Cách vẽ qua trung điểm trọng tâm hoàn toàn không xét tới biên.
Câu 5 | Kernel trick
Đâu là điều mà kernel trick giúp thực hiện được?
Thực hiện phân tách phi tuyến mà không cần thực sự tính tọa độ sau khi ánh xạ lên chiều cao
Tính toán từng đặc trưng chiều cao thực sự rồi mới phân tách tuyến tính
Tự động chia dữ liệu thành nhiều cụm mà không cần dữ liệu giám sát
Giảm đáng kể số lượng dữ liệu dùng để học để làm nhanh hơn
Đáp ánA. Thực hiện phân tách phi tuyến mà không cần thực sự tính tọa độ sau khi ánh xạ lên chiều cao
Kernel trick tính trực tiếp tích trong (inner product) sau khi ánh xạ lên không gian chiều cao bằng hàm kernel, giúp thực hiện phân tách phi tuyến mà không cần thực sự tính tọa độ sau khi ánh xạ. Việc không cần tính tọa độ từng cái là lý do nó được gọi là "mẹo", nên mô tả tính toán thực sự rồi mới phân tách là ngược chiều. Việc chia mà không cần dữ liệu giám sát là chuyện của phân cụm, và đây cũng không phải cơ chế giảm số lượng dữ liệu học.
Câu 6 | Song song và tuần tự
Đâu là sự khác biệt giữa bagging và boosting trong học tập hợp (ensemble learning)?
Bagging chỉ dùng được cho cây quyết định, boosting chỉ dùng được cho hồi quy tuyến tính
Bagging học bộ học yếu theo tuần tự, boosting học theo song song
Bagging học bộ học yếu theo song song, boosting học theo tuần tự
Bagging không dùng dữ liệu giám sát, boosting dùng dữ liệu giám sát
Đáp ánC. Bagging học bộ học yếu theo song song, boosting học theo tuần tự
Bagging tạo các bộ học một cách song song và độc lập với nhau từ dữ liệu huấn luyện được tạo bằng lấy mẫu bootstrap, rồi lấy biểu quyết đa số hoặc trung bình. Boosting cộng dồn các bộ học theo tuần tự trong khi coi trọng các ví dụ mà bộ học trước đó đã sai, nên phụ thuộc vào thứ tự và không thể tạo song song. Việc đổi chỗ song song và tuần tự là lỗi phổ biến nhất. Cả hai đều là học có giám sát dùng dữ liệu giám sát, và loại bộ học yếu có thể dùng cũng không giới hạn ở cây quyết định hay hồi quy tuyến tính.
Câu 7 | Rừng ngẫu nhiên
Đâu là cách học phù hợp của rừng ngẫu nhiên (random forest)?
Nuôi một cây quyết định duy nhất càng sâu càng tốt, rồi cuối cùng làm đều số nhánh
Cộng dồn từng cây quyết định một, coi trọng những ví dụ mà cây trước đó đã sai
Học song song nhiều cây quyết định được tạo bằng lấy mẫu bootstrap
Không dùng cây quyết định, lấy trung bình dự đoán của nhiều hồi quy tuyến tính để ra kết quả
Đáp ánC. Học song song nhiều cây quyết định được tạo bằng lấy mẫu bootstrap
Rừng ngẫu nhiên là ví dụ tiêu biểu của bagging: tạo dữ liệu huấn luyện hơi khác nhau bằng lấy mẫu bootstrap (lấy mẫu cho phép trùng lặp), rồi nuôi song song và độc lập nhiều cây quyết định từ đó, lấy biểu quyết đa số hoặc trung bình. Việc cộng dồn từng cây một trong khi coi trọng sai số của cây trước là mô tả của phía boosting như gradient boosting, và việc đổi chỗ ở đây là lỗi điển hình. Số cây không phải một mà là số lượng lớn, và thứ được gộp lại là cây quyết định chứ không phải hồi quy tuyến tính.
Câu 8 | Điểm yếu của cây quyết định
Đâu là mô tả phù hợp về tính chất của cây quyết định?
Càng làm phân nhánh sâu, độ khớp với dữ liệu huấn luyện chắc chắn càng tệ đi
Vì không cần dữ liệu giám sát nên không dùng được cho cả phân loại lẫn hồi quy
Điều kiện phân nhánh con người không đọc được, nhưng khó xảy ra quá khớp (overfitting)
Con người có thể đọc được điều kiện phân nhánh, nhưng bản thân nó dễ quá khớp
Đáp ánD. Con người có thể đọc được điều kiện phân nhánh, nhưng bản thân nó dễ quá khớp
Cây quyết định là phương pháp sắp xếp các phân nhánh điều kiện theo đặc trưng dưới dạng cây, điểm mạnh là con người có thể đọc được đã đi theo hướng nào ở điều kiện nào. Mặt khác, càng nuôi cây sâu thì càng ghi nhớ cả những đặc điểm chi tiết vụn vặt của dữ liệu huấn luyện, nên bản thân nó dễ quá khớp. Càng làm sâu thì độ khớp với dữ liệu huấn luyện thực ra càng tốt hơn, và vấn đề nằm ở chỗ vẫn giảm sút với dữ liệu mới, nên mô tả rằng độ khớp chắc chắn tệ đi là sai. Cây quyết định là học có giám sát, dùng được cho cả phân loại lẫn hồi quy.
Câu 9 | AR và VAR
Đâu là mối quan hệ giữa mô hình tự hồi quy (mô hình AR) và mô hình tự hồi quy vectơ (mô hình VAR)?
AR trích xuất đặc trưng cục bộ của ảnh, VAR trích xuất thành phần tần số của âm thanh
AR xử lý đồng thời nhiều chuỗi thời gian, VAR chỉ giải thích 1 chuỗi thời gian bằng giá trị quá khứ
AR không cần dữ liệu giám sát, VAR là phương pháp cần dữ liệu giám sát
AR giải thích 1 chuỗi thời gian bằng giá trị quá khứ của chính nó, VAR giải thích nhiều chuỗi thời gian bằng giá trị quá khứ lẫn nhau
Đáp ánD. AR giải thích 1 chuỗi thời gian bằng giá trị quá khứ của chính nó, VAR giải thích nhiều chuỗi thời gian bằng giá trị quá khứ lẫn nhau
Mô hình AR giải thích giá trị hiện tại của một chuỗi thời gian duy nhất bằng giá trị quá khứ của chính chuỗi đó. Mô hình VAR mở rộng điều này cho nhiều chuỗi thời gian, dưới dạng giải thích lẫn nhau bằng giá trị quá khứ của nhau. Vì khác nhau ở việc một chuỗi hay nhiều chuỗi, nên mô tả đổi chỗ hai cái này là sai. Cả hai đều là mô hình xử lý chuỗi thời gian, không phải công cụ trích xuất đặc trưng cục bộ của ảnh hay thành phần tần số của âm thanh. Đây cũng không phải sự phân biệt theo có cần dữ liệu giám sát hay không.
Câu 10 | Phân loại đa lớp
Trong các mục sau, đâu là ví dụ của phân loại đa lớp?
Gán ảnh chữ số viết tay vào một trong các số từ 0 đến 9
Chọn lại nước đi tiếp theo dựa trên phần thưởng, từ trạng thái bàn cờ
Tìm cụm những khách hàng giống nhau từ lịch sử mua hàng của khách hàng
Dự đoán giá trị nhiệt độ cao nhất ngày mai từ nhiệt độ và độ ẩm
Đáp ánA. Gán ảnh chữ số viết tay vào một trong các số từ 0 đến 9
Phân loại đa lớp là bài toán phân loại đoán xem thuộc lớp nào trong số 3 lớp trở lên, ví dụ điển hình là bài toán gán chữ số viết tay vào một trong các số từ 0 đến 9. Đoán giá trị liên tục như nhiệt độ cao nhất là bài toán hồi quy, không phải phân loại. Tìm cụm khách hàng giống nhau là phân cụm thuộc học không giám sát, chọn lại nước đi dựa trên phần thưởng là học tăng cường — cả hai đều không phải bài toán phân loại của học có giám sát ngay từ đầu.
Câu 11 | Đầu vào của học không giám sát
Đâu là mô tả phù hợp về học không giám sát?
Chỉ cung cấp đặc trưng, tìm cấu trúc hoặc quy luật mà bản thân dữ liệu có
Cung cấp cặp đặc trưng và dữ liệu giám sát, thu nhỏ chênh lệch với đáp án
Chỉ dùng một lượng nhỏ dữ liệu có đáp án, bỏ phần còn lại rồi tiến hành học
Lấy phần thưởng nhận được từ môi trường làm manh mối để cải thiện cách chọn hành động
Đáp ánA. Chỉ cung cấp đặc trưng, tìm cấu trúc hoặc quy luật mà bản thân dữ liệu có
Đề cương nêu mục tiêu "hiểu rằng học không giám sát chỉ cần đặc trưng". Học không giám sát là việc tìm cấu trúc của chính dữ liệu bằng phân cụm hoặc giảm chiều, mà không có nhãn đáp án. Lấy tiền đề là cặp đặc trưng và dữ liệu giám sát là học có giám sát, lấy phần thưởng làm manh mối là học tăng cường — mỗi cái được đặt ở mục khác nhau. Thủ tục bỏ phần dữ liệu còn lại cũng không phải mô tả của học không giám sát.
Câu 12 | Phương pháp k-means
Đâu là cách tiến hành phù hợp của phương pháp k-means?
Quyết định trước số cụm, lặp lại việc cập nhật trọng tâm và gán điểm
Cung cấp nhãn đáp án, tối đa hóa biên của ranh giới
Không quyết định số cụm, lặp lại việc gộp lần lượt từ những cái gần nhau
Ước lượng tỷ lệ chủ đề tiềm ẩn trong văn bản, từ cách xuất hiện của từ
Đáp ánA. Quyết định trước số cụm, lặp lại việc cập nhật trọng tâm và gán điểm
Phương pháp k-means là phân cụm không phân cấp, quyết định trước số cụm k, rồi lặp lại thao tác gán mỗi điểm vào trọng tâm gần nhất và tính lại trọng tâm. Việc không quyết định số cụm mà gộp lần lượt từ những cái gần nhau là phân cụm phân cấp như phương pháp Ward, loại này có thể vẽ được biểu đồ cây (dendrogram). Tối đa hóa biên là SVM thuộc học có giám sát, ước lượng chủ đề từ cách xuất hiện của từ là mô hình chủ đề như phân bổ Dirichlet tiềm ẩn (LDA).
Câu 13 | Phương pháp Ward
Đâu là mối quan hệ giữa phương pháp Ward và biểu đồ cây (dendrogram)?
Là phương pháp giảm chiều, vẽ 2 trục sau khi giảm dưới dạng biểu đồ cây
Là phương pháp phân cụm phân cấp, có thể vẽ quá trình gộp dưới dạng biểu đồ cây
Là phương pháp học có giám sát, vẽ ranh giới phân loại dưới dạng biểu đồ cây
Là phương pháp phân cụm không phân cấp, về nguyên lý không thể vẽ biểu đồ cây
Đáp ánB. Là phương pháp phân cụm phân cấp, có thể vẽ quá trình gộp dưới dạng biểu đồ cây
Phương pháp Ward là phân cụm phân cấp, gộp lần lượt từ những cái gần nhau, và có thể vẽ quá trình gộp đó dưới dạng biểu đồ cây (dendrogram). Lợi ích là có thể quyết định số cụm sau đó, tùy theo cắt ở độ cao nào. Loại không phân cấp, quyết định trước số cụm là phương pháp k-means, loại này không tạo biểu đồ cây. Phương pháp Ward không phải phương pháp giảm chiều cũng không phải phương pháp học có giám sát, và không dùng nhãn đáp án.
Câu 14 | PCA và t-SNE
Đâu là sự khác biệt phù hợp giữa phân tích thành phần chính (PCA) và t-SNE?
PCA là giảm chiều tuyến tính, t-SNE là phi tuyến và phù hợp cho trực quan hóa
PCA cần dữ liệu giám sát, t-SNE là phương pháp chỉ hoạt động bằng đặc trưng
PCA là giảm chiều phi tuyến, t-SNE là tuyến tính và phù hợp cho trực quan hóa
PCA ước lượng chủ đề của văn bản, t-SNE là phương pháp phân rã ma trận
Đáp ánA. PCA là giảm chiều tuyến tính, t-SNE là phi tuyến và phù hợp cho trực quan hóa
PCA là giảm chiều tuyến tính, lấy lại trục theo hướng phương sai lớn nhất; t-SNE là phương pháp phi tuyến, ánh xạ xuống chiều thấp sao cho giữ nguyên độ gần của các điểm gần nhau, thường được dùng để trực quan hóa ở 2 hoặc 3 chiều. Mô tả đổi chỗ tuyến tính và phi tuyến ở đây là lỗi điển hình. Ước lượng chủ đề văn bản là mô hình chủ đề như phân bổ Dirichlet tiềm ẩn (LDA), phân rã ma trận là phân rã giá trị kỳ dị (SVD). Cả PCA lẫn t-SNE đều là học không giám sát nên không cần dữ liệu giám sát.
Câu 15 | Cold start
Đâu là vấn đề cold start trong lọc cộng tác (collaborative filtering)?
Việc sản phẩm được đề xuất đã hết hàng nên không thể giao cho người dùng
Việc đề xuất bị thiên lệch nếu chỉ dựa vào mô tả sản phẩm làm manh mối
Việc tính toán đề xuất không kết thúc được đối với người dùng có quá nhiều lịch sử
Việc không thể đưa ra đề xuất tốt cho người dùng hoặc sản phẩm chưa có lịch sử
Đáp ánD. Việc không thể đưa ra đề xuất tốt cho người dùng hoặc sản phẩm chưa có lịch sử
Lọc cộng tác đề xuất dựa trên manh mối là sự giống nhau trong đánh giá giữa những người dùng, hoặc giữa các sản phẩm, nên với người dùng mới hoặc sản phẩm mới chưa có lịch sử đánh giá thì không lấy được manh mối, khó đưa ra đề xuất. Đây chính là vấn đề cold start. Lọc dựa trên nội dung (content-based filtering), vốn lấy manh mối từ chính mô tả hoặc thuộc tính sản phẩm, được nói đến như hướng bù đắp cho điểm yếu này. Đây không phải chuyện về thời gian tính toán hay tồn kho.
Câu 16 | Tín hiệu của học tăng cường
Đâu là thứ mà học tăng cường (reinforcement learning) dùng làm manh mối để học?
Tín hiệu phần thưởng nhận được từ môi trường
Số lần xuất hiện của từ trong văn bản
Nhãn đáp án do con người đưa ra cho từng trường hợp một
Chỉ độ gần của khoảng cách giữa các đặc trưng
Đáp ánA. Tín hiệu phần thưởng nhận được từ môi trường
Học tăng cường tương tác thử và sai với môi trường, học chính sách sao cho tổng phần thưởng nhận được trở nên lớn. Manh mối không phải nhãn đáp án cho từng nước đi mà là phần thưởng, nên đây không phải một dạng của học có giám sát. Chỉ lấy độ gần khoảng cách làm manh mối là ý tưởng của phân cụm thuộc học không giám sát, số lần xuất hiện của từ là chuyện về biểu diễn đặc trưng trong xử lý ngôn ngữ tự nhiên — đều không phải tín hiệu học của học tăng cường. Việc dùng tỷ lệ chiết khấu để đánh giá tương lai, phòng khi phần thưởng không trả về ngay, cũng là đặc điểm của khung này.
Câu 17 | Giá trị và chính sách
Đâu là mô tả phù hợp về hai cách tiếp cận tiêu biểu của học tăng cường?
Chỉ có cách học hàm giá trị, chính sách được quyết định duy nhất từ hàm giá trị
Có cách học hàm giá trị và cách học trực tiếp chính sách, Actor-Critic có cả hai
Chỉ có cách học trực tiếp chính sách, hàm giá trị không thể dùng trong quá trình học
Cả hàm giá trị lẫn chính sách đều do con người thiết kế bằng tay, không phải đối tượng để học
Đáp ánB. Có cách học hàm giá trị và cách học trực tiếp chính sách, Actor-Critic có cả hai
Đề cương nêu mục tiêu "hiểu hai cách tiếp cận tiêu biểu là học hàm giá trị và học chính sách". Ước lượng hàm giá trị trạng thái hoặc hàm giá trị hành động rồi mới chọn hành động là cách trước, tiêu biểu là Q-learning và SARSA. Biểu diễn trực tiếp chính sách bằng tham số rồi cập nhật trực tiếp là cách sau, tiêu biểu là phương pháp gradient chính sách và REINFORCE. Actor-Critic kết hợp Actor đảm nhận chính sách và Critic đảm nhận giá trị, có cả hai. Mô tả chỉ có một trong hai, hoặc mô tả rằng không phải đối tượng để học, đều là sai.
Câu 18 | Q-learning và SARSA
Đâu là sự khác biệt phù hợp giữa Q-learning và SARSA?
Q-learning dùng giá trị của hành động thực sự đã chọn, SARSA dùng giá trị hành động lớn nhất ở trạng thái tiếp theo
Q-learning cần dữ liệu giám sát, SARSA cập nhật mà không cần dữ liệu giám sát
Q-learning không dùng hàm giá trị hành động, chỉ SARSA cập nhật hàm giá trị hành động
Q-learning dùng giá trị hành động lớn nhất ở trạng thái tiếp theo, SARSA dùng giá trị của hành động thực sự đã chọn
Đáp ánD. Q-learning dùng giá trị hành động lớn nhất ở trạng thái tiếp theo, SARSA dùng giá trị của hành động thực sự đã chọn
Cả hai đều là phương pháp học tăng cường cập nhật hàm giá trị hành động, khác nhau ở việc dùng gì để cập nhật. Q-learning dùng giá trị lớn nhất trong số các hành động có thể có ở trạng thái tiếp theo, còn SARSA cập nhật bằng giá trị của hành động tiếp theo thực sự đã chọn. Mô tả đổi chỗ hai cái này là lỗi điển hình. Q-learning cũng cập nhật hàm giá trị hành động, nên mô tả chỉ một bên dùng là sai. Học tăng cường ở cả hai đều là khung học bằng phần thưởng, nên mô tả cần dữ liệu giám sát cũng sai.
Câu 19 | ε-greedy
Trong bài toán bandit có 4 cánh tay, dùng chính sách ε-greedy: với xác suất ε chọn ngẫu nhiên đều 1 trong 4 cánh tay, với xác suất 1-ε chọn cánh tay có giá trị ước lượng lớn nhất. Khi ε bằng 0.1, xác suất mà kết quả của một lần chọn là cánh tay có giá trị ước lượng lớn nhất được chọn là bao nhiêu?
0.900
0.100
0.250
0.925
Đáp ánD. 0.925
Cánh tay có giá trị ước lượng lớn nhất được chọn trong hai trường hợp: khi chọn theo cách tham lam (greedy), và khi chọn ngẫu nhiên mà tình cờ trúng đúng cánh tay đó. Trường hợp trước là 1 trừ 0.1 bằng 0.900, trường hợp sau là 0.1 chia cho 4 bằng 0.025, cộng lại được 0.925. 0.900 là giá trị bỏ sót phần trúng khi chọn ngẫu nhiên, 0.250 là xác suất khi chọn đều 1 trong 4 cánh tay, 0.100 là chính ε. Càng tăng ε thì việc khám phá càng tăng, và xác suất này càng giảm.
Câu 20 | Tính tỷ lệ chiết khấu
Từ một thời điểm, sau 1 bước nhận phần thưởng 4, sau 2 bước nhận phần thưởng 12, sau 3 bước nhận phần thưởng 8. Nhân phần thưởng sau 1 bước với 0.5, phần thưởng sau 2 bước với bình phương của 0.5, phần thưởng sau 3 bước với lập phương của 0.5, rồi cộng lại — giá trị đó là bao nhiêu?
24.0
6.0
7.5
12.0
Đáp ánB. 6.0
4 nhân 0.5 bằng 2, 12 nhân bình phương của 0.5 tức 0.25 bằng 3, 8 nhân lập phương của 0.5 tức 0.125 bằng 1, tổng lại là 6.0. 24.0 là giá trị cộng thẳng 4, 12, 8 mà không nhân chiết khấu nào; 12.0 là giá trị của 24 đó nhân thêm 1 lần 0.5; 7.5 là giá trị nhân ngược thứ tự — 4 với 0.125, 12 với 0.25, 8 với 0.5 — đều là những nhầm lẫn thường gặp. Vì vai trò của tỷ lệ chiết khấu là đánh giá phần thưởng càng xa trong tương lai càng nhỏ, nên phần gần hơn được gán trọng số lớn hơn.
Câu 21 | Tính độ chính xác
Kết quả dự đoán của một mô hình là: 40 trường hợp dương thật, 10 trường hợp dương giả, 20 trường hợp âm giả, 130 trường hợp âm thật. Độ chính xác (precision) là bao nhiêu?
0.85
0.80
0.73
0.67
Đáp ánB. 0.80
Độ chính xác lấy mẫu số là những trường hợp được dự đoán là dương, nên lấy 40 dương thật chia cho tổng 40 dương thật và 10 dương giả tức 50, được 0.80. 0.67 là độ nhạy (recall) lấy mẫu số là những trường hợp thực sự dương, tức 40 chia cho tổng 40 dương thật và 20 âm giả tức 60. 0.85 là tỷ lệ chính xác tổng thể (accuracy), tức 170 trường hợp đúng trong tổng 200 trường hợp; 0.73 là F-score, trung bình điều hòa của độ chính xác 0.80 và độ nhạy 0.67 — tất cả đều là chỉ số khác bị tính nhầm.
Câu 22 | Sự khác biệt về mẫu số
Đâu là sự khác biệt phù hợp về mẫu số giữa độ chính xác (precision) và độ nhạy (recall)?
Độ chính xác lấy mẫu số là số trường hợp thực sự dương, độ nhạy lấy mẫu số là số trường hợp được dự đoán là dương
Độ chính xác chỉ lấy mẫu số là số âm thật, độ nhạy chỉ lấy mẫu số là số âm giả
Cả độ chính xác lẫn độ nhạy đều lấy thẳng tổng số toàn bộ dữ liệu làm mẫu số
Độ chính xác lấy mẫu số là số trường hợp được dự đoán là dương, độ nhạy lấy mẫu số là số trường hợp thực sự dương
Đáp ánD. Độ chính xác lấy mẫu số là số trường hợp được dự đoán là dương, độ nhạy lấy mẫu số là số trường hợp thực sự dương
Độ chính xác là "trong số những trường hợp được dự đoán là dương, tỷ lệ thực sự dương", nên mẫu số nằm ở phía dự đoán. Độ nhạy là "trong số những trường hợp thực sự dương, tỷ lệ đã bắt được", nên mẫu số nằm ở phía thực tế. Lỗi đổi chỗ hai cái này là phổ biến nhất, nên nên ghi nhớ theo hướng mẫu số là dự đoán hay thực tế. Lấy toàn bộ dữ liệu làm mẫu số là tỷ lệ chính xác tổng thể (accuracy); chỉ lấy âm thật hoặc âm giả làm mẫu số không phải là một trong hai chỉ số này. Khi muốn giảm nhận diện sai thì coi trọng độ chính xác, khi muốn giảm bỏ sót thì coi trọng độ nhạy.
Câu 23 | Tính F-score
Khi độ chính xác là 0.6, độ nhạy là 0.9, F-score là bao nhiêu?
1.50
0.54
0.75
0.72
Đáp ánD. 0.72
F-score là trung bình điều hòa của độ chính xác và độ nhạy, nên lấy 2 nhân với tích của 0.6 và 0.9 tức 0.54, được 1.08, rồi chia cho tổng của 0.6 và 0.9 tức 1.5, được 0.72. 0.75 là giá trị tính nhầm thành trung bình cộng thay vì trung bình điều hòa; 0.54 chỉ là giá trị nhân hai số lại; 1.50 chỉ là giá trị cộng hai số lại. Cũng cần xác nhận rằng trung bình điều hòa bị kéo về phía số nhỏ hơn, nên nhỏ hơn trung bình cộng là 0.75.
Câu 24 | Dữ liệu mất cân bằng
Với dữ liệu mà dương chỉ chiếm 1% toàn bộ, đã tạo một mô hình dự đoán tất cả đều là âm. Đâu là mô tả phù hợp về tình huống này?
Tỷ lệ chính xác tổng thể là 50%, cho thấy hiệu năng ngang với đoán mò
Tỷ lệ chính xác tổng thể cao ở mức 99%, nhưng độ nhạy là 0%, không bắt được trường hợp dương nào
Tỷ lệ chính xác tổng thể thấp ở mức 1%, độ nhạy cũng 0%, vấn đề thể hiện rõ ở cả hai chỉ số
Tỷ lệ chính xác tổng thể cao ở mức 99%, độ nhạy cũng cao ở mức 99%, nên có thể nói là đủ dùng thực tế
Đáp ánB. Tỷ lệ chính xác tổng thể cao ở mức 99%, nhưng độ nhạy là 0%, không bắt được trường hợp dương nào
Vì dương chỉ chiếm 1%, nên chỉ cần trả lời toàn bộ là âm thì đã đúng 99%, tỷ lệ chính xác tổng thể là 99%. Tuy nhiên vì không bắt được trường hợp dương thực sự nào nên độ nhạy là 0%, mô hình này không có giá trị sử dụng. Khi số lượng các lớp không cân bằng, nếu chỉ nhìn tỷ lệ chính xác tổng thể sẽ đánh giá sai, nên cần xem cả độ nhạy, F-score, đường cong ROC và AUC. Với thiết lập này, tỷ lệ chính xác tổng thể không thể là 1% hay 50%.
Câu 25 | Trục của đường cong ROC
Đâu là tổ hợp phù hợp về trục tung và trục hoành của đường cong ROC?
Trục tung là độ lớn sai số, trục hoành là số lần đã lặp lại việc học
Trục tung là tỷ lệ chính xác tổng thể, trục hoành là số lượng dữ liệu dùng để học
Trục tung là tỷ lệ dương thật, trục hoành là tỷ lệ dương giả, diện tích bên dưới là AUC
Trục tung là độ chính xác, trục hoành là độ nhạy, diện tích bên dưới là AUC
Đáp ánC. Trục tung là tỷ lệ dương thật, trục hoành là tỷ lệ dương giả, diện tích bên dưới là AUC
Đường cong ROC là đường cong được vẽ trong khi thay đổi ngưỡng phán định, với trục tung là tỷ lệ dương thật và trục hoành là tỷ lệ dương giả, và diện tích bên dưới nó là AUC. AUC càng gần 1 càng tốt, còn 0.5 nghĩa là ngang mức phán định ngẫu nhiên. Nếu đặt trục tung là độ chính xác và trục hoành là độ nhạy thì sẽ thành một đường cong khác, đây là điểm nhầm lẫn điển hình. Tổ hợp tỷ lệ chính xác tổng thể với số lượng dữ liệu, hay sai số với số lần lặp, là đồ thị khác dùng để xem quá trình học.
Câu 26 | AIC và BIC
Đâu là cách dùng của tiêu chuẩn thông tin Akaike (AIC) và tiêu chuẩn thông tin Bayes (BIC)?
Xem sự cân bằng giữa độ khớp và số tham số, chọn mô hình có giá trị lớn
Chỉ xem số tham số, chọn mô hình có nhiều tham số nhất
Chỉ xem độ khớp với dữ liệu huấn luyện, chọn mô hình có sai số nhỏ nhất
Xem sự cân bằng giữa độ khớp và số tham số, chọn mô hình có giá trị nhỏ
Đáp ánD. Xem sự cân bằng giữa độ khớp và số tham số, chọn mô hình có giá trị nhỏ
Cả AIC lẫn BIC đều là chỉ số cộng độ khớp với dữ liệu và một khoản phạt cho việc tăng tham số, giá trị càng nhỏ thì coi là mô hình càng tốt. Cho rằng càng lớn càng tốt là sai, và đây là điểm hay bị nhắm tới nhất. Nếu chỉ chọn theo độ khớp với dữ liệu huấn luyện thì sẽ toàn chọn mô hình nhiều tham số và dẫn tới quá khớp, nên đặt khoản phạt để cân bằng lại. Đây cùng hướng với cách nghĩ của dao cạo Occam — không phức tạp hóa hơn mức cần thiết.
Câu 27 | Số lần của kiểm định 5 phần
Khi đưa 200 dữ liệu vào kiểm định chéo chia 5 phần, đâu là tổ hợp phù hợp về số lượng dữ liệu kiểm định mỗi lần và số lần lặp lại học và đánh giá?
Kiểm định 160 trường hợp, lặp lại học và đánh giá 5 lần
Kiểm định 40 trường hợp, lặp lại học và đánh giá 5 lần
Kiểm định 40 trường hợp, chỉ thực hiện học và đánh giá 1 lần
Kiểm định 100 trường hợp, lặp lại học và đánh giá 2 lần
Đáp ánB. Kiểm định 40 trường hợp, lặp lại học và đánh giá 5 lần
Kiểm định chéo k-phần chia dữ liệu thành k phần, dùng 1 phần để kiểm định và phần còn lại để học, lặp lại thủ tục này k lần rồi lấy trung bình kết quả. Chia 200 trường hợp thành 5 phần thì mỗi cụm có 40 trường hợp, nên mỗi lần kiểm định dùng 40 trường hợp, học dùng 160 trường hợp còn lại, và lặp lại 5 lần. Chỉ chia và kết thúc 1 lần là kiểm định holdout, tính toán nhẹ nhưng dễ bị ảnh hưởng bởi cách chia. Dùng 160 trường hợp cho kiểm định là cách đếm nhầm lẫn giữa học và kiểm định.
Câu 28 | Tính RMSE
Đối với 4 dự đoán, sai số lấy giá trị thực đo trừ giá trị dự đoán lần lượt là 2, 4, -4, 0. Sai số bình phương trung bình gốc (RMSE) là bao nhiêu?
6.0
9.0
2.5
3.0
Đáp ánD. 3.0
Bình phương của các sai số là 4, 16, 16, 0, tổng lại là 36. Chia cho số lượng 4 thì được 9, đây là sai số bình phương trung bình (MSE), và căn bậc hai của nó là 3.0 chính là RMSE. 9.0 là giá trị trả lời nhầm ngay ở MSE; 2.5 là sai số tuyệt đối trung bình (MAE), tức trung bình của các giá trị tuyệt đối sai số 2, 4, 4, 0; 6.0 là giá trị quên chia cho số lượng và lấy căn bậc hai của tổng bình phương 36. RMSE dễ đọc vì cùng đơn vị với sai số gốc.
Câu 29 | Trung bình và trung vị
Khi 7 dữ liệu là 2, 4, 4, 6, 8, 10, 50, đâu là tổ hợp phù hợp của trung bình, trung vị, mốt (giá trị xuất hiện nhiều nhất)?
Trung bình 12, trung vị 4, mốt 6
Trung bình 12, trung vị 6, mốt 4
Trung bình 6, trung vị 12, mốt 4
Trung bình 6, trung vị 4, mốt 10
Đáp ánB. Trung bình 12, trung vị 6, mốt 4
Tổng 84 chia cho số lượng 7 được trung bình là 12; khi sắp theo thứ tự tăng dần thì giá trị thứ 4 là 6 nên trung vị là 6; số 4 xuất hiện 2 lần nên là mốt. Điểm mấu chốt là chỉ riêng trung bình bị kéo mạnh bởi giá trị ngoại lai 50, trong khi trung vị và mốt hầu như không đổi — đây là ví dụ cho thấy không nên phán đoán chỉ dựa vào một giá trị đại diện. Giá trị đổi chỗ trung bình và trung vị, hay nhầm lẫn giữa trung vị và mốt, là những lỗi thường gặp.
Câu 30 | Tương quan giả
Đâu là mô tả phù hợp về tương quan giả (spurious correlation)?
Nếu hệ số tương quan bằng 0 thì có thể khẳng định chắc chắn hai bên không có quan hệ gì
Quy tắc bắt buộc phải loại bỏ giá trị ngoại lai khi tính hệ số tương quan
Hiện tượng tương quan xuất hiện giữa hai thứ không có quan hệ nhân quả, do có yếu tố chung
Nếu hệ số tương quan dương thì chắc chắn một bên là nguyên nhân của bên kia
Đáp ánC. Hiện tượng tương quan xuất hiện giữa hai thứ không có quan hệ nhân quả, do có yếu tố chung
Tương quan giả là hiện tượng tương quan xuất hiện giữa hai thứ không có quan hệ nhân quả trực tiếp, ví dụ doanh số kem và số vụ tai nạn đuối nước cùng biến động vì có yếu tố chung là nhiệt độ. Bài học ở đây là có tương quan không có nghĩa là có nhân quả, nên không thể nói hệ số tương quan dương thì đó là nguyên nhân và kết quả. Ngoài ra, dù hệ số tương quan bằng 0 vẫn có thể ẩn chứa quan hệ không tuyến tính, nên không thể khẳng định chắc chắn là không có quan hệ. Cách xử lý giá trị ngoại lai là một vấn đề khác.
Luyện tập: giải các câu hỏi trên trang này
Đây là công cụ luyện tập với câu hỏi ngẫu nhiên (hoạt động khi JavaScript được bật). Bạn vẫn có thể đọc toàn bộ câu hỏi và phần giải thích ở trên.
* Lời giải là thông tin phục vụ việc học. Phạm vi ra đề và chế độ thi có thể thay đổi theo từng năm, vì vậy hãy luôn kiểm tra thông báo chính thức của đơn vị tổ chức thi.
Trang này là bản dịch từ nguyên bản tiếng Nhật. Nếu nội dung bản dịch và nguyên bản khác nhau, bản tiếng Nhật sẽ được ưu tiên. Xem nguyên bản tiếng Nhật