Đâu là mô tả đúng về perceptron đơn giản (simple perceptron)?
Chỉ gồm lớp đầu vào và lớp đầu ra, chỉ giải được bài toán phân tách tuyến tính
Giỏi trượt bộ lọc trên ảnh để trích xuất đặc trưng cục bộ
Có đường nối đưa trạng thái quay lại theo chiều thời gian, xử lý được dữ liệu chuỗi theo đúng thứ tự
Có nhiều lớp ẩn, có thể phân tách phi tuyến nên biểu diễn được cả phép XOR
Đáp ánA. Chỉ gồm lớp đầu vào và lớp đầu ra, chỉ giải được bài toán phân tách tuyến tính
Perceptron đơn giản là mạng nơ-ron đơn giản nhất chỉ gồm lớp đầu vào và lớp đầu ra, chỉ giải được bài toán phân tách tuyến tính — tách được bằng một đường thẳng duy nhất. Phép XOR (hoặc loại trừ) có các điểm cho ra 1 và cho ra 0 xen kẽ nhau trên đường chéo, nên dù vẽ đường thẳng ở đâu cũng không tách được, do đó không biểu diễn được bằng perceptron đơn giản. Perceptron nhiều lớp — thêm lớp ẩn để có thể uốn cong ranh giới — thì biểu diễn được cả XOR, và phương án đầu tiên chính là mô tả của perceptron nhiều lớp đó. Việc đưa trạng thái thời điểm trước quay lại để xử lý chuỗi là mạng nơ-ron hồi quy (RNN), còn việc trượt bộ lọc để trích xuất đặc trưng cục bộ là mô tả của lớp tích chập.
Câu 2 | Sự phù hợp của GPU
Đâu là lý do phù hợp nhất giải thích tại sao GPU được cho là phù hợp với việc học của học sâu?
Vì dung lượng bộ nhớ để lưu dữ liệu dùng cho việc học lớn hơn CPU rất nhiều
Vì đã tích hợp sẵn từ đầu dưới dạng mạch chuyên dụng cho quy tắc chuỗi dùng trong lan truyền ngược
Vì có thể xử lý tuần tự với tốc độ cao các xử lý phức tạp nhiều nhánh rẽ, bằng một số ít nhân mạnh
Vì có số lượng lớn các nhân tính toán nhỏ, có thể xử lý cùng một phép tính song song đồng loạt
Đáp ánD. Vì có số lượng lớn các nhân tính toán nhỏ, có thể xử lý cùng một phép tính song song đồng loạt
Việc học của học sâu là phép tính lặp lại vô số lần các phép nhân và cộng ma trận với vector. GPU có số lượng lớn các nhân nhỏ thực hiện phép tính đơn giản, phù hợp để chạy cùng một phép tính song song đồng loạt, nên hợp với dạng phép tính này. Việc xử lý tuần tự với tốc độ cao các xử lý nhiều nhánh rẽ bằng một số ít nhân mạnh là sở trường của CPU, số lượng nhân của CPU không nhiều. Lợi thế của GPU không phải là dung lượng bộ nhớ mà là mức độ song song. Không có việc GPU tích hợp sẵn quy tắc chuỗi như mạch chuyên dụng, và thứ được thiết kế nhắm riêng cho phép tính tensor của học sâu là TPU.
Câu 3 | Nguyên nhân biến mất gradient
Tại sao dùng hàm sigmoid ở lớp ẩn dễ gây ra vấn đề biến mất gradient (vanishing gradient)?
Vì đầu ra nằm trong khoảng từ 0 đến 1, nên khi xếp chồng nhiều lớp thì chính đầu ra tiến gần về 0
Vì tổng đầu ra được chuẩn hóa để bằng 1, nên giá trị nhỏ dần theo từng lớp
Vì giá trị lớn nhất của đạo hàm là 0.25, và bị nhân dồn lại mỗi khi lùi qua một lớp
Vì đầu ra luôn bằng 0 với đầu vào âm, khiến đơn vị (unit) đó ngừng học
Đáp ánC. Vì giá trị lớn nhất của đạo hàm là 0.25, và bị nhân dồn lại mỗi khi lùi qua một lớp
Vấn đề biến mất gradient là hiện tượng gradient tiến gần về 0 trong quá trình lan truyền ngược, khiến các lớp phía đầu vào không được học. Hàm sigmoid có giá trị lớn nhất của đạo hàm chỉ là 0.25, nên mỗi khi lùi qua một lớp thì lại nhân thêm một số không quá 0.25, và với mạng sâu thì gradient gần như không còn lại gì. Vấn đề nằm ở độ lớn của đạo hàm, không phải bản thân giá trị đầu ra. Việc gradient bằng 0 với đầu vào âm khiến việc học dừng lại là điểm yếu của hàm ReLU, và hàm Leaky ReLU chính là cách đối phó với điểm này. Việc chuẩn hóa để tổng đầu ra bằng 1 là hàm softmax.
Câu 4 | Hàm ReLU
Đâu là mô tả phù hợp về hàm ReLU?
Là hàm ép đầu vào vào khoảng từ 0 đến 1, vẽ ra đường cong hình chữ S
Là hàm chuẩn hóa gộp tất cả đầu ra để tổng đầu ra bằng 1
Là hàm ép đầu vào vào khoảng từ -1 đến 1, có hình dạng đối xứng qua gốc tọa độ
Là hàm trả về nguyên giá trị đầu vào nếu dương, trả về 0 nếu âm
Đáp ánD. Là hàm trả về nguyên giá trị đầu vào nếu dương, trả về 0 nếu âm
Hàm ReLU là hàm đơn giản trả về nguyên giá trị nếu đầu vào dương, trả về 0 nếu âm. Ở miền dương thì đạo hàm luôn bằng 1, nên dù lùi qua nhiều lớp gradient cũng không nhỏ đi, giúp giảm mạnh vấn đề biến mất gradient. Tuy nhiên ở miền âm thì đạo hàm bằng 0, nên có trường hợp đơn vị (unit) một khi rơi vào phía âm sẽ ngừng học, và hàm Leaky ReLU — cho phía âm một độ dốc nhỏ — được chuẩn bị để xử lý điều này. Hình chữ S ép vào khoảng 0 đến 1 là hàm sigmoid, đối xứng qua gốc tọa độ trong khoảng -1 đến 1 là hàm tanh, chuẩn hóa để tổng đầu ra bằng 1 là mô tả của hàm softmax.
Câu 5 | Leaky ReLU
Hàm Leaky ReLU được chuẩn bị để đối phó với điểm nào của hàm ReLU?
Việc tổng đầu ra không bằng 1, nên không thể diễn giải như xác suất
Việc gradient bằng 0 với đầu vào âm, khiến đơn vị đó ngừng học
Việc phép tính chứa hàm mũ, khiến mỗi lần xử lý trở nên nặng
Việc gradient vẫn giữ nguyên bằng 1 với đầu vào dương, khiến lượng cập nhật trở nên quá lớn
Đáp ánB. Việc gradient bằng 0 với đầu vào âm, khiến đơn vị đó ngừng học
Hàm ReLU cho cả đầu ra lẫn đạo hàm bằng 0 ở miền âm, nên nếu đầu vào của một đơn vị luôn âm thì gradient không chảy qua được, và đơn vị đó sẽ không bao giờ được học nữa. Hàm Leaky ReLU tránh ngõ cụt này bằng cách cho cả phía âm một độ dốc nhỏ. Việc gradient bằng 1 ở miền dương là ưu điểm chứ không phải nhược điểm của hàm ReLU — chính tính chất này ngăn được biến mất gradient. Việc tổng đầu ra không bằng 1 là điều đương nhiên đối với hàm kích hoạt, và với lớp đầu ra muốn đọc như xác suất thì dùng hàm softmax. Phép tính chứa hàm mũ là hàm sigmoid hay hàm tanh, còn hàm ReLU ngược lại tính toán nhẹ.
Câu 6 | Softmax
Đâu là nơi dùng tiêu biểu của hàm softmax?
Đặt ở lớp đầu ra của bài toán hồi quy, xuất ra trực tiếp giá trị liên tục
Dùng làm hàm kích hoạt của lớp ẩn, tạo tính phi tuyến cho lớp
Đặt ở lớp đầu ra của phân loại nhị phân, xuất ra xác suất của một lớp
Đặt ở lớp đầu ra của phân loại đa lớp, xuất ra xác suất của mỗi lớp
Đáp ánD. Đặt ở lớp đầu ra của phân loại đa lớp, xuất ra xác suất của mỗi lớp
Hàm softmax chuẩn hóa toàn bộ sao cho tổng đầu ra đúng bằng 1, nên được đặt ở lớp đầu ra của phân loại đa lớp — có từ 3 lớp trở lên — để đọc như xác suất thuộc về mỗi lớp. Việc kết hợp hàm sai số với entropy chéo là cơ bản. Đặt ở lớp đầu ra của phân loại nhị phân để xuất xác suất là hàm sigmoid, dùng rộng rãi làm hàm kích hoạt của lớp ẩn là hàm ReLU hay hàm tanh. Với bài toán hồi quy thì lớp đầu ra xuất trực tiếp giá trị, và dùng hàm sai số bình phương trung bình.
Câu 7 | Hàm sai số của hồi quy
Trong bài toán hồi quy dự đoán giá trị liên tục như giá nhà, đâu là hàm sai số cơ bản được chọn?
Entropy chéo đo độ lệch giữa phân phối xác suất dự đoán và phân phối đáp án
Triplet Loss dạy quan hệ khoảng cách của bộ ba
Contrastive Loss dạy bằng khoảng cách xem có phải cùng một thứ hay không
Hàm sai số bình phương trung bình, bình phương chênh lệch giữa dự đoán và đáp án rồi lấy trung bình
Đáp ánD. Hàm sai số bình phương trung bình, bình phương chênh lệch giữa dự đoán và đáp án rồi lấy trung bình
Vì hồi quy là bài toán đoán giá trị liên tục, nên hàm sai số bình phương trung bình — bình phương trực tiếp chênh lệch giữa dự đoán và đáp án rồi lấy trung bình — là lựa chọn tự nhiên. Entropy chéo là hàm đo độ lệch giữa các phân phối xác suất, dùng cho bài toán phân loại. Nếu là phân loại đa lớp thì kết hợp cơ bản với hàm softmax ở lớp đầu ra. Triplet Loss dạy quan hệ khoảng cách bằng bộ ba gồm mốc, ví dụ dương, ví dụ âm; Contrastive Loss dạy bằng khoảng cách xem hai dữ liệu có phải cùng một thứ hay không — cả hai đều là hàm sai số để có được biểu diễn đo độ giống nhau. Việc chọn hàm sai số theo từng nhiệm vụ chính là mục tiêu của mục này.
Câu 8 | Sai số của bộ ba
Đâu là mô tả phù hợp về hàm sai số Triplet Loss?
Bình phương chênh lệch giữa dự đoán và đáp án rồi lấy trung bình, đo trực tiếp độ lệch về độ lớn giá trị
Đo độ lệch giữa phân phối xác suất dự đoán và phân phối đáp án, dùng rộng rãi cho việc học phân loại
Dùng bộ ba gồm mốc, ví dụ dương, ví dụ âm, để ví dụ dương gần hơn ví dụ âm
Đo khoảng cách giữa hai phân phối xác suất, có tác dụng kéo hai phân phối lại gần nhau
Đáp ánC. Dùng bộ ba gồm mốc, ví dụ dương, ví dụ âm, để ví dụ dương gần hơn ví dụ âm
Triplet Loss là hàm sai số dùng bộ ba gồm dữ liệu làm mốc, dữ liệu cùng loại (ví dụ dương), dữ liệu khác loại (ví dụ âm), để học sao cho khoảng cách giữa mốc và ví dụ dương nhỏ hơn khoảng cách giữa mốc và ví dụ âm. Được dùng khi tạo không gian biểu diễn độ giống nhau bằng khoảng cách. Đo độ lệch giữa hai phân phối xác suất là phân kỳ Kullback-Leibler (KL); bình phương chênh lệch giữa dự đoán và đáp án rồi lấy trung bình là hàm sai số bình phương trung bình; đo độ lệch phân phối xác suất và dùng rộng rãi cho phân loại là entropy chéo. Ngoài ra Contrastive Loss — dạy bằng cặp dữ liệu xem có giống nhau hay không — cũng được liệt kê trong cùng mục này.
Câu 9 | Lan truyền ngược
Đâu là mô tả phù hợp nhất về thuật toán lan truyền ngược (backpropagation)?
Là chính thủ tục cập nhật, viết lại trực tiếp trọng số theo thứ tự từ lớp đầu ra
Là thủ tục di chuyển trọng số bằng số ngẫu nhiên một chút một, rồi chọn hướng làm giảm sai số
Là thủ tục tiến hành tính toán theo thứ tự từ phía đầu vào tới phía đầu ra, để tìm ra đầu ra
Là thủ tục dùng quy tắc chuỗi, lùi từ phía đầu ra về phía đầu vào để tìm gradient
Đáp ánD. Là thủ tục dùng quy tắc chuỗi, lùi từ phía đầu ra về phía đầu vào để tìm gradient
Lan truyền ngược là phương pháp dùng quy tắc chuỗi — phân rã đạo hàm của hàm hợp thành tích các đạo hàm từng thành phần — để tìm hiệu quả gradient của từng trọng số bằng cách lùi từ phía đầu ra về phía đầu vào. Thứ tìm được ở đây chỉ là gradient, còn việc dùng gradient đó để thực sự di chuyển trọng số là vai trò của phương pháp giảm gradient (gradient descent). Cần lưu ý rằng nói lan truyền ngược cập nhật trọng số là không chính xác. Di chuyển bằng số ngẫu nhiên rồi chọn hướng tốt là ý tưởng tìm kiếm không dùng gradient; tiến hành tính toán từ đầu vào tới đầu ra là lan truyền xuôi, tức là thủ tục suy luận.
Câu 10 | Vấn đề phân bổ tín nhiệm
Vấn đề phân bổ xem lớp nào, đơn vị (unit) nào phải chịu trách nhiệm bao nhiêu cho sai số cuối cùng được gọi là gì?
Vấn đề phân bổ tín nhiệm
Vấn đề bùng nổ gradient
Vấn đề biến mất gradient
Lời nguyền chiều
Đáp ánA. Vấn đề phân bổ tín nhiệm
Vấn đề phân bổ tín nhiệm là vấn đề xác định nên quy trách nhiệm cho sai số xuất hiện ở đầu ra cho lớp nào, đơn vị nào ở giữa với mức độ bao nhiêu. Lan truyền ngược được định vị là đã làm cho việc phân bổ này trở nên tính toán được nhờ quy tắc chuỗi. Vấn đề biến mất gradient là hiện tượng gradient tiến gần về 0 trong quá trình lùi lại khiến các lớp phía đầu vào không được học; vấn đề bùng nổ gradient ngược lại là hiện tượng gradient trở nên quá lớn và phân kỳ — cả hai đều là vấn đề phát sinh khi áp dụng lan truyền ngược. Lời nguyền chiều là hiện tượng lượng dữ liệu cần thiết tăng vọt khi số chiều đặc trưng tăng lên, và trong đề cương được đặt ở mục vừa của học máy.
Câu 11 | Chính quy hóa L1
Đâu là đặc điểm phù hợp của chính quy hóa L1?
Lấy tổng bình phương trọng số làm hình phạt, làm đều giá trị nhỏ đi nhưng khó thành 0
Lấy tổng giá trị tuyệt đối của trọng số làm hình phạt, dễ khiến giá trị đúng bằng 0
Vô hiệu hóa ngẫu nhiên các đơn vị (unit) mỗi lần học, để ngăn sự lệ thuộc thiên lệch
Dừng hẳn việc học tại thời điểm sai số dữ liệu kiểm định bắt đầu xấu đi
Đáp ánB. Lấy tổng giá trị tuyệt đối của trọng số làm hình phạt, dễ khiến giá trị đúng bằng 0
Chính quy hóa L1 là chính quy hóa cộng thêm tổng giá trị tuyệt đối của trọng số vào hàm sai số làm hình phạt, dễ khiến trọng số bị ép về đúng điểm 0. Kết quả là hệ số của những đặc trưng không được dùng sẽ tự động về 0 và bị loại bỏ, tạo ra hiệu quả chọn đặc trưng. Trạng thái này gọi là thưa (sparse). Lấy tổng bình phương trọng số làm hình phạt là chính quy hóa L2, làm đều giá trị nhỏ đi nhưng khó thành 0. Vô hiệu hóa ngẫu nhiên đơn vị khi học là dropout, dừng học khi nhìn thấy sai số kiểm định xấu đi là dừng sớm (early stopping) — cả hai đều là cách đối phó với quá khớp nhưng cơ chế khác nhau.
Câu 12 | Hồi quy Ridge
Đâu là chính quy hóa được dùng trong hồi quy Ridge?
Chính quy hóa L0 lấy số lượng trọng số khác 0 làm hình phạt
Chính quy hóa L2 cộng thêm tổng bình phương trọng số làm hình phạt
Chính quy hóa L1 lấy tổng giá trị tuyệt đối của trọng số làm hình phạt
Dropout vô hiệu hóa ngẫu nhiên các đơn vị (unit) khi học
Đáp ánB. Chính quy hóa L2 cộng thêm tổng bình phương trọng số làm hình phạt
Hồi quy Ridge là phương pháp kết hợp hồi quy tuyến tính với chính quy hóa L2. Vì cộng thêm tổng bình phương trọng số làm hình phạt nên toàn bộ hệ số được giữ nhỏ lại, ngăn được quá khớp. Bên kết hợp hồi quy tuyến tính với chính quy hóa L1 là hồi quy Lasso, loại này dễ khiến hệ số đúng bằng 0 và cho ra nghiệm thưa. Sự tương ứng giữa L1-Lasso và L2-Ridge dễ nhầm lẫn nên cần ghi nhớ theo cặp. Chính quy hóa L0 là ý tưởng lấy chính số lượng trọng số khác 0 làm hình phạt, vì số lượng không thể lấy đạo hàm nên khó đưa vào việc học dùng gradient. Dropout là kỹ thuật chính quy hóa dành riêng cho mạng nơ-ron.
Câu 13 | Dropout
Đâu là mô tả phù hợp về dropout?
Lật ảnh trái phải hoặc cắt ra một phần, để tăng thêm chính dữ liệu học
Vô hiệu hóa ngẫu nhiên các đơn vị theo một tỷ lệ nhất định khi học, để kìm hãm quá khớp
Dừng việc học tại thời điểm sai số dữ liệu kiểm định bắt đầu tăng, để ngăn quá khớp
Chỉnh đầu ra của lớp giữa trong mini-batch về trung bình 0, phương sai 1 để ổn định việc học
Đáp ánB. Vô hiệu hóa ngẫu nhiên các đơn vị theo một tỷ lệ nhất định khi học, để kìm hãm quá khớp
Dropout là kỹ thuật vô hiệu hóa ngẫu nhiên các đơn vị của lớp ẩn theo một tỷ lệ nhất định mỗi lần học. Vì mỗi lần lại học với một mạng hình dạng hơi khác nhau, nên không thể ghi nhớ theo cách phụ thuộc hoàn toàn vào một tổ hợp đơn vị cụ thể, và đạt được hiệu ứng gần giống như lấy trung bình của nhiều mô hình. Chỉ vô hiệu hóa khi học, còn khi suy luận thì dùng toàn bộ đơn vị. Tuy tên gần giống nhưng trong đề cương dropout được xếp vào mục 14 chính quy hóa, không phải mục 19 lớp chuẩn hóa. Chỉnh phân phối trong mini-batch là chuẩn hóa batch, tăng thêm dữ liệu là tăng cường dữ liệu, dừng khi sai số xấu đi là dừng sớm.
Câu 14 | Học mini-batch
Đâu là mô tả phù hợp về học mini-batch?
Là cách tiến hành không cập nhật trọng số, tiếp tục dùng nguyên giá trị đã quyết định trước
Là cách tiến hành tìm gradient trên toàn bộ dữ liệu huấn luyện rồi cập nhật trọng số đúng 1 lần
Là cách tiến hành cập nhật trọng số theo từng cụm vài chục đến vài trăm dữ liệu
Là cách tiến hành cập nhật trọng số mỗi khi dùng 1 dữ liệu huấn luyện
Đáp ánC. Là cách tiến hành cập nhật trọng số theo từng cụm vài chục đến vài trăm dữ liệu
Học mini-batch là cách tiến hành chia dữ liệu huấn luyện thành các cụm vài chục đến vài trăm dữ liệu, tìm gradient theo từng cụm đó và cập nhật trọng số. Nó có tính chất trung gian: không bị dao động nhiều như học trực tuyến (cập nhật từng dữ liệu một), và không nặng về tính toán như học theo batch (cập nhật đúng 1 lần trên toàn bộ dữ liệu), nên trong thực tế đây là cách chiếm phần lớn. Phương pháp giảm gradient ngẫu nhiên (SGD) tìm gradient chỉ trên một phần dữ liệu, nên nhờ sự dao động đó mà dễ thoát khỏi điểm yên ngựa hay cực tiểu cục bộ nông. Việc không cập nhật trọng số không phải là học, mà chỉ đơn thuần là suy luận.
Câu 15 | Epoch
Đâu là mối quan hệ phù hợp giữa epoch và iteration?
Epoch chỉ độ lớn của mini-batch, iteration chỉ độ lớn của tốc độ học
Epoch chỉ việc đi hết 1 vòng dữ liệu, iteration chỉ việc cập nhật trọng số 1 lần
Epoch chỉ việc cập nhật trọng số 1 lần, iteration chỉ việc đi hết 1 vòng dữ liệu
Cả epoch lẫn iteration đều chỉ việc đi hết 1 vòng dữ liệu
Đáp ánB. Epoch chỉ việc đi hết 1 vòng dữ liệu, iteration chỉ việc cập nhật trọng số 1 lần
Epoch chỉ việc đi hết 1 vòng toàn bộ dữ liệu huấn luyện, iteration chỉ việc cập nhật trọng số 1 lần. Hai khái niệm này được liên kết thông qua kích thước mini-batch: số iteration trong 1 epoch bằng số lượng dữ liệu chia cho kích thước mini-batch. Ví dụ nếu chạy 3000 dữ liệu với kích thước 50 thì 1 epoch là 60 iteration. Nếu tăng kích thước mini-batch thì gradient mỗi lần ổn định hơn nhưng số lần cập nhật trong 1 epoch giảm; nếu giảm kích thước thì số lần cập nhật tăng nhưng độ dao động lớn hơn. Cả kích thước mini-batch lẫn tốc độ học đều là siêu tham số (hyperparameter) do con người quyết định trước, khác với khái niệm epoch hay iteration.
Câu 16 | Điểm yên ngựa
Đâu là mô tả phù hợp về điểm yên ngựa (saddle point)?
Là điểm mà nhìn từ hướng này là cực tiểu, nhìn từ hướng khác lại là cực đại
Là điểm sai số nhỏ nhất trong phạm vi lân cận, nhưng toàn thể còn có điểm tốt hơn
Là vùng mà giá trị sai số không đổi trên toàn phạm vi, không có độ dốc theo bất kỳ hướng nào
Là điểm mà sai số nhỏ nhất trong toàn bộ phạm vi có thể có
Đáp ánA. Là điểm mà nhìn từ hướng này là cực tiểu, nhìn từ hướng khác lại là cực đại
Điểm yên ngựa là điểm mà nhìn từ một hướng thì là đáy thung lũng, nhưng nhìn từ hướng khác lại là đỉnh núi. Tên gọi này bắt nguồn từ việc nó có hình dạng giống chiếc yên ngựa. Trong học sâu với số lượng tham số cực lớn, người ta cho rằng việc bị kẹt ở điểm yên ngựa và không di chuyển được dễ xảy ra hơn là rơi vào cực tiểu toàn cục — nơi là đáy thung lũng theo mọi hướng cùng lúc. Điểm sai số nhỏ nhất trong toàn phạm vi là cực tiểu toàn cục, điểm nhỏ nhất chỉ trong phạm vi lân cận là cực tiểu cục bộ. Phương pháp giảm gradient ngẫu nhiên (SGD) có sự dao động trên gradient nên dễ thoát khỏi tình trạng bị mắc kẹt như vậy.
Câu 17 | Adam
Adam là phương pháp tối ưu hóa kết hợp cách nghĩ nào?
Kết hợp 2 loại hình phạt là tổng giá trị tuyệt đối và tổng bình phương của trọng số
Kết hợp cách dùng quán tính với cách thích ứng tốc độ học
Luân phiên chuyển đổi giữa 2 cách tiến hành là học theo batch và học trực tuyến
Kết hợp 2 loại tìm kiếm là tìm kiếm lưới (grid search) và tìm kiếm ngẫu nhiên (random search)
Đáp ánB. Kết hợp cách dùng quán tính với cách thích ứng tốc độ học
Adam là phương pháp tối ưu hóa kết hợp ý tưởng của Momentum — cộng dồn lượng cập nhật trước đó như quán tính — với ý tưởng của RMSprop — tự động điều chỉnh tốc độ học cho từng tham số, và thường được dùng làm giá trị mặc định trong thực tế. Dòng thích ứng tốc độ học bắt đầu từ AdaGrad; AdaGrad giảm tốc độ học nhiều hơn cho tham số có lượng cập nhật lớn, nhưng vì cứ giảm mãi nên RMSprop đã nới lỏng điều này bằng trung bình động theo cấp số mũ. Cùng dòng này còn có AdaDelta, AdaBound, AMSBound. Hình phạt lên trọng số là chuyện của chính quy hóa, tìm kiếm lưới và tìm kiếm ngẫu nhiên là chuyện của tìm kiếm siêu tham số — không cái nào là chính quy tắc cập nhật.
Câu 18 | Không có bữa trưa miễn phí
Định lý không có bữa trưa miễn phí (no free lunch) phát biểu điều gì?
Không tồn tại thuật toán vạn năng vượt trội hơn các thuật toán khác trên mọi bài toán
Số chiều đặc trưng càng tăng thì lượng dữ liệu học cần thiết càng tăng vọt
Nếu tiếp tục giảm tốc độ học thì chắc chắn sẽ đạt tới cực tiểu toàn cục
Khi làm mô hình lớn hơn, sai số tạm thời xấu đi rồi lại giảm trở lại
Đáp ánA. Không tồn tại thuật toán vạn năng vượt trội hơn các thuật toán khác trên mọi bài toán
Định lý không có bữa trưa miễn phí khẳng định rằng nếu lấy trung bình trên mọi bài toán có thể hình dung được, thì không tồn tại thuật toán vạn năng vượt trội hơn tất cả các thuật toán khác. Do đó việc chọn phương pháp phải xét theo từng bài toán, không có câu trả lời "lúc nào cũng dùng cái này là được". Việc khi làm mô hình lớn hơn thì sai số tạm thời xấu đi rồi lại giảm trở lại là hiện tượng giảm kép (double descent), cũng được liệt kê trong cùng mục này. Số chiều đặc trưng tăng khiến lượng dữ liệu cần thiết tăng vọt là lời nguyền chiều. Không có bảo đảm rằng cứ tiếp tục giảm tốc độ học sẽ chắc chắn đạt tới cực tiểu toàn cục, vì có thể dừng lại ở cực tiểu cục bộ hoặc điểm yên ngựa.
Câu 19 | Tìm kiếm ngẫu nhiên
Đâu là mô tả phù hợp về tìm kiếm ngẫu nhiên (random search), một phương pháp tìm kiếm siêu tham số?
Sắp xếp các giá trị ứng viên theo dạng lưới, thử lần lượt mọi tổ hợp
Vô hiệu hóa ngẫu nhiên các đơn vị (unit) mỗi lần học, để có được hành vi trung bình
Dừng hẳn việc học tại thời điểm sai số dữ liệu kiểm định bắt đầu xấu đi
Chọn ngẫu nhiên các điểm trong phạm vi tìm kiếm, và thử tổ hợp đó
Đáp ánD. Chọn ngẫu nhiên các điểm trong phạm vi tìm kiếm, và thử tổ hợp đó
Tìm kiếm ngẫu nhiên là phương pháp chọn ngẫu nhiên các điểm trong phạm vi tìm kiếm siêu tham số rồi thử. Khác với tìm kiếm lưới — sắp xếp các ứng viên theo dạng lưới rồi thử vét cạn — phương pháp này ít lãng phí lượt thử cho các siêu tham số không có tác dụng, và có lợi thế là dù cùng số lượt thử vẫn có thể khảo sát chi tiết hơn trục có tác dụng. Các giá trị con người quyết định trước như tốc độ học, kích thước mini-batch, số lớp chính là siêu tham số. Dừng học khi sai số kiểm định xấu đi là dừng sớm, vô hiệu hóa ngẫu nhiên đơn vị khi học là dropout — cả hai đều không phải phương pháp tìm kiếm.
Câu 20 | Hiện tượng giảm kép
Hiện tượng khi tăng kích thước mô hình hoặc lượng học, sai số kiểm định tạm thời xấu đi rồi lại giảm trở lại, được gọi là gì?
Vấn đề bùng nổ gradient
Đạt được tính bất biến
Hiện tượng giảm kép
Vấn đề phân bổ tín nhiệm
Đáp ánC. Hiện tượng giảm kép
Hiện tượng giảm kép (double descent) là hiện tượng khi tăng kích thước mô hình hoặc lượng học, sai số kiểm định tạm thời xấu đi rồi khi tiếp tục tăng thêm nữa thì lại bắt đầu giảm trở lại. Tên gọi này xuất phát từ việc đường cong sai số giảm 2 lần. Nó trái ngược với trực giác đơn giản rằng mô hình càng lớn thì càng dễ quá khớp và xấu đi, và được liệt kê trong mục phương pháp tối ưu hóa của đề cương như một khung để giải thích kinh nghiệm gần đây rằng mô hình càng lớn đôi khi lại cho kết quả tốt hơn. Vấn đề phân bổ tín nhiệm là vấn đề quy trách nhiệm sai số cho đơn vị nào; vấn đề bùng nổ gradient là vấn đề gradient phân kỳ trong lan truyền ngược; đạt được tính bất biến là vai trò của lớp pooling.
Câu 21 | Lớp tích chập
So với lớp kết nối đầy đủ (fully connected), đâu là đặc điểm phù hợp của lớp tích chập?
Kết nối với mọi đơn vị của lớp trước, nên đầu vào càng lớn thì trọng số càng tăng
Dùng lại cùng một bộ lọc ở các vị trí khác nhau, nên trích xuất được đặc trưng với ít trọng số
Bằng cách đưa trạng thái thời điểm trước quay lại đầu vào, xử lý được dữ liệu chuỗi có thứ tự
Hoàn toàn không có trọng số để học, chỉ lấy giá trị đại diện của vùng để thu nhỏ đầu ra
Đáp ánB. Dùng lại cùng một bộ lọc ở các vị trí khác nhau, nên trích xuất được đặc trưng với ít trọng số
Lớp tích chập trượt một bộ lọc nhỏ trên đầu vào, dùng lại cùng trọng số để trích xuất đặc trưng cục bộ. Nhờ hai điểm — đối tượng kết nối chỉ giới hạn ở các phần tử lân cận, và dùng lại cùng trọng số dù đổi vị trí — nên có thể xử lý ảnh với số tham số ít hơn rất nhiều so với lớp kết nối đầy đủ. Một sản phẩm phụ của việc dùng lại này là dù vật thể xuất hiện ở đâu trong ảnh cũng được bắt lấy như cùng một đặc trưng. Kết nối với mọi đơn vị của lớp trước là lớp kết nối đầy đủ; không có trọng số để học và chỉ lấy giá trị đại diện là lớp pooling; đưa trạng thái thời điểm trước quay lại là mô tả của lớp kết nối hồi quy. Kết quả sau khi cho qua một bộ lọc là bản đồ đặc trưng (feature map), độ dịch chuyển là stride, việc lấp đầy xung quanh là padding.
Câu 22 | Chuẩn hóa batch
Đâu là mô tả phù hợp về chuẩn hóa batch (batch normalization)?
Cộng thêm tổng bình phương trọng số làm hình phạt vào hàm sai số, làm đều trọng số nhỏ lại
Vô hiệu hóa một tỷ lệ nhất định các đơn vị (unit) mỗi lần học, loại bỏ sự lệ thuộc thiên lệch
Chỉnh gộp giá trị của toàn bộ lớp trong 1 mẫu, không bị ảnh hưởng bởi kích thước mini-batch
Gộp giá trị cùng kênh trong mini-batch lại, chỉnh về trung bình 0, phương sai 1
Đáp ánD. Gộp giá trị cùng kênh trong mini-batch lại, chỉnh về trung bình 0, phương sai 1
Chuẩn hóa batch là lớp chuẩn hóa gộp giá trị cùng kênh trong mini-batch lại, chỉnh về trung bình 0, phương sai 1, giúp việc học ổn định và nhanh hơn. Điểm yếu là khi kích thước mini-batch nhỏ thì các đại lượng thống kê trở nên không đáng tin cậy. Chỉnh gộp giá trị toàn bộ lớp trong 1 mẫu là chuẩn hóa lớp (layer normalization), không bị ảnh hưởng bởi kích thước mini-batch nên thường dùng cho mô hình xử lý chuỗi. Ngoài ra còn có chuẩn hóa instance và chuẩn hóa nhóm, 4 loại này được xếp cùng vào mục lớp chuẩn hóa của đề cương. Ngoài ra, tên gọi mục này đã đổi từ lớp chính quy hóa sang lớp chuẩn hóa kể từ phiên bản 1.1. Chính quy hóa L2 lấy tổng bình phương trọng số làm hình phạt và dropout vô hiệu hóa đơn vị được xếp vào chính quy hóa, không phải lớp chuẩn hóa.
Câu 23 | Lớp pooling
Đâu là vai trò phù hợp nhất mà lớp pooling đảm nhận?
Nhảy qua các lớp để cộng dồn đầu vào vào lớp phía sau, tạo con đường để gradient tới nơi
Làm đều phân phối đầu ra của lớp giữa, giúp việc học ổn định và nhanh hơn
Rút gọn vùng thành giá trị đại diện, tạo mô hình mạnh với sự lệch vị trí nhỏ
Nén đầu vào xuống chiều thấp rồi làm cho có thể khôi phục lại đầu vào gốc
Đáp ánC. Rút gọn vùng thành giá trị đại diện, tạo mô hình mạnh với sự lệch vị trí nhỏ
Lớp pooling là lớp rút gọn một vùng có kích thước cố định thành một giá trị đại diện, có pooling giá trị lớn nhất (max pooling) lấy giá trị lớn nhất của vùng, và pooling giá trị trung bình (average pooling) lấy trung bình. Không chỉ giảm độ phân giải để tính toán nhẹ hơn, mà giá trị đại diện cũng ít thay đổi dù vật thể lệch vài pixel, nên trở nên mạnh với sự lệch vị trí. Đây gọi là đạt được tính bất biến. Global Average Pooling (GAP) — làm phẳng toàn bộ một bản đồ đặc trưng thành một giá trị bằng cách lấy trung bình — nếu dùng thay cho việc xếp lớp kết nối đầy đủ ở cuối thì có thể giảm mạnh số tham số. Điểm khác với lớp tích chập là lớp pooling không có trọng số để học. Nhảy qua lớp để cộng dồn là kết nối bỏ qua (skip connection), làm đều phân phối là lớp chuẩn hóa, nén rồi khôi phục là autoencoder.
Câu 24 | Kết nối bỏ qua
Tại sao việc áp dụng kết nối bỏ qua (skip connection) giúp việc học tiến triển được ngay cả với mạng rất sâu?
Vì tạo được con đường nhảy qua các lớp, nên gradient theo con đường nông tới được phía đầu vào
Vì các đơn vị (unit) bị vô hiệu hóa ngẫu nhiên nên không còn phụ thuộc vào con đường cụ thể
Vì phân phối đầu ra của mỗi lớp được làm đều, độ dao động của giá trị được kìm hãm theo từng lớp
Vì số lượng trọng số giảm nên khó quá khớp ngay cả với dữ liệu hạn chế
Đáp ánA. Vì tạo được con đường nhảy qua các lớp, nên gradient theo con đường nông tới được phía đầu vào
Kết nối bỏ qua là đường nối cộng thẳng đầu vào vào đầu ra của một lớp ở phía sau, nhảy qua vài lớp. Khi lan truyền ngược, gradient không chỉ đi qua con đường dài qua nhiều lớp mà còn đi qua con đường ngắn nhảy qua đó để tới được phía đầu vào, nên dù xếp sâu thì gradient cũng khó biến mất. Ví dụ tiêu biểu áp dụng ý tưởng này để biến độ sâu hơn 100 lớp thành hiện thực là ResNet, và trong đề cương, từ khóa duy nhất được đặt ở mục vừa kết nối bỏ qua là ResNet. Vô hiệu hóa ngẫu nhiên đơn vị là dropout, làm đều phân phối của mỗi lớp là lớp chuẩn hóa — cả hai đều là cơ chế khác với kết nối bỏ qua. Kết nối bỏ qua cũng không phải là mẹo để giảm số lượng trọng số.
Câu 25 | LSTM và GRU
Về các cổng (gate) mà LSTM và GRU có, đâu là tổ hợp đúng?
Cả LSTM lẫn GRU đều có chung 2 cổng reset và update
Cả LSTM lẫn GRU đều có chung 3 cổng input, output và forget
LSTM có 3 cổng input, output và forget, GRU có 2 cổng reset và update
LSTM có 2 cổng reset và update, GRU có 3 cổng input, output và forget
Đáp ánC. LSTM có 3 cổng input, output và forget, GRU có 2 cổng reset và update
LSTM có một con đường bộ nhớ gọi là CEC để lưu giữ thông tin, và kiểm soát việc đưa vào lấy ra bằng 3 cổng: cổng input quyết định ghi gì vào đó, cổng forget quyết định bỏ gì, cổng output quyết định đưa gì ra ngoài. Cơ chế này giúp giữ được quan hệ phụ thuộc dài, làm giảm mạnh vấn đề biến mất gradient của mạng nơ-ron hồi quy. GRU là phiên bản đơn giản hóa của LSTM, chỉ có 2 cổng là cổng reset và cổng update. Ít tham số hơn, tính toán nhẹ hơn, nhưng không phải lúc nào cũng có hiệu năng cao hơn LSTM. Số cổng là 3 và 2, và CEC là thuật ngữ riêng của LSTM — đây là những điểm phân biệt hay được hỏi lặp đi lặp lại.
Câu 26 | Jordan
Đâu là cấu trúc phù hợp của mạng Jordan (Jordan network)?
Đưa đầu ra của lớp đầu ra quay lại làm đầu vào cho lớp ẩn ở thời điểm tiếp theo
Đưa đầu ra của lớp ẩn quay lại làm đầu vào cho lớp ẩn ở thời điểm tiếp theo
Đưa đầu ra của lớp đầu ra quay lại làm đầu vào cho lớp đầu vào ở cùng thời điểm
Đưa thẳng giá trị của lớp đầu vào nhảy tới tận lớp đầu ra và cộng vào
Đáp ánA. Đưa đầu ra của lớp đầu ra quay lại làm đầu vào cho lớp ẩn ở thời điểm tiếp theo
Mạng Jordan là một dạng mạng nơ-ron hồi quy đưa đầu ra của lớp đầu ra quay lại làm đầu vào cho lớp ẩn ở thời điểm tiếp theo. Ngược lại, mạng đưa đầu ra của lớp ẩn quay lại làm đầu vào cho lớp ẩn ở thời điểm tiếp theo là mạng Elman, sự khác biệt giữa hai loại nằm ở việc đưa gì trở lại. Cả hai đều là cấu trúc để xử lý dữ liệu chuỗi thời gian theo đúng thứ tự, và việc học dùng BPTT — triển khai mạng theo chiều thời gian rồi áp dụng lan truyền ngược. Với chuỗi dài thì vấn đề biến mất gradient và bùng nổ gradient xuất hiện mạnh, nên dùng LSTM hoặc GRU có cơ chế cổng. Nhảy qua lớp để cộng dồn là kết nối bỏ qua, không phải chuyện về chiều thời gian.
Câu 27 | Attention
Đâu là mô tả phù hợp về Source-Target Attention?
Là cơ chế tính độ mạnh của mối liên quan giữa các phần tử với nhau trong cùng một chuỗi
Là cơ chế tính độ mạnh của mối liên quan giữa 2 chuỗi khác nhau
Là cơ chế chạy song song nhiều cách chú ý rồi tổng hợp kết quả lại
Là cơ chế cộng thêm tín hiệu riêng cho từng vị trí để đưa thông tin thứ tự của từ
Đáp ánB. Là cơ chế tính độ mạnh của mối liên quan giữa 2 chuỗi khác nhau
Attention là cơ chế tính trọng số cho biết nên chú ý vào đâu trong đầu vào, được biểu diễn bằng 3 thành phần query, key, value. Trong đó Source-Target Attention tính độ mạnh của mối liên quan giữa 2 chuỗi khác nhau, trong tình huống như dịch thuật nơi chuỗi đầu vào và chuỗi đầu ra tách biệt. Bên tính quan hệ giữa các phần tử với nhau trong cùng một chuỗi là Self-Attention, là thành phần trung tâm của Transformer. Cộng thêm tín hiệu riêng cho từng vị trí để đưa thông tin thứ tự từ là positional encoding, chạy song song nhiều cách chú ý rồi tổng hợp là Multi-Head Attention — đều là các thành phần khác cấu thành Transformer.
Câu 28 | Positional encoding
Đâu là mô tả phù hợp về Transformer?
Là mô hình học nén đầu vào xuống chiều thấp rồi khôi phục lại đầu vào gốc từ đó
Là mô hình xếp chồng xen kẽ tích chập và pooling, thu thập đặc trưng cục bộ theo từng giai đoạn
Là mô hình không dùng kết nối hồi quy, cấu thành từ Attention, và đưa thứ tự từ bằng positional encoding
Là mô hình có cấu trúc xếp chồng kết nối hồi quy, truyền trạng thái thời điểm trước theo thứ tự
Đáp ánC. Là mô hình không dùng kết nối hồi quy, cấu thành từ Attention, và đưa thứ tự từ bằng positional encoding
Transformer là mô hình chuỗi không dùng kết nối hồi quy, được cấu thành chủ yếu từ Attention. Vì không cần chờ tính toán của thời điểm trước, nên có thể xử lý song song toàn bộ chuỗi, và nắm bắt trực tiếp quan hệ giữa các từ xa nhau chỉ trong một lần tính. Tuy nhiên vì xử lý song song nên thông tin thứ tự của từ bị mất, nên đưa thứ tự từ bằng positional encoding — cộng thêm tín hiệu riêng cho từng vị trí. Điểm dễ nhầm lẫn là Transformer không phải một loại mạng nơ-ron hồi quy. Xếp chồng kết nối hồi quy để truyền trạng thái thời điểm trước là RNN, xếp chồng tích chập và pooling là CNN, nén rồi khôi phục là mô tả của autoencoder.
Câu 29 | VAE
Đâu là điểm khác biệt của autoencoder biến phân (VAE) so với autoencoder thông thường?
Điểm nén đầu vào xuống chiều thấp rồi khôi phục lại đầu vào gốc
Điểm học nơi được nén không phải là 1 điểm mà là một phân phối xác suất, nên có thể tạo dữ liệu mới
Điểm có thể tiến hành việc học mà không cần chuẩn bị nhãn đáp án
Điểm học từng lớp một theo thứ tự, để tạo giá trị khởi tạo cho mạng sâu
Đáp ánB. Điểm học nơi được nén không phải là 1 điểm mà là một phân phối xác suất, nên có thể tạo dữ liệu mới
Autoencoder biến phân (VAE) học nơi đã nén đầu vào không phải dưới dạng một điểm duy nhất mà dưới dạng một phân phối xác suất. Nếu lấy giá trị từ phân phối đó ra rồi khôi phục thì có thể tạo ra dữ liệu mới không có trong dữ liệu học, nên được coi là mô hình sinh (generative model). Việc nén xuống chiều thấp rồi khôi phục, và việc có thể học mà không cần nhãn đáp án, là tính chất chung với autoencoder thông thường, không phải đặc trưng riêng của VAE. Việc học từng lớp một theo thứ tự để tạo giá trị khởi tạo cho mạng sâu là tiền huấn luyện bằng autoencoder xếp chồng. Đề cương cũng liệt kê VQ-VAE, info VAE, β-VAE trong cùng mục này.
Câu 30 | Mixup
Trong các phương pháp tăng cường dữ liệu ảnh, Mixup thực hiện thao tác nào?
Cắt ra một phần ảnh rồi phóng to thành ví dụ mới
Chồng 2 ảnh lên nhau để tạo ra 1 ví dụ mới
Lật ảnh trái phải để tạo ra ví dụ với hướng khác nhau
Tô đen một phần ảnh theo hình vuông, che giấu thông tin của phần đó
Đáp ánB. Chồng 2 ảnh lên nhau để tạo ra 1 ví dụ mới
Mixup là phương pháp tăng cường dữ liệu chồng 2 ảnh lên nhau theo một tỷ lệ nhất định, đồng thời trộn cả nhãn đáp án theo cùng tỷ lệ đó để tạo dữ liệu học mới. CutMix có tên gần giống nhưng không chồng lên nhau mà cắt dán một phần của 2 ảnh thành 1 ảnh. Tô đen một phần ảnh theo hình vuông là Cutout hoặc Random Erasing, lật trái phải là Random Flip, cắt ra một phần là Crop. Ngoài ra còn có xoay là Rotate, đổi độ sáng là Brightness, đổi độ tương phản là Contrast, và tự động quyết định áp dụng phép biến đổi nào với mức độ bao nhiêu là RandAugment; đối với văn bản thì có paraphrasing và noising. Điều quan trọng ở mọi trường hợp là không chọn phép biến đổi làm hỏng ý nghĩa.
Câu 31 | GoogLeNet
Đâu là đặc điểm phù hợp của GoogLeNet?
Dùng module Inception, áp dụng song song các bộ lọc kích thước khác nhau
Vô địch ILSVRC năm 2012, dùng hàm ReLU và học bằng GPU
Đưa vào kết nối bỏ qua nhảy qua các lớp, hiện thực hóa độ sâu hơn 100 lớp
Chỉ xếp chồng phép tích chập nhỏ 3 nhân 3, tạo cấu trúc sâu
Đáp ánA. Dùng module Inception, áp dụng song song các bộ lọc kích thước khác nhau
GoogLeNet là mô hình dùng module Inception — áp dụng song song các bộ lọc kích thước khác nhau rồi tổng hợp kết quả — để hiện thực hóa cấu trúc sâu trong khi vẫn kìm hãm số tham số. Xếp chồng chỉ phép tích chập nhỏ 3 nhân 3 để tạo cấu trúc đơn giản mà sâu là VGG, cùng lọt vào top ILSVRC năm 2014 như GoogLeNet. Hiện thực hóa độ sâu hơn 100 lớp bằng kết nối bỏ qua nhảy qua lớp là ResNet, vô địch ILSVRC năm 2012 và kết hợp hàm ReLU, dropout, học bằng GPU là AlexNet. Sau đó mở rộng tới Wide ResNet, DenseNet, SENet, EfficientNet, MobileNet..., và Vision Transformer — mang ý tưởng Transformer vào mà không dùng tích chập — cũng được thu thập.
Câu 32 | Phát hiện 1 giai đoạn
Đâu là đặc điểm chung của YOLO và SSD?
Phát hiện vật thể theo quy trình 2 giai đoạn: đưa ra vùng ứng viên rồi mới phân loại
Gán lớp cho từng pixel một, tô màu phân vùng ảnh
Gộp việc trích xuất vùng ứng viên và phân loại thành 1 lần suy luận duy nhất, coi trọng tốc độ
Nhắm tới việc ước lượng vị trí khớp cơ thể người để tìm tư thế
Đáp ánC. Gộp việc trích xuất vùng ứng viên và phân loại thành 1 lần suy luận duy nhất, coi trọng tốc độ
YOLO và SSD là mô hình phát hiện vật thể 1 giai đoạn, gộp việc trích xuất vùng ứng viên và phán định lớp thành 1 lần suy luận duy nhất, thế mạnh là tốc độ. Ngược lại, dòng bắt đầu từ R-CNN rồi phát triển thành Fast R-CNN, Faster R-CNN là phương thức 2 giai đoạn — đưa ra vùng ứng viên trước rồi mới phân loại — chậm hơn nhưng dễ đạt độ chính xác cao. Gán lớp cho từng pixel là phân đoạn ngữ nghĩa (semantic segmentation), tiêu biểu là FCN, SegNet, U-Net, PSPNet, DeepLab. Phân đoạn thực thể (instance segmentation) — tách cả các cá thể của cùng một lớp — do Mask R-CNN đảm nhận, ước lượng tư thế qua khớp cơ thể người tiêu biểu là OpenPose.
Câu 33 | BERT
Đâu là mô tả phù hợp về BERT?
Ánh xạ ảnh và câu mô tả vào cùng một không gian vector, liên kết cả hai lại với nhau
Đi ngược lại quá trình thêm nhiễu để dần dần sinh ra dữ liệu
Dùng bộ mã hóa của Transformer, nhìn ngữ cảnh từ cả hai chiều trước sau
Xếp chồng lớp kết nối hồi quy, đọc từng từ theo thứ tự để tạo ngữ cảnh
Đáp ánC. Dùng bộ mã hóa của Transformer, nhìn ngữ cảnh từ cả hai chiều trước sau
BERT là mô hình ngôn ngữ dùng bộ mã hóa của Transformer, đặc điểm là được tiền huấn luyện bằng cách nhìn ngữ cảnh từ cả hai chiều trước và sau của câu. Nó đã phổ biến cách dùng tiền huấn luyện trên lượng lớn văn bản rồi mới thích ứng cho từng nhiệm vụ riêng. Xếp chồng lớp kết nối hồi quy để đọc từ theo thứ tự là mô hình dùng mạng nơ-ron hồi quy, Transformer không có kết nối hồi quy. Ánh xạ ảnh và câu mô tả vào cùng không gian vector là CLIP, trong đề cương được đặt ở mục đa phương thức (multimodal). Đi ngược quá trình thêm nhiễu để sinh dữ liệu là Diffusion Model, thuộc mục vừa sinh dữ liệu.
Câu 34 | CBOW
Đâu là chiều học phù hợp của CBOW trong word2vec?
Học để đoán từ ở trung tâm, từ các từ xuất hiện xung quanh
Học để đoán các từ xuất hiện xung quanh, từ từ ở trung tâm
Học để đoán toàn bộ câu là tích cực hay tiêu cực, từ toàn bộ câu
Học để đoán xem câu sau có nối tiếp không, từ câu trước
Đáp ánA. Học để đoán từ ở trung tâm, từ các từ xuất hiện xung quanh
CBOW là phương thức học để đoán từ ở trung tâm từ các từ xuất hiện xung quanh nó. Ngược lại, học để đoán các từ xung quanh từ từ ở trung tâm là skip-gram, chiều ngược nhau nên cần chú ý tránh nhầm lẫn. Cả hai đều là phương thức của word2vec, mục đích là có được biểu diễn phân tán (distributed representation) — biểu diễn từ bằng vector đặc (dense). Vector one-hot gán một chiều cho một từ có số chiều bằng kích thước từ vựng và không thể biểu diễn độ gần giữa các từ, trong khi ở biểu diễn phân tán thì các từ gần nghĩa được đặt gần nhau trong không gian vector. Đoán câu tích cực hay tiêu cực là nhiệm vụ ứng dụng phân tích cảm xúc, không phải chuyện về phương thức học biểu diễn từ.
Câu 35 | RLHF
Đâu là phương pháp tạo mô hình phần thưởng từ phản hồi của con người rồi điều chỉnh mô hình bằng học tăng cường?
DQN
A3C
PPO
RLHF
Đáp ánD. RLHF
RLHF là phương pháp tạo mô hình phần thưởng từ đánh giá sở thích do con người đưa ra, rồi dùng nó làm phần thưởng để điều chỉnh mô hình bằng học tăng cường. Nó nổi tiếng với việc điều chỉnh mô hình ngôn ngữ, nhưng điểm bất ngờ cần ghi nhớ là trong đề cương, nó được đặt ở mục vừa học tăng cường sâu chứ không phải xử lý ngôn ngữ tự nhiên. DQN là phương pháp tiêu biểu của học tăng cường sâu, xấp xỉ hàm giá trị hành động bằng mạng nơ-ron; PPO là phương pháp học chính sách kìm hãm độ lớn cập nhật chính sách để ổn định; A3C là phương pháp chạy song song nhiều môi trường để tiến hành học. Cùng mục này còn có Double DQN, Dueling Network, Rainbow, APE-X, Agent57.
Câu 36 | Diffusion
Đâu là mô tả phù hợp về Diffusion Model?
Học cách nhìn ba chiều từ ảnh chụp ở nhiều góc nhìn, tạo ảnh từ góc nhìn mới
Học nơi đã nén thành phân phối xác suất, rồi lấy ra từ đó để khôi phục
Cho 2 mạng cạnh tranh với nhau, để sinh ra dữ liệu giống thật
Đi ngược lại quá trình thêm nhiễu từng bước, để sinh ra dữ liệu
Đáp ánD. Đi ngược lại quá trình thêm nhiễu từng bước, để sinh ra dữ liệu
Diffusion Model là mô hình sinh, tạo ra dữ liệu mục tiêu từ nhiễu bằng cách đi ngược lại quá trình thêm nhiễu từng chút một vào dữ liệu. Cơ chế hoàn toàn khác với mạng đối sinh (GAN) — cho 2 mạng cạnh tranh nhau để học — và đây không phải một loại của GAN. Từ GAN đã phát sinh ra DCGAN, CycleGAN, Pix2Pix. Học cách nhìn ba chiều từ ảnh chụp ở nhiều góc nhìn là NeRF, học nơi đã nén thành phân phối xác suất là autoencoder biến phân (VAE). Nên sắp xếp rằng GAN, VAE và Diffusion Model là các dòng khác nhau đứng song song.
Câu 37 | Học chuyển giao
Đâu là sự khác biệt phù hợp giữa học chuyển giao (transfer learning) và fine-tuning?
Học chuyển giao học lại toàn bộ trọng số, fine-tuning chỉ học lớp đầu ra
Cả học chuyển giao lẫn fine-tuning đều học trọng số từ đầu mà không qua tiền huấn luyện
Học chuyển giao chủ yếu học phần gần lớp đầu ra, fine-tuning học lại một phạm vi rộng
Học chuyển giao chỉ dùng được cho ảnh, fine-tuning chỉ dùng được cho ngôn ngữ
Đáp ánC. Học chuyển giao chủ yếu học phần gần lớp đầu ra, fine-tuning học lại một phạm vi rộng
Học chuyển giao là phương pháp giữ nguyên cố định phần trích xuất đặc trưng của mô hình đã tiền huấn luyện, chủ yếu chỉ học lại phần gần lớp đầu ra bằng nhiệm vụ mới. Fine-tuning học lại toàn bộ hoặc một phạm vi rộng của trọng số bằng dữ liệu mới, tốn nhiều dữ liệu và tính toán hơn nhưng đổi lại dễ đạt hiệu quả khi lĩnh vực đối tượng khác biệt lớn với dữ liệu tiền huấn luyện. Với fine-tuning có thể xảy ra hiện tượng quên thảm khốc (catastrophic forgetting), mất đi khả năng mà mô hình gốc từng có. Cả hai đều là phương pháp lấy tiền đề là mô hình đã tiền huấn luyện, không phải học từ đầu. Cách dùng cũng không được quyết định theo loại dữ liệu xử lý.
Câu 38 | Mô hình nền tảng
Trong đề cương, từ mô hình nền tảng (foundation model) được đặt ở mục vừa nào?
Đặt ở học chuyển giao và fine-tuning, cùng với Few-shot
Đặt ở đa phương thức (multimodal), cùng với CLIP và DALL-E
Đặt ở học tăng cường sâu, cùng với DQN và RLHF
Đặt ở xử lý ngôn ngữ tự nhiên, cùng với mô hình ngôn ngữ lớn (LLM)
Đáp ánB. Đặt ở đa phương thức (multimodal), cùng với CLIP và DALL-E
Mô hình nền tảng là từ chỉ mô hình quy mô lớn được tiền huấn luyện trên lượng lớn dữ liệu và có thể chuyển dùng cho nhiều nhiệm vụ hạ nguồn khác nhau; trong đề cương nó được đặt ở mục 32 đa phương thức, cùng với CLIP, DALL-E, Flamingo, Unified-IO, Zero-shot. Các từ liên quan tới AI tạo sinh được phân tán ở nhiều nơi: mô hình ngôn ngữ lớn (LLM) được thu thập ở mục 27 xử lý ngôn ngữ tự nhiên, RLHF được thu thập ở mục 29 học tăng cường sâu. Đứng cùng ở mục 31 học chuyển giao và fine-tuning là Few-shot, One-shot, học tự giám sát, mô hình đã tiền huấn luyện, quên thảm khốc. Nắm được cái gì đặt ở mục vừa nào sẽ giúp dễ hình dung toàn cảnh phạm vi thi.
Câu 39 | SHAP
Đâu là cách nghĩ phù hợp của SHAP, một phương pháp của AI có thể giải thích (XAI)?
Cố ý hoán đổi giá trị của đặc trưng, đo mức độ quan trọng từ mức độ giảm độ chính xác
Trình bày dưới dạng bản đồ nhiệt xem đã nhìn vào đâu trong ảnh để phán đoán
Áp một mô hình đơn giản gần với dự đoán, giải thích bằng hệ số của mô hình đó
Dùng cách nghĩ của lý thuyết trò chơi hợp tác, phân bổ và trình bày đóng góp của mỗi đặc trưng
Đáp ánD. Dùng cách nghĩ của lý thuyết trò chơi hợp tác, phân bổ và trình bày đóng góp của mỗi đặc trưng
SHAP là phương pháp mượn cách nghĩ dùng trong lý thuyết trò chơi hợp tác, phân bổ công bằng và trình bày đóng góp của mỗi đặc trưng đối với dự đoán. Trình bày dưới dạng bản đồ nhiệt xem đã nhìn vào đâu trong ảnh để phán đoán là CAM hoặc Grad-CAM; cố ý hoán đổi giá trị đặc trưng và đo mức độ quan trọng từ mức độ giảm độ chính xác là Permutation Importance; áp một mô hình đơn giản gần với từng dự đoán riêng lẻ và giải thích bằng hệ số của nó là LIME. Tất cả những phương pháp này được thu thập ở mục 33 khả năng diễn giải mô hình của đề cương, và nỗ lực trình bày căn cứ phán đoán theo cách con người hiểu được gọi chung là AI có thể giải thích (XAI).
Câu 40 | Giả thuyết vé số
Đâu là nội dung phù hợp của giả thuyết vé số (lottery ticket hypothesis) liên quan tới việc làm nhẹ mô hình?
Cách nghĩ rằng nếu cho mô hình nhỏ học theo đầu ra của mô hình giáo viên lớn thì có thể giữ được hiệu năng
Cách nghĩ rằng bên trong một mạng lớn có tồn tại một phần dù học riêng lẻ vẫn đạt hiệu năng tương đương
Cách nghĩ rằng mô hình càng lớn thì lượng dữ liệu học cần thiết càng tăng theo cấp số mũ
Cách nghĩ rằng dù giảm độ chính xác của con số biểu diễn trọng số, mức giảm độ chính xác chỉ rất nhỏ
Đáp ánB. Cách nghĩ rằng bên trong một mạng lớn có tồn tại một phần dù học riêng lẻ vẫn đạt hiệu năng tương đương
Giả thuyết vé số là giả thuyết cho rằng bên trong một mạng lớn có chứa một mạng con "trúng thưởng" — nếu chỉ lấy riêng phần đó ra để học thì cũng đạt hiệu năng tương đương toàn thể. Nó được nói đến như bối cảnh giải thích lý do tại sao pruning — cắt bỏ các kết nối hoặc lớp có đóng góp nhỏ — lại hiệu quả. Cho mô hình nhỏ học theo đầu ra của mô hình giáo viên lớn là chưng cất (distillation), giảm độ chính xác của con số biểu diễn trọng số là lượng tử hóa (quantization); 3 kỹ thuật này cộng với pruning chính là các phương pháp làm nhẹ trong đề cương, gọi chung là nén mô hình. Lượng dữ liệu học cần thiết tăng vọt là chuyện của lời nguyền chiều. Ví dụ điển hình cần tới việc làm nhẹ là AI biên (edge AI) — chạy suy luận ở phía thiết bị đầu cuối.
Luyện tập: giải các câu hỏi trên trang này
Đây là công cụ luyện tập với câu hỏi ngẫu nhiên (hoạt động khi JavaScript được bật). Bạn vẫn có thể đọc toàn bộ câu hỏi và phần giải thích ở trên.
* Lời giải là thông tin phục vụ việc học. Phạm vi ra đề và chế độ thi có thể thay đổi theo từng năm, vì vậy hãy luôn kiểm tra thông báo chính thức của đơn vị tổ chức thi.
Trang này là bản dịch từ nguyên bản tiếng Nhật. Nếu nội dung bản dịch và nguyên bản khác nhau, bản tiếng Nhật sẽ được ưu tiên. Xem nguyên bản tiếng Nhật