ห้องเรียนรู้ Karinoya

คุณวุฒิ · แล็บสอบผ่าน Cloud / AI / Python

วิธีการเรียนรู้เชิงลึกและการประยุกต์ใช้

อ่านโจทย์และคำอธิบายเป็นไทยได้ ส่วนบทบรรยาย (บทความอธิบาย) มีเฉพาะฉบับภาษาญี่ปุ่นเท่านั้น

ดูฉบับภาษาญี่ปุ่น (มีบทบรรยาย) →

ข้อ 1 | เพอร์เซปตรอนอย่างง่าย

ข้อใดกล่าวถึงเพอร์เซปตรอนอย่างง่าย (Simple Perceptron) ได้อย่างถูกต้อง

  1. ประกอบด้วยชั้นอินพุตและชั้นเอาต์พุตเท่านั้น แก้ปัญหาที่แยกเชิงเส้นได้เท่านั้น
  2. ถนัดในการเลื่อนฟิลเตอร์ไปบนภาพเพื่อดึงลักษณะเฉพาะเฉพาะจุด
  3. มีการเชื่อมย้อนสถานะไปยังทิศทางเวลา จึงจัดการข้อมูลลำดับตามลำดับเดิมได้
  4. มีเลเยอร์ซ่อนหลายชั้น สามารถแยกข้อมูลแบบไม่เชิงเส้นได้ จึงแทน XOR ได้
คำตอบA. ประกอบด้วยชั้นอินพุตและชั้นเอาต์พุตเท่านั้น แก้ปัญหาที่แยกเชิงเส้นได้เท่านั้น

เพอร์เซปตรอนอย่างง่ายเป็นโครงข่ายประสาทเทียมที่ง่ายที่สุด ประกอบด้วยชั้นอินพุตและชั้นเอาต์พุตเท่านั้น จึงแก้ได้เฉพาะปัญหาที่แยกเชิงเส้นได้ด้วยเส้นตรงเส้นเดียว XOR มีจุดที่เอาต์พุตเป็น 1 กับ 0 เรียงสลับกันตามแนวทแยง ไม่ว่าจะลากเส้นตรงตรงไหนก็แยกไม่ได้ เพอร์เซปตรอนอย่างง่ายจึงแทน XOR ไม่ได้ เพอร์เซปตรอนหลายชั้น (Multi-layer Perceptron) ที่เพิ่มเลเยอร์ซ่อนเพื่อโค้งขอบเขตได้จึงแทน XOR ได้ ตัวเลือกที่ 1 คือคำอธิบายของเพอร์เซปตรอนหลายชั้นนี้ การย้อนสถานะเวลาก่อนหน้าเพื่อจัดการลำดับคือโครงข่ายประสาทเทียมแบบวนซ้ำ (RNN) ส่วนการเลื่อนฟิลเตอร์เพื่อดึงลักษณะเฉพาะจุดคือคำอธิบายของชั้นคอนโวลูชัน

ข้อ 2 | ความเหมาะสมของ GPU

เหตุผลที่ GPU ถูกกล่าวว่าเหมาะสมกับการเรียนรู้ของดีปเลิร์นนิง ข้อใดเหมาะสมที่สุด

  1. มีความจุหน่วยความจำสำหรับเก็บข้อมูลที่ใช้เรียนรู้ มากกว่า CPU อย่างมาก
  2. มีวงจรเฉพาะสำหรับกฎลูกโซ่ (Chain Rule) ที่ใช้ในการแพร่ย้อนกลับของข้อผิดพลาดฝังไว้ตั้งแต่แรก
  3. ประมวลผลงานซับซ้อนที่มีการแตกกิ่งมากด้วยแกนจำนวนน้อยแต่ทรงพลังตามลำดับได้เร็ว
  4. มีแกนคำนวณขนาดเล็กจำนวนมาก ประมวลผลการคำนวณแบบเดียวกันแบบขนานพร้อมกันได้
คำตอบD. มีแกนคำนวณขนาดเล็กจำนวนมาก ประมวลผลการคำนวณแบบเดียวกันแบบขนานพร้อมกันได้

การเรียนรู้ของดีปเลิร์นนิงคือการคำนวณที่ทำการคูณและบวกเมทริกซ์กับเวกเตอร์ซ้ำจำนวนมหาศาล GPU มีแกนคำนวณขนาดเล็กจำนวนมากที่เหมาะกับการประมวลผลการคำนวณแบบเดียวกันแบบขนานพร้อมกัน จึงเข้ากันได้ดีกับรูปแบบการคำนวณนี้ การประมวลผลงานที่มีการแตกกิ่งมากด้วยแกนจำนวนน้อยแต่ทรงพลังตามลำดับได้เร็วเป็นจุดเด่นของ CPU ซึ่งมีจำนวนแกนไม่มาก ข้อได้เปรียบของ GPU ไม่ใช่ความจุหน่วยความจำแต่คือระดับการขนาน ไม่มีข้อเท็จจริงว่ามีวงจรเฉพาะสำหรับกฎลูกโซ่ฝังไว้ TPU ต่างหากที่ถูกออกแบบมาเฉพาะสำหรับการคำนวณเทนเซอร์ของดีปเลิร์นนิง

ข้อ 3 | สาเหตุของ Vanishing Gradient

เหตุใดการใช้ฟังก์ชันซิกมอยด์ (Sigmoid) ในเลเยอร์ซ่อนจึงมักนำไปสู่ปัญหา Vanishing Gradient

  1. เพราะเอาต์พุตอยู่ในช่วง 0 ถึง 1 เมื่อซ้อนเลเยอร์กัน เอาต์พุตเองจะเข้าใกล้ 0
  2. เพราะผลรวมของเอาต์พุตถูกปรับให้เป็น 1 ค่าจึงเล็กลงไปทีละเลเยอร์
  3. เพราะค่าอนุพันธ์สูงสุดคือ 0.25 และถูกคูณซ้ำทุกครั้งที่ย้อนกลับไปทีละเลเยอร์
  4. เพราะเอาต์พุตเป็น 0 เสมอสำหรับอินพุตที่เป็นลบ ทำให้ยูนิตนั้นหยุดเรียนรู้
คำตอบC. เพราะค่าอนุพันธ์สูงสุดคือ 0.25 และถูกคูณซ้ำทุกครั้งที่ย้อนกลับไปทีละเลเยอร์

ปัญหา Vanishing Gradient คือปรากฏการณ์ที่ค่าเกรเดียนต์เข้าใกล้ 0 ระหว่างการแพร่ย้อนกลับ ทำให้เลเยอร์ฝั่งอินพุตไม่ถูกเรียนรู้ ฟังก์ชันซิกมอยด์มีค่าอนุพันธ์สูงสุดเพียง 0.25 เมื่อย้อนกลับไปทีละเลเยอร์จึงถูกคูณด้วยค่าที่ 0.25 หรือน้อยกว่าซ้ำไปเรื่อย ๆ ในโครงข่ายที่ลึกจึงแทบไม่เหลือเกรเดียนต์ สิ่งที่เป็นปัญหาไม่ใช่ค่าเอาต์พุตเอง แต่คือขนาดของอนุพันธ์ การที่เกรเดียนต์เป็น 0 สำหรับอินพุตลบและหยุดเรียนรู้เป็นจุดอ่อนของฟังก์ชัน ReLU ซึ่งฟังก์ชัน Leaky ReLU ถูกสร้างมาเพื่อรับมือกับปัญหานี้ ส่วนการปรับผลรวมเอาต์พุตให้เป็น 1 คือฟังก์ชัน Softmax

ข้อ 4 | ฟังก์ชัน ReLU

ข้อใดอธิบายฟังก์ชัน ReLU ได้อย่างเหมาะสม

  1. เป็นฟังก์ชันรูปตัว S ที่บีบอินพุตให้อยู่ระหว่าง 0 ถึง 1
  2. เป็นฟังก์ชันที่ปรับเอาต์พุตทั้งหมดให้ผลรวมเป็น 1
  3. เป็นฟังก์ชันที่บีบอินพุตให้อยู่ระหว่าง -1 ถึง 1 มีรูปทรงสมมาตรรอบจุดกำเนิด
  4. เป็นฟังก์ชันที่คืนค่าอินพุตตามเดิมถ้าเป็นบวก และคืนค่า 0 ถ้าเป็นลบ
คำตอบD. เป็นฟังก์ชันที่คืนค่าอินพุตตามเดิมถ้าเป็นบวก และคืนค่า 0 ถ้าเป็นลบ

ฟังก์ชัน ReLU เป็นฟังก์ชันง่าย ๆ ที่คืนค่าอินพุตตามเดิมถ้าเป็นบวก และคืนค่า 0 ถ้าเป็นลบ ในช่วงบวกอนุพันธ์เป็น 1 เสมอ แม้ย้อนกลับหลายเลเยอร์เกรเดียนต์ก็ไม่เล็กลง จึงบรรเทาปัญหา Vanishing Gradient ได้มาก แต่ในช่วงลบอนุพันธ์เป็น 0 ทำให้ยูนิตที่เข้าสู่ฝั่งลบไปแล้วอาจหยุดเรียนรู้ จึงมีฟังก์ชัน Leaky ReLU ที่ให้มีความชันเล็กน้อยในฝั่งลบ ฟังก์ชันรูปตัว S ที่บีบให้อยู่ระหว่าง 0 ถึง 1 คือซิกมอยด์ ฟังก์ชันที่สมมาตรรอบจุดกำเนิดในช่วง -1 ถึง 1 คือ tanh ส่วนฟังก์ชันที่ปรับผลรวมเอาต์พุตให้เป็น 1 คือ Softmax

ข้อ 5 | Leaky ReLU

ฟังก์ชัน Leaky ReLU ถูกสร้างขึ้นมาเพื่อรับมือกับจุดใดของฟังก์ชัน ReLU

  1. ผลรวมของเอาต์พุตไม่เป็น 1 จึงตีความเป็นความน่าจะเป็นไม่ได้
  2. เกรเดียนต์เป็น 0 สำหรับอินพุตที่เป็นลบ ทำให้ยูนิตนั้นหยุดเรียนรู้
  3. การคำนวณมีฟังก์ชันเลขชี้กำลังอยู่ ทำให้ประมวลผลแต่ละครั้งหนัก
  4. เกรเดียนต์คงที่ที่ 1 สำหรับอินพุตที่เป็นบวก ทำให้ปริมาณอัปเดตใหญ่เกินไป
คำตอบB. เกรเดียนต์เป็น 0 สำหรับอินพุตที่เป็นลบ ทำให้ยูนิตนั้นหยุดเรียนรู้

ฟังก์ชัน ReLU ให้เอาต์พุตและอนุพันธ์เป็น 0 ในช่วงลบ ดังนั้นหากอินพุตของยูนิตหนึ่งเป็นลบต่อเนื่อง เกรเดียนต์จะไม่ไหลผ่าน ยูนิตนั้นจะไม่ถูกเรียนรู้อีกต่อไป ฟังก์ชัน Leaky ReLU หลีกเลี่ยงทางตันนี้ด้วยการให้มีความชันเล็กน้อยแม้ในฝั่งลบ การที่เกรเดียนต์เป็น 1 ในช่วงบวกเป็นข้อดีของ ReLU ไม่ใช่ข้อเสีย เพราะคุณสมบัตินี้เองที่ป้องกัน Vanishing Gradient การที่ผลรวมเอาต์พุตไม่เป็น 1 เป็นเรื่องปกติของฟังก์ชันกระตุ้น หากต้องการให้อ่านเป็นความน่าจะเป็นในชั้นเอาต์พุตจึงใช้ฟังก์ชัน Softmax การคำนวณที่มีฟังก์ชันเลขชี้กำลังคือซิกมอยด์และ tanh ในขณะที่ ReLU กลับคำนวณเบากว่า

ข้อ 6 | Softmax

จุดที่ใช้ฟังก์ชัน Softmax โดยทั่วไปคือข้อใด

  1. วางไว้ในชั้นเอาต์พุตของปัญหาการถดถอย เพื่อส่งออกค่าต่อเนื่องตามเดิม
  2. ใช้เป็นฟังก์ชันกระตุ้นของเลเยอร์ซ่อน เพื่อให้เลเยอร์มีความไม่เชิงเส้น
  3. วางไว้ในชั้นเอาต์พุตของการจำแนกสองคลาส เพื่อให้ความน่าจะเป็นของคลาสหนึ่ง
  4. วางไว้ในชั้นเอาต์พุตของการจำแนกหลายคลาส เพื่อให้ความน่าจะเป็นของแต่ละคลาส
คำตอบD. วางไว้ในชั้นเอาต์พุตของการจำแนกหลายคลาส เพื่อให้ความน่าจะเป็นของแต่ละคลาส

ฟังก์ชัน Softmax ปรับผลรวมของเอาต์พุตทั้งหมดให้เป็น 1 พอดี จึงวางไว้ในชั้นเอาต์พุตของการจำแนกหลายคลาสที่มีตั้งแต่ 3 คลาสขึ้นไป และให้อ่านเป็นความน่าจะเป็นของแต่ละคลาส โดยพื้นฐานจะใช้คู่กับฟังก์ชันความสูญเสีย Cross Entropy ฟังก์ชันที่วางในชั้นเอาต์พุตของการจำแนกสองคลาสเพื่อให้ความน่าจะเป็นคือซิกมอยด์ ส่วนฟังก์ชันที่ใช้กันแพร่หลายเป็นฟังก์ชันกระตุ้นของเลเยอร์ซ่อนคือ ReLU และ tanh ในปัญหาการถดถอยจะส่งค่าออกตามเดิมในชั้นเอาต์พุต และใช้ฟังก์ชันความสูญเสีย Mean Squared Error

ข้อ 7 | ฟังก์ชันความสูญเสียของการถดถอย

ในปัญหาการถดถอยที่ทำนายค่าต่อเนื่อง เช่น ราคาบ้าน ฟังก์ชันความสูญเสียที่ถือเป็นตัวเลือกพื้นฐานคือข้อใด

  1. Cross Entropy ที่วัดความคลาดเคลื่อนระหว่างการแจกแจงความน่าจะเป็นที่ทำนายกับคำตอบ
  2. Triplet Loss ที่ให้เรียนรู้ความสัมพันธ์ระยะทางของข้อมูลชุดสามตัว
  3. Contrastive Loss ที่ให้เรียนรู้ว่าเป็นสิ่งเดียวกันหรือไม่ด้วยระยะทาง
  4. Mean Squared Error ที่ยกกำลังสองผลต่างระหว่างค่าทำนายกับคำตอบแล้วหาค่าเฉลี่ย
คำตอบD. Mean Squared Error ที่ยกกำลังสองผลต่างระหว่างค่าทำนายกับคำตอบแล้วหาค่าเฉลี่ย

การถดถอยเป็นปัญหาที่ทำนายค่าต่อเนื่อง ตัวเลือกที่ตรงไปตรงมาคือ Mean Squared Error ที่ยกกำลังสองผลต่างระหว่างค่าทำนายกับคำตอบแล้วหาค่าเฉลี่ยตามเดิม Cross Entropy เป็นฟังก์ชันที่วัดความคลาดเคลื่อนระหว่างการแจกแจงความน่าจะเป็น ใช้กับปัญหาการจำแนก ถ้าเป็นการจำแนกหลายคลาสจะใช้คู่กับฟังก์ชัน Softmax ในชั้นเอาต์พุตเป็นรูปแบบพื้นฐาน Triplet Loss เรียนรู้ความสัมพันธ์ระยะทางของข้อมูลชุดสามตัวคือฐาน ตัวอย่างบวก และตัวอย่างลบ ส่วน Contrastive Loss เรียนรู้ว่าข้อมูลสองชิ้นเป็นสิ่งเดียวกันหรือไม่ด้วยระยะทาง ทั้งสองเป็นฟังก์ชันความสูญเสียสำหรับสร้างการแทนค่าที่วัดความคล้ายคลึง การเลือกฟังก์ชันความสูญเสียตามลักษณะงานคือเป้าหมายของหัวข้อกลางนี้

ข้อ 8 | ความสูญเสียของชุดสามตัว

ข้อใดอธิบายฟังก์ชันความสูญเสีย Triplet Loss ได้อย่างเหมาะสม

  1. ยกกำลังสองผลต่างระหว่างค่าทำนายกับคำตอบแล้วหาค่าเฉลี่ย วัดความคลาดเคลื่อนของขนาดค่าโดยตรง
  2. วัดความคลาดเคลื่อนระหว่างการแจกแจงความน่าจะเป็นที่ทำนายกับคำตอบ ใช้กันแพร่หลายในการเรียนรู้การจำแนก
  3. ใช้ข้อมูลชุดสามตัวคือฐาน ตัวอย่างบวก และตัวอย่างลบ ให้ตัวอย่างบวกอยู่ใกล้กว่าตัวอย่างลบ
  4. วัดระยะห่างระหว่างการแจกแจงความน่าจะเป็นสองชุด และทำงานให้การแจกแจงเข้าใกล้กัน
คำตอบC. ใช้ข้อมูลชุดสามตัวคือฐาน ตัวอย่างบวก และตัวอย่างลบ ให้ตัวอย่างบวกอยู่ใกล้กว่าตัวอย่างลบ

Triplet Loss ใช้ข้อมูลชุดสามตัวคือข้อมูลฐาน ข้อมูลประเภทเดียวกัน (ตัวอย่างบวก) และข้อมูลต่างประเภท (ตัวอย่างลบ) โดยฝึกให้ระยะห่างระหว่างฐานกับตัวอย่างบวกน้อยกว่าระยะห่างระหว่างฐานกับตัวอย่างลบ ใช้เมื่อสร้างปริภูมิที่แสดงความคล้ายคลึงด้วยระยะทาง ฟังก์ชันที่วัดระยะห่างระหว่างการแจกแจงความน่าจะเป็นสองชุดคือ Kullback-Leibler Divergence (KL) ฟังก์ชันที่ยกกำลังสองผลต่างระหว่างค่าทำนายกับคำตอบแล้วหาค่าเฉลี่ยคือ Mean Squared Error ส่วนฟังก์ชันที่วัดความคลาดเคลื่อนของการแจกแจงความน่าจะเป็นและใช้แพร่หลายในการจำแนกคือ Cross Entropy นอกจากนี้ Contrastive Loss ที่เรียนรู้ว่าข้อมูลสองชิ้นเหมือนหรือต่างกันก็ถูกจัดอยู่ในหัวข้อกลางเดียวกัน

ข้อ 9 | การแพร่ย้อนกลับของข้อผิดพลาด

ข้อใดอธิบายวิธีการแพร่ย้อนกลับของข้อผิดพลาด (Backpropagation) ได้เหมาะสมที่สุด

  1. เป็นขั้นตอนการอัปเดตเอง ที่เขียนทับน้ำหนักโดยตรงตามลำดับจากชั้นเอาต์พุต
  2. เป็นขั้นตอนที่ขยับน้ำหนักด้วยตัวเลขสุ่มทีละน้อย แล้วเลือกทิศทางที่ความคลาดเคลื่อนลดลง
  3. เป็นขั้นตอนที่คำนวณไปตามลำดับจากฝั่งอินพุตไปฝั่งเอาต์พุตเพื่อหาค่าเอาต์พุต
  4. เป็นขั้นตอนที่ใช้กฎลูกโซ่ ย้อนจากฝั่งเอาต์พุตไปฝั่งอินพุตเพื่อหาเกรเดียนต์
คำตอบD. เป็นขั้นตอนที่ใช้กฎลูกโซ่ ย้อนจากฝั่งเอาต์พุตไปฝั่งอินพุตเพื่อหาเกรเดียนต์

การแพร่ย้อนกลับของข้อผิดพลาดคือวิธีที่ใช้กฎลูกโซ่ ซึ่งแยกอนุพันธ์ของฟังก์ชันประกอบออกเป็นการคูณอนุพันธ์ของแต่ละส่วน แล้วย้อนจากฝั่งเอาต์พุตไปฝั่งอินพุตเพื่อหาเกรเดียนต์ของแต่ละน้ำหนักอย่างมีประสิทธิภาพ สิ่งที่หาได้ในขั้นตอนนี้คือเกรเดียนต์เท่านั้น ส่วนการนำเกรเดียนต์นั้นไปขยับน้ำหนักจริงเป็นหน้าที่ของ Gradient Descent ต้องระวังว่าการบอกว่าการแพร่ย้อนกลับของข้อผิดพลาดคืออัปเดตน้ำหนักนั้นไม่ถูกต้องแม่นยำ การขยับด้วยตัวเลขสุ่มแล้วเลือกทิศทางที่ดีเป็นแนวคิดการค้นหาที่ไม่ใช้เกรเดียนต์ ส่วนการคำนวณจากฝั่งอินพุตไปฝั่งเอาต์พุตคือการแพร่ไปข้างหน้า (Forward Propagation) หรือขั้นตอนการอนุมาน

ข้อ 10 | ปัญหาการจัดสรรความรับผิดชอบ

ปัญหาที่ว่ายูนิตในเลเยอร์ใดควรรับผิดชอบต่อความคลาดเคลื่อนสุดท้ายมากน้อยเพียงใด เรียกว่าอะไร

  1. ปัญหาการจัดสรรความรับผิดชอบ (Credit Assignment Problem)
  2. ปัญหา Exploding Gradient
  3. ปัญหา Vanishing Gradient
  4. คำสาปของมิติ (Curse of Dimensionality)
คำตอบA. ปัญหาการจัดสรรความรับผิดชอบ (Credit Assignment Problem)

ปัญหาการจัดสรรความรับผิดชอบคือปัญหาที่ว่าควรให้ยูนิตในเลเยอร์ใดรับผิดชอบต่อความคลาดเคลื่อนที่ปรากฏในเอาต์พุตมากน้อยเพียงใด การแพร่ย้อนกลับของข้อผิดพลาดถูกวางตำแหน่งว่าทำให้การจัดสรรนี้คำนวณได้ด้วยกฎลูกโซ่ ปัญหา Vanishing Gradient คือปรากฏการณ์ที่เกรเดียนต์เข้าใกล้ 0 ระหว่างย้อนกลับ ทำให้เลเยอร์ฝั่งอินพุตไม่ถูกเรียนรู้ ส่วนปัญหา Exploding Gradient คือปรากฏการณ์ตรงข้ามที่เกรเดียนต์ใหญ่เกินไปจนลู่ออก ทั้งสองอย่างเป็นปัญหาที่เกิดขึ้นเมื่อใช้การแพร่ย้อนกลับของข้อผิดพลาด คำสาปของมิติคือปรากฏการณ์ที่ข้อมูลที่ต้องการเพิ่มขึ้นอย่างรวดเร็วเมื่อมิติของลักษณะเฉพาะเพิ่มขึ้น ในหลักสูตรถูกจัดอยู่ในหัวข้อกลางของการเรียนรู้ของเครื่อง

ข้อ 11 | L1 Regularization

ข้อใดคือคุณลักษณะของ L1 Regularization

  1. ใช้ผลรวมกำลังสองของน้ำหนักเป็นบทลงโทษ ทำให้ค่าเล็กลงเสมอกันแต่ไม่ค่อยเป็น 0
  2. ใช้ผลรวมค่าสัมบูรณ์ของน้ำหนักเป็นบทลงโทษ ทำให้ค่ามีแนวโน้มเป็น 0 พอดี
  3. ปิดการทำงานของยูนิตแบบสุ่มทุกครั้งที่เรียนรู้ เพื่อป้องกันการพึ่งพาที่เอนเอียง
  4. หยุดการเรียนรู้ทันทีที่ความคลาดเคลื่อนของข้อมูลตรวจสอบเริ่มแย่ลง
คำตอบB. ใช้ผลรวมค่าสัมบูรณ์ของน้ำหนักเป็นบทลงโทษ ทำให้ค่ามีแนวโน้มเป็น 0 พอดี

L1 Regularization คือการเพิ่มผลรวมค่าสัมบูรณ์ของน้ำหนักเป็นบทลงโทษเข้าไปในฟังก์ชันความสูญเสีย ทำให้น้ำหนักมีแนวโน้มถูกบีบจนเป็น 0 พอดี ผลที่ตามมาคือค่าสัมประสิทธิ์ของลักษณะเฉพาะที่ไม่ได้ใช้จะเป็น 0 และถูกตัดออกโดยอัตโนมัติ เกิดผลของการเลือกลักษณะเฉพาะ สภาวะนี้เรียกว่า Sparse การใช้ผลรวมกำลังสองของน้ำหนักเป็นบทลงโทษคือ L2 Regularization ซึ่งทำให้ค่าเล็กลงเสมอกันแต่ไม่ค่อยเป็น 0 การปิดการทำงานของยูนิตแบบสุ่มระหว่างเรียนรู้คือ Dropout ส่วนการหยุดเรียนรู้เมื่อความคลาดเคลื่อนของข้อมูลตรวจสอบแย่ลงคือ Early Stopping ทั้งสองอย่างเป็นการรับมือกับ Overfitting แต่กลไกต่างกัน

ข้อ 12 | Ridge Regression

Regularization แบบใดที่ใช้ใน Ridge Regression

  1. L0 Regularization ที่ใช้จำนวนน้ำหนักที่ไม่เป็น 0 เป็นบทลงโทษ
  2. L2 Regularization ที่เพิ่มผลรวมกำลังสองของน้ำหนักเป็นบทลงโทษ
  3. L1 Regularization ที่ใช้ผลรวมค่าสัมบูรณ์ของน้ำหนักเป็นบทลงโทษ
  4. Dropout ที่ปิดการทำงานของยูนิตแบบสุ่มระหว่างเรียนรู้
คำตอบB. L2 Regularization ที่เพิ่มผลรวมกำลังสองของน้ำหนักเป็นบทลงโทษ

Ridge Regression คือวิธีที่ผสาน L2 Regularization เข้ากับการถดถอยเชิงเส้น เนื่องจากเพิ่มผลรวมกำลังสองของน้ำหนักเป็นบทลงโทษ ค่าสัมประสิทธิ์โดยรวมจึงถูกกดให้เล็กลง ป้องกัน Overfitting ได้ ส่วนที่ผสาน L1 Regularization เข้ากับการถดถอยเชิงเส้นคือ Lasso Regression ซึ่งค่าสัมประสิทธิ์มีแนวโน้มเป็น 0 พอดี ได้คำตอบแบบ Sparse ความสัมพันธ์ระหว่าง L1 กับ Lasso และ L2 กับ Ridge มักสับสนกันได้ง่าย ควรจำคู่กันไว้ให้แม่นยำ L0 Regularization เป็นแนวคิดที่ใช้จำนวนน้ำหนักที่ไม่เป็น 0 เองเป็นบทลงโทษ เนื่องจากจำนวนหาอนุพันธ์ไม่ได้จึงยากที่จะนำมาใช้กับการเรียนรู้ที่ใช้เกรเดียนต์ Dropout เป็นวิธี Regularization สำหรับโครงข่ายประสาทเทียม

ข้อ 13 | Dropout

ข้อใดอธิบาย Dropout ได้อย่างเหมาะสม

  1. พลิกภาพซ้ายขวาหรือตัดบางส่วนออก เพื่อเพิ่มปริมาณข้อมูลเรียนรู้เอง
  2. ปิดการทำงานของยูนิตแบบสุ่มในอัตราส่วนหนึ่งระหว่างเรียนรู้ เพื่อลด Overfitting
  3. หยุดการเรียนรู้เมื่อความคลาดเคลื่อนของข้อมูลตรวจสอบเริ่มแย่ลง เพื่อป้องกัน Overfitting
  4. ปรับเอาต์พุตของเลเยอร์กลางภายในมินิแบตช์ให้มีค่าเฉลี่ย 0 ความแปรปรวน 1 เพื่อทำให้การเรียนรู้เสถียร
คำตอบB. ปิดการทำงานของยูนิตแบบสุ่มในอัตราส่วนหนึ่งระหว่างเรียนรู้ เพื่อลด Overfitting

Dropout คือวิธีที่ปิดการทำงานของยูนิตในเลเยอร์ซ่อนแบบสุ่มในอัตราส่วนหนึ่งทุกครั้งที่เรียนรู้ เนื่องจากเรียนรู้ด้วยโครงข่ายที่มีรูปร่างต่างกันเล็กน้อยในแต่ละครั้ง จึงไม่สามารถพึ่งพาชุดยูนิตเฉพาะกลุ่มมากเกินไป และได้ผลคล้ายกับการเฉลี่ยหลายโมเดล การปิดการทำงานจะทำเฉพาะตอนเรียนรู้เท่านั้น ตอนอนุมานจะใช้ยูนิตทั้งหมด แม้ชื่อจะคล้ายกัน แต่ในหลักสูตร Dropout ถูกจัดอยู่ในหมวด Regularization ลำดับที่ 14 ไม่ใช่เลเยอร์ Normalization ลำดับที่ 19 การปรับการแจกแจงภายในมินิแบตช์คือ Batch Normalization การเพิ่มปริมาณข้อมูลคือ Data Augmentation ส่วนการหยุดเมื่อความคลาดเคลื่อนแย่ลงคือ Early Stopping

ข้อ 14 | การเรียนรู้แบบมินิแบตช์

ข้อใดอธิบายการเรียนรู้แบบมินิแบตช์ (Mini-batch Learning) ได้อย่างเหมาะสม

  1. ไม่อัปเดตน้ำหนัก ใช้ค่าที่กำหนดไว้ล่วงหน้าต่อไปเรื่อย ๆ
  2. หาเกรเดียนต์จากข้อมูลฝึกทั้งหมด แล้วอัปเดตน้ำหนักเพียงครั้งเดียว
  3. อัปเดตน้ำหนักทีละกลุ่มขนาดประมาณสิบถึงร้อยรายการ
  4. อัปเดตน้ำหนักทุกครั้งที่ใช้ข้อมูลฝึก 1 รายการ
คำตอบC. อัปเดตน้ำหนักทีละกลุ่มขนาดประมาณสิบถึงร้อยรายการ

การเรียนรู้แบบมินิแบตช์คือวิธีที่แบ่งข้อมูลฝึกออกเป็นกลุ่มขนาดประมาณสิบถึงร้อยรายการ แล้วหาเกรเดียนต์และอัปเดตน้ำหนักทีละกลุ่มนั้น มีลักษณะกึ่งกลาง คือเกรเดียนต์แต่ละครั้งไม่กระจัดกระจายมากเท่าการเรียนรู้แบบออนไลน์ที่อัปเดตทีละรายการ และการคำนวณก็ไม่หนักเท่าการเรียนรู้แบบแบตช์ที่อัปเดตเพียงครั้งเดียวจากข้อมูลทั้งหมด ในทางปฏิบัติจึงใช้วิธีนี้เป็นส่วนใหญ่ Stochastic Gradient Descent (SGD) หาเกรเดียนต์จากข้อมูลเพียงบางส่วน ความผันผวนนี้เองที่มีข้อดีคือหลุดออกจากจุดอานม้าหรือจุดเหมาะสมท้องถิ่นตื้น ๆ ได้ง่าย การไม่อัปเดตน้ำหนักไม่ใช่การเรียนรู้ แต่เป็นเพียงการอนุมานเท่านั้น

ข้อ 15 | Epoch

ความสัมพันธ์ระหว่าง Epoch กับ Iteration ข้อใดถูกต้อง

  1. Epoch คือขนาดของมินิแบตช์ Iteration คือขนาดของอัตราการเรียนรู้
  2. Epoch คือการวนข้อมูลครบ 1 รอบ Iteration คือการอัปเดตน้ำหนัก 1 ครั้ง
  3. Epoch คือการอัปเดตน้ำหนัก 1 ครั้ง Iteration คือการวนข้อมูลครบ 1 รอบ
  4. ทั้ง Epoch และ Iteration ต่างหมายถึงการวนข้อมูลครบ 1 รอบเหมือนกัน
คำตอบB. Epoch คือการวนข้อมูลครบ 1 รอบ Iteration คือการอัปเดตน้ำหนัก 1 ครั้ง

Epoch หมายถึงการวนข้อมูลฝึกทั้งหมดครบ 1 รอบ ส่วน Iteration หมายถึงการอัปเดตน้ำหนัก 1 ครั้ง ทั้งสองเชื่อมโยงกันผ่านขนาดของมินิแบตช์ จำนวน Iteration ต่อ 1 Epoch เท่ากับจำนวนข้อมูลหารด้วยขนาดมินิแบตช์ ตัวอย่างเช่น หากใช้ข้อมูล 3000 รายการกับขนาดมินิแบตช์ 50 แล้ว 1 Epoch จะเท่ากับ 60 Iteration หากขยายขนาดมินิแบตช์ให้ใหญ่ขึ้น เกรเดียนต์แต่ละครั้งจะเสถียรขึ้นแต่จำนวนครั้งการอัปเดตต่อ 1 Epoch จะลดลง หากทำให้เล็กลงการอัปเดตจะเพิ่มขึ้นแต่ความผันผวนจะมากขึ้น ทั้งขนาดมินิแบตช์และอัตราการเรียนรู้เป็นไฮเปอร์พารามิเตอร์ที่มนุษย์กำหนดไว้ล่วงหน้า เป็นแนวคิดคนละอย่างกับ Epoch และ Iteration

ข้อ 16 | จุดอานม้า

ข้อใดอธิบายจุดอานม้า (Saddle Point) ได้อย่างเหมาะสม

  1. เป็นจุดที่ดูเป็นจุดต่ำสุดเมื่อมองจากทิศทางหนึ่ง แต่เป็นจุดสูงสุดเมื่อมองจากอีกทิศทาง
  2. เป็นจุดที่ความคลาดเคลื่อนน้อยที่สุดในบริเวณใกล้เคียง แต่ยังมีจุดที่ดีกว่าในภาพรวม
  3. เป็นบริเวณที่ค่าความคลาดเคลื่อนคงที่ตลอดทั้งช่วง ไม่มีความชันในทิศทางใดเลย
  4. เป็นจุดที่ความคลาดเคลื่อนน้อยที่สุดในบรรดาช่วงค่าที่เป็นไปได้ทั้งหมด
คำตอบA. เป็นจุดที่ดูเป็นจุดต่ำสุดเมื่อมองจากทิศทางหนึ่ง แต่เป็นจุดสูงสุดเมื่อมองจากอีกทิศทาง

จุดอานม้าคือจุดที่เมื่อมองจากทิศทางหนึ่งเป็นก้นหุบเขา แต่เมื่อมองจากอีกทิศทางหนึ่งกลับเป็นยอดเขา ชื่อนี้มาจากรูปทรงคล้ายอานม้า ในดีปเลิร์นนิงที่มีพารามิเตอร์จำนวนมาก มีความเชื่อว่าการติดอยู่ที่จุดอานม้าเกิดขึ้นได้ง่ายกว่าการติดอยู่ที่จุดเหมาะสมท้องถิ่นที่เป็นก้นหุบเขาในทุกทิศทางพร้อมกัน จุดที่ความคลาดเคลื่อนน้อยที่สุดในภาพรวมทั้งหมดคือจุดเหมาะสมสากล จุดที่น้อยที่สุดเฉพาะในบริเวณใกล้เคียงคือจุดเหมาะสมท้องถิ่น Stochastic Gradient Descent (SGD) มีความผันผวนของเกรเดียนต์ จึงหลุดออกจากการติดขัดแบบนี้ได้ง่าย

ข้อ 17 | Adam

Adam เป็นวิธีการปรับให้เหมาะสมที่รวมแนวคิดใดเข้าด้วยกัน

  1. รวมบทลงโทษ 2 ชนิด คือผลรวมค่าสัมบูรณ์และผลรวมกำลังสองของน้ำหนักเข้าด้วยกัน
  2. รวมแนวคิดที่ใช้แรงเฉื่อยกับแนวคิดที่ปรับอัตราการเรียนรู้ให้เหมาะสมเข้าด้วยกัน
  3. สลับใช้การเรียนรู้แบบแบตช์กับแบบออนไลน์สลับกันไปมา
  4. รวมการค้นหา 2 แบบ คือ Grid Search และ Random Search เข้าด้วยกัน
คำตอบB. รวมแนวคิดที่ใช้แรงเฉื่อยกับแนวคิดที่ปรับอัตราการเรียนรู้ให้เหมาะสมเข้าด้วยกัน

Adam คือวิธีการปรับให้เหมาะสมที่รวมแนวคิดของ Momentum ซึ่งบวกปริมาณอัปเดตครั้งก่อนเข้าไปในรูปแบบแรงเฉื่อย เข้ากับแนวคิดของ RMSprop ที่ปรับอัตราการเรียนรู้โดยอัตโนมัติตามแต่ละพารามิเตอร์ ในทางปฏิบัติมักใช้เป็นค่าตั้งต้น สายที่ปรับอัตราการเรียนรู้ให้เหมาะสมเริ่มจาก AdaGrad ซึ่งลดอัตราการเรียนรู้ของพารามิเตอร์ที่มีการอัปเดตมากลงเรื่อย ๆ แต่ก็ลดต่อไปเรื่อย ๆ จนเกินไป RMSprop จึงใช้ค่าเฉลี่ยเคลื่อนที่แบบเลขชี้กำลังมาผ่อนคลายปัญหานี้ ในสายเดียวกันยังมี AdaDelta, AdaBound, AMSBound บทลงโทษต่อน้ำหนักคือเรื่องของ Regularization ส่วน Grid Search และ Random Search คือเรื่องของการค้นหาไฮเปอร์พารามิเตอร์ ทั้งสองไม่ใช่กฎการอัปเดตเอง

ข้อ 18 | No Free Lunch

ทฤษฎีบท No Free Lunch กล่าวถึงเรื่องใด

  1. ไม่มีอัลกอริทึมสารพัดประโยชน์ที่ดีกว่าอัลกอริทึมอื่นในทุกปัญหา
  2. เมื่อมิติของลักษณะเฉพาะเพิ่มขึ้น ข้อมูลเรียนรู้ที่จำเป็นจะเพิ่มขึ้นอย่างรวดเร็ว
  3. ถ้าลดอัตราการเรียนรู้ลงเรื่อย ๆ จะสามารถไปถึงจุดเหมาะสมสากลได้เสมอ
  4. เมื่อทำให้โมเดลใหญ่ขึ้น ความคลาดเคลื่อนจะแย่ลงชั่วคราวก่อนจะลดลงอีกครั้ง
คำตอบA. ไม่มีอัลกอริทึมสารพัดประโยชน์ที่ดีกว่าอัลกอริทึมอื่นในทุกปัญหา

ทฤษฎีบท No Free Lunch กล่าวว่าเมื่อเฉลี่ยทุกปัญหาที่เป็นไปได้แล้ว ไม่มีอัลกอริทึมสารพัดประโยชน์ใดที่ดีกว่าอัลกอริทึมอื่นทั้งหมด ดังนั้นการเลือกวิธีการต้องพิจารณาตามแต่ละปัญหา ไม่มีคำตอบที่ใช้ได้เสมอไม่ว่ากรณีใด การที่ความคลาดเคลื่อนแย่ลงชั่วคราวก่อนจะลดลงอีกครั้งเมื่อทำให้โมเดลใหญ่ขึ้นคือปรากฏการณ์ Double Descent ซึ่งถูกจัดอยู่ในหัวข้อกลางเดียวกัน การที่ข้อมูลที่จำเป็นเพิ่มขึ้นอย่างรวดเร็วเมื่อมิติของลักษณะเฉพาะเพิ่มขึ้นคือคำสาปของมิติ การลดอัตราการเรียนรู้ลงเรื่อย ๆ ไม่มีการรับประกันว่าจะไปถึงจุดเหมาะสมสากลได้เสมอ อาจติดอยู่ที่จุดเหมาะสมท้องถิ่นหรือจุดอานม้าได้

ข้อ 19 | Random Search

ข้อใดอธิบาย Random Search ซึ่งเป็นวิธีค้นหาไฮเปอร์พารามิเตอร์ ได้อย่างเหมาะสม

  1. เรียงค่าตัวเลือกเป็นตาราง แล้วลองทุกชุดค่าผสมตามลำดับ
  2. ปิดการทำงานของยูนิตแบบสุ่มทุกครั้งที่เรียนรู้ เพื่อให้ได้พฤติกรรมเฉลี่ย
  3. หยุดการเรียนรู้ทันทีที่ความคลาดเคลื่อนของข้อมูลตรวจสอบเริ่มแย่ลง
  4. เลือกจุดแบบสุ่มจากภายในช่วงที่ค้นหา แล้วลองชุดค่าผสมนั้น
คำตอบD. เลือกจุดแบบสุ่มจากภายในช่วงที่ค้นหา แล้วลองชุดค่าผสมนั้น

Random Search คือวิธีที่เลือกจุดแบบสุ่มจากภายในช่วงค้นหาไฮเปอร์พารามิเตอร์แล้วลอง ต่างจาก Grid Search ที่เรียงตัวเลือกเป็นตารางแล้วลองทุกชุดค่าผสม เพราะไม่ค่อยเสียการลองผิดลองถูกไปกับไฮเปอร์พารามิเตอร์ที่ไม่ค่อยมีผล จึงสำรวจแกนที่มีผลได้ละเอียดกว่าแม้ใช้จำนวนครั้งเท่ากัน ค่าที่มนุษย์กำหนดไว้ล่วงหน้า เช่น อัตราการเรียนรู้ ขนาดมินิแบตช์ จำนวนเลเยอร์ คือไฮเปอร์พารามิเตอร์ การหยุดเรียนรู้เมื่อความคลาดเคลื่อนของข้อมูลตรวจสอบแย่ลงคือ Early Stopping ส่วนการปิดการทำงานของยูนิตแบบสุ่มระหว่างเรียนรู้คือ Dropout ทั้งสองไม่ใช่วิธีการค้นหา

ข้อ 20 | ปรากฏการณ์ Double Descent

ปรากฏการณ์ที่เมื่อเพิ่มขนาดโมเดลหรือปริมาณการเรียนรู้ ความคลาดเคลื่อนของข้อมูลตรวจสอบจะแย่ลงชั่วคราวก่อนจะลดลงอีกครั้ง เรียกว่าอะไร

  1. ปัญหา Exploding Gradient
  2. การได้มาซึ่งความไม่แปรเปลี่ยน
  3. ปรากฏการณ์ Double Descent
  4. ปัญหาการจัดสรรความรับผิดชอบ
คำตอบC. ปรากฏการณ์ Double Descent

ปรากฏการณ์ Double Descent คือปรากฏการณ์ที่เมื่อเพิ่มขนาดโมเดลหรือปริมาณการเรียนรู้ไปเรื่อย ๆ ความคลาดเคลื่อนของข้อมูลตรวจสอบจะแย่ลงชั่วคราวก่อน แล้วเมื่อเพิ่มต่อไปอีกก็จะเริ่มลดลงอีกครั้ง ชื่อนี้มาจากการที่กราฟความคลาดเคลื่อนลดลง 2 ครั้ง แม้จะขัดกับสัญชาตญาณง่าย ๆ ที่ว่ายิ่งทำให้โมเดลใหญ่ขึ้นยิ่งเกิด Overfitting และแย่ลง แต่ก็ถูกจัดไว้ในหัวข้อวิธีการปรับให้เหมาะสมของหลักสูตรในฐานะกรอบอธิบายประสบการณ์ในปัจจุบันที่ว่าโมเดลใหญ่บางครั้งให้ผลลัพธ์ที่ดีกว่า ปัญหาการจัดสรรความรับผิดชอบคือปัญหาว่าควรให้ยูนิตใดรับผิดชอบต่อความคลาดเคลื่อน ปัญหา Exploding Gradient คือปัญหาที่เกรเดียนต์ลู่ออกระหว่างการแพร่ย้อนกลับ ส่วนการได้มาซึ่งความไม่แปรเปลี่ยนคือบทบาทของเลเยอร์พูลลิง

ข้อ 21 | ชั้นคอนโวลูชัน

เมื่อเทียบกับชั้นเชื่อมต่อเต็มรูปแบบ (Fully Connected Layer) ข้อใดคือคุณลักษณะของชั้นคอนโวลูชัน (Convolutional Layer)

  1. เชื่อมต่อกับทุกยูนิตของเลเยอร์ก่อนหน้า ยิ่งอินพุตใหญ่น้ำหนักยิ่งเพิ่มขึ้น
  2. ใช้ฟิลเตอร์เดียวกันซ้ำโดยเปลี่ยนตำแหน่ง จึงดึงลักษณะเฉพาะได้ด้วยน้ำหนักจำนวนน้อย
  3. ย้อนสถานะของเวลาก่อนหน้ากลับมาเป็นอินพุต จึงจัดการข้อมูลลำดับตามลำดับได้
  4. ไม่มีน้ำหนักที่เรียนรู้เลย นำค่าตัวแทนของพื้นที่มาลดขนาดเอาต์พุตลง
คำตอบB. ใช้ฟิลเตอร์เดียวกันซ้ำโดยเปลี่ยนตำแหน่ง จึงดึงลักษณะเฉพาะได้ด้วยน้ำหนักจำนวนน้อย

ชั้นคอนโวลูชันเลื่อนฟิลเตอร์ขนาดเล็กไปบนอินพุต โดยใช้น้ำหนักเดียวกันซ้ำ ๆ เพื่อดึงลักษณะเฉพาะเฉพาะจุด ด้วยคุณสมบัติ 2 อย่างคือเชื่อมต่อเฉพาะกับองค์ประกอบใกล้เคียง และใช้น้ำหนักเดียวกันแม้เปลี่ยนตำแหน่ง จึงจัดการภาพได้ด้วยพารามิเตอร์ที่น้อยกว่าชั้นเชื่อมต่อเต็มรูปแบบมาก ผลพลอยได้จากการใช้ซ้ำคือสามารถจับเป็นลักษณะเฉพาะแบบเดียวกันได้ ไม่ว่าวัตถุจะปรากฏอยู่ตรงไหนของภาพ การเชื่อมต่อกับทุกยูนิตของเลเยอร์ก่อนหน้าคือชั้นเชื่อมต่อเต็มรูปแบบ การไม่มีน้ำหนักที่เรียนรู้และใช้ค่าตัวแทนคือชั้นพูลลิง การย้อนสถานะเวลาก่อนหน้าคือชั้นการเชื่อมต่อแบบวนซ้ำ ผลลัพธ์จากการผ่านฟิลเตอร์หนึ่งแผ่นคือแผนที่ลักษณะเฉพาะ (Feature Map) ความกว้างในการเลื่อนคือ Stride การเติมขอบคือ Padding

ข้อ 22 | Batch Normalization

ข้อใดอธิบาย Batch Normalization ได้อย่างเหมาะสม

  1. เพิ่มผลรวมกำลังสองของน้ำหนักเป็นบทลงโทษเข้าไปในฟังก์ชันความสูญเสีย ทำให้น้ำหนักเล็กลงเสมอกัน
  2. ปิดการทำงานของยูนิตในอัตราส่วนหนึ่งแบบสุ่มทุกครั้งที่เรียนรู้ เพื่อลดการพึ่งพาที่เอนเอียง
  3. ปรับค่าทั้งเลเยอร์ภายในตัวอย่างเดียวให้เรียบร้อย ไม่ขึ้นกับขนาดของมินิแบตช์
  4. รวมค่าของช่องสัญญาณเดียวกันภายในมินิแบตช์ให้มีค่าเฉลี่ย 0 ความแปรปรวน 1
คำตอบD. รวมค่าของช่องสัญญาณเดียวกันภายในมินิแบตช์ให้มีค่าเฉลี่ย 0 ความแปรปรวน 1

Batch Normalization คือเลเยอร์ Normalization ที่รวมค่าของช่องสัญญาณเดียวกันภายในมินิแบตช์ให้มีค่าเฉลี่ย 0 ความแปรปรวน 1 ทำให้การเรียนรู้เสถียรและเร็วขึ้น จุดอ่อนคือหากขนาดมินิแบตช์เล็กเกินไป ค่าทางสถิติจะเชื่อถือไม่ได้ การปรับค่าทั้งเลเยอร์ภายในตัวอย่างเดียวคือ Layer Normalization ซึ่งไม่ขึ้นกับขนาดมินิแบตช์ จึงมักใช้กับโมเดลที่จัดการข้อมูลลำดับ นอกจากนี้ยังมี Instance Normalization และ Group Normalization รวมทั้ง 4 อย่างนี้อยู่ในเลเยอร์ Normalization ของหลักสูตร หัวข้อกลางนี้เปลี่ยนชื่อจาก Regularization Layer เป็น Normalization Layer ในฉบับ 1.1 L2 Regularization ที่ใช้ผลรวมกำลังสองของน้ำหนักเป็นบทลงโทษ และ Dropout ที่ปิดการทำงานของยูนิต ถูกจัดอยู่ในหมวด Regularization ไม่ใช่เลเยอร์ Normalization

ข้อ 23 | ชั้นพูลลิง

บทบาทที่ชั้นพูลลิง (Pooling Layer) ทำหน้าที่ ข้อใดเหมาะสมที่สุด

  1. ข้ามเลเยอร์แล้วบวกอินพุตเข้าไปในเลเยอร์ถัดไป สร้างเส้นทางให้เกรเดียนต์ไปถึง
  2. ปรับการแจกแจงของเอาต์พุตของเลเยอร์กลางให้เรียบร้อย ทำให้การเรียนรู้เสถียรและเร็วขึ้น
  3. ลดพื้นที่ให้เหลือค่าตัวแทน ทำให้โมเดลทนต่อการเลื่อนตำแหน่งเล็กน้อย
  4. บีบอัดอินพุตให้อยู่ในมิติต่ำ แล้วสามารถคืนค่าอินพุตเดิมกลับมาได้
คำตอบC. ลดพื้นที่ให้เหลือค่าตัวแทน ทำให้โมเดลทนต่อการเลื่อนตำแหน่งเล็กน้อย

ชั้นพูลลิงคือเลเยอร์ที่ลดพื้นที่ขนาดที่กำหนดให้เหลือค่าตัวแทนเพียงหนึ่งค่า มี Max Pooling ที่ใช้ค่าสูงสุดของพื้นที่ และ Average Pooling ที่ใช้ค่าเฉลี่ย ไม่เพียงลดความละเอียดและทำให้การคำนวณเบาลง แต่ยังทำให้ค่าตัวแทนไม่เปลี่ยนง่ายแม้วัตถุจะเลื่อนไปไม่กี่พิกเซล จึงทนต่อการเลื่อนตำแหน่งได้มากขึ้น เรียกสิ่งนี้ว่าการได้มาซึ่งความไม่แปรเปลี่ยน Global Average Pooling (GAP) ที่เฉลี่ยแผนที่ลักษณะเฉพาะทั้งแผ่นให้เหลือค่าเดียวสามารถใช้แทนการซ้อนชั้นเชื่อมต่อเต็มรูปแบบในตอนท้ายเพื่อลดพารามิเตอร์ได้มาก ชั้นพูลลิงไม่มีน้ำหนักที่เรียนรู้เป็นอีกจุดต่างจากชั้นคอนโวลูชัน การข้ามเลเยอร์แล้วบวกเข้าไปคือ Skip Connection การปรับการแจกแจงคือเลเยอร์ Normalization การบีบอัดแล้วคืนค่าคือ Autoencoder

ข้อ 24 | Skip Connection

เหตุใดการนำ Skip Connection มาใช้จึงทำให้การเรียนรู้ดำเนินไปได้แม้ในโครงข่ายที่ลึกมาก

  1. เกิดเส้นทางที่ข้ามเลเยอร์ เกรเดียนต์จึงเดินทางผ่านเส้นทางตื้นไปถึงฝั่งอินพุตได้
  2. ยูนิตถูกปิดการทำงานแบบสุ่ม จึงไม่พึ่งพาเส้นทางเฉพาะกลุ่มอีกต่อไป
  3. การแจกแจงของเอาต์พุตแต่ละเลเยอร์เรียบร้อยขึ้น ความผันผวนของค่าถูกกดในแต่ละเลเยอร์
  4. จำนวนน้ำหนักลดลง ทำให้ไม่เกิด Overfitting ง่ายแม้มีข้อมูลจำกัด
คำตอบA. เกิดเส้นทางที่ข้ามเลเยอร์ เกรเดียนต์จึงเดินทางผ่านเส้นทางตื้นไปถึงฝั่งอินพุตได้

Skip Connection คือการเชื่อมต่อที่ข้ามหลายเลเยอร์และบวกอินพุตเข้ากับเอาต์พุตของเลเยอร์ถัดไปโดยตรง เมื่อแพร่ย้อนกลับ เกรเดียนต์ไม่เพียงเดินทางผ่านเส้นทางยาวที่ผ่านหลายเลเยอร์เท่านั้น แต่ยังเดินทางผ่านเส้นทางสั้นที่ข้ามไปถึงฝั่งอินพุตได้ด้วย จึงไม่เกิด Vanishing Gradient ง่าย ๆ แม้ซ้อนกันลึกมาก ตัวอย่างที่มีชื่อเสียงซึ่งนำแนวคิดนี้มาใช้จนทำให้ความลึกเกิน 100 ชั้นเป็นจริงได้คือ ResNet ในหลักสูตรมีเพียงคำสำคัญ ResNet เท่านั้นที่วางไว้ในหัวข้อกลางของ Skip Connection การปิดการทำงานของยูนิตแบบสุ่มคือ Dropout การปรับการแจกแจงของแต่ละเลเยอร์คือเลเยอร์ Normalization ซึ่งทั้งสองเป็นกลไกที่ต่างจาก Skip Connection Skip Connection ก็ไม่ใช่วิธีลดจำนวนน้ำหนักเช่นกัน

ข้อ 25 | LSTM และ GRU

ข้อใดคือชุดค่าผสมที่ถูกต้องของประตู (Gate) ที่ LSTM และ GRU มี

  1. ทั้ง LSTM และ GRU มีประตูร่วมกัน 2 ประตูคือ Reset และ Update
  2. ทั้ง LSTM และ GRU มีประตูร่วมกัน 3 ประตูคือ Input, Output, Forget
  3. LSTM มี 3 ประตูคือ Input, Output, Forget ส่วน GRU มี 2 ประตูคือ Reset และ Update
  4. LSTM มี 2 ประตูคือ Reset และ Update ส่วน GRU มี 3 ประตูคือ Input, Output, Forget
คำตอบC. LSTM มี 3 ประตูคือ Input, Output, Forget ส่วน GRU มี 2 ประตูคือ Reset และ Update

LSTM มีเส้นทางความจำที่เรียกว่า CEC สำหรับเก็บสะสมข้อมูล และควบคุมการเข้าออกด้วย 3 ประตู ได้แก่ Input Gate ที่กำหนดว่าจะเขียนอะไรลงไป, Forget Gate ที่กำหนดว่าจะทิ้งอะไร, และ Output Gate ที่กำหนดว่าจะส่งอะไรออกไปข้างนอก ด้วยกลไกนี้ทำให้เก็บความสัมพันธ์ระยะยาวไว้ได้ และบรรเทาปัญหา Vanishing Gradient ของโครงข่ายประสาทเทียมแบบวนซ้ำได้มาก GRU เป็นรูปแบบที่ทำให้ LSTM ง่ายขึ้น มีเพียง 2 ประตูคือ Reset Gate และ Update Gate มีพารามิเตอร์น้อยและคำนวณเบา แต่ก็ไม่ได้มีประสิทธิภาพเหนือกว่า LSTM เสมอไป จำนวนประตูที่เป็น 3 กับ 2 และ CEC ที่เป็นศัพท์เฉพาะฝั่ง LSTM คือจุดแยกความแตกต่างที่ถูกถามซ้ำ ๆ

ข้อ 26 | Jordan

โครงสร้างของ Jordan Network ข้อใดเหมาะสม

  1. ย้อนเอาต์พุตของชั้นเอาต์พุตกลับไปเป็นอินพุตของเลเยอร์ซ่อนในเวลาถัดไป
  2. ย้อนเอาต์พุตของเลเยอร์ซ่อนกลับไปเป็นอินพุตของเลเยอร์ซ่อนในเวลาถัดไป
  3. ย้อนเอาต์พุตของชั้นเอาต์พุตกลับไปเป็นอินพุตของชั้นอินพุตในเวลาเดียวกัน
  4. ส่งค่าของชั้นอินพุตข้ามไปบวกที่ชั้นเอาต์พุตโดยตรงตามเดิม
คำตอบA. ย้อนเอาต์พุตของชั้นเอาต์พุตกลับไปเป็นอินพุตของเลเยอร์ซ่อนในเวลาถัดไป

Jordan Network เป็นโครงข่ายประสาทเทียมแบบวนซ้ำที่ย้อนเอาต์พุตของชั้นเอาต์พุตกลับไปเป็นอินพุตของเลเยอร์ซ่อนในเวลาถัดไป ในทางกลับกัน Elman Network ย้อนเอาต์พุตของเลเยอร์ซ่อนกลับไปเป็นเลเยอร์ซ่อนในเวลาถัดไป ความแตกต่างของทั้งสองอยู่ที่ว่าย้อนอะไรกลับไป ทั้งสองเป็นโครงสร้างสำหรับจัดการข้อมูลอนุกรมเวลาตามลำดับเดิม การเรียนรู้ใช้ BPTT ซึ่งขยายโครงข่ายไปตามทิศทางเวลาแล้วจึงใช้การแพร่ย้อนกลับของข้อผิดพลาด ในลำดับที่ยาวจะเกิดปัญหา Vanishing Gradient และ Exploding Gradient รุนแรง จึงใช้ LSTM หรือ GRU ที่มีกลไกประตู การข้ามเลเยอร์แล้วบวกเข้าไปคือ Skip Connection ซึ่งไม่ใช่เรื่องทิศทางเวลา

ข้อ 27 | Attention

ข้อใดอธิบาย Source-Target Attention ได้อย่างเหมาะสม

  1. เป็นกลไกที่คำนวณความแข็งแรงของความเกี่ยวข้องระหว่างองค์ประกอบต่าง ๆ ภายในลำดับเดียวกัน
  2. เป็นกลไกที่คำนวณความแข็งแรงของความเกี่ยวข้องระหว่างลำดับ 2 ชุดที่แยกกัน
  3. เป็นกลไกที่รันวิธีการให้ความสนใจหลายแบบแบบขนาน แล้วรวมผลลัพธ์เข้าด้วยกัน
  4. เป็นกลไกที่บวกสัญญาณเฉพาะของแต่ละตำแหน่งเข้าไป เพื่อให้ข้อมูลลำดับของคำ
คำตอบB. เป็นกลไกที่คำนวณความแข็งแรงของความเกี่ยวข้องระหว่างลำดับ 2 ชุดที่แยกกัน

Attention คือกลไกที่คำนวณว่าควรให้ความสนใจตรงไหนของอินพุตในรูปแบบน้ำหนัก แสดงด้วย Query, Key, Value 3 อย่าง ในจำนวนนี้ Source-Target Attention ใช้ในสถานการณ์ที่ลำดับอินพุตและลำดับเอาต์พุตแยกจากกัน เช่นการแปลภาษา โดยคำนวณความแข็งแรงของความเกี่ยวข้องระหว่างลำดับ 2 ชุดที่แยกกัน ส่วนที่คำนวณความสัมพันธ์ระหว่างองค์ประกอบต่าง ๆ ภายในลำดับเดียวกันคือ Self-Attention ซึ่งเป็นส่วนประกอบหลักของ Transformer การบวกสัญญาณเฉพาะของแต่ละตำแหน่งเพื่อให้ข้อมูลลำดับของคำคือ Positional Encoding และการรันวิธีการให้ความสนใจหลายแบบแบบขนานแล้วรวมผลลัพธ์คือ Multi-Head Attention ทั้งสองเป็นส่วนประกอบอื่นที่ประกอบกันเป็น Transformer

ข้อ 28 | Positional Encoding

ข้อใดอธิบาย Transformer ได้อย่างเหมาะสม

  1. เป็นโมเดลที่บีบอัดอินพุตให้อยู่ในมิติต่ำ แล้วเรียนรู้ให้คืนค่าอินพุตเดิมกลับมาได้
  2. เป็นโมเดลที่ซ้อนคอนโวลูชันกับพูลลิงสลับกัน เพื่อรวบรวมลักษณะเฉพาะเฉพาะจุดทีละขั้น
  3. ประกอบขึ้นด้วย Attention โดยไม่ใช้การเชื่อมต่อแบบวนซ้ำ และให้ข้อมูลลำดับคำด้วย Positional Encoding
  4. เป็นโครงสร้างที่ซ้อนการเชื่อมต่อแบบวนซ้ำ ส่งต่อสถานะของเวลาก่อนหน้าไปตามลำดับ
คำตอบC. ประกอบขึ้นด้วย Attention โดยไม่ใช้การเชื่อมต่อแบบวนซ้ำ และให้ข้อมูลลำดับคำด้วย Positional Encoding

Transformer คือโมเดลลำดับที่ประกอบขึ้นด้วย Attention เป็นหลักโดยไม่ใช้การเชื่อมต่อแบบวนซ้ำ เนื่องจากไม่ต้องรอผลการคำนวณของเวลาก่อนหน้า จึงประมวลผลทั้งลำดับแบบขนานได้ และสามารถจับความสัมพันธ์ระหว่างคำที่อยู่ห่างกันได้ด้วยการคำนวณเพียงครั้งเดียว แต่เมื่อประมวลผลแบบขนาน ข้อมูลลำดับของคำจะหายไป จึงให้ข้อมูลลำดับคำด้วย Positional Encoding ที่บวกสัญญาณเฉพาะของแต่ละตำแหน่งเข้าไป จุดที่มักถูกใช้หลอกคือ Transformer ไม่ใช่โครงข่ายประสาทเทียมแบบวนซ้ำชนิดหนึ่ง การซ้อนการเชื่อมต่อแบบวนซ้ำและส่งต่อสถานะเวลาก่อนหน้าคือ RNN การซ้อนคอนโวลูชันกับพูลลิงคือ CNN การบีบอัดแล้วคืนค่าคือ Autoencoder

ข้อ 29 | VAE

Variational Autoencoder (VAE) ต่างจาก Autoencoder ทั่วไปในจุดใด

  1. บีบอัดอินพุตให้อยู่ในมิติต่ำก่อน แล้วจึงคืนค่าอินพุตเดิมกลับมา
  2. เรียนรู้ปลายทางการบีบอัดเป็นการแจกแจงความน่าจะเป็นแทนที่จะเป็นจุดเดียว จึงสร้างข้อมูลใหม่ได้
  3. เรียนรู้ได้โดยไม่ต้องเตรียมป้ายกำกับที่ถูกต้อง
  4. เรียนรู้ทีละเลเยอร์ตามลำดับ เพื่อสร้างค่าเริ่มต้นของโครงข่ายที่ลึก
คำตอบB. เรียนรู้ปลายทางการบีบอัดเป็นการแจกแจงความน่าจะเป็นแทนที่จะเป็นจุดเดียว จึงสร้างข้อมูลใหม่ได้

Variational Autoencoder (VAE) เรียนรู้ปลายทางที่บีบอัดอินพุตให้เหลือไม่ใช่จุดเดียว แต่เป็นการแจกแจงความน่าจะเป็น หากดึงค่าจากการแจกแจงนั้นมาคืนค่ากลับ ก็จะสร้างข้อมูลใหม่ที่ไม่เคยมีในข้อมูลเรียนรู้ได้ จึงถูกจัดเป็นโมเดลกำเนิด การบีบอัดให้อยู่ในมิติต่ำก่อนแล้วคืนค่ากลับ และการเรียนรู้ได้โดยไม่ต้องมีป้ายกำกับที่ถูกต้อง เป็นคุณสมบัติร่วมกับ Autoencoder ทั่วไป ไม่ใช่ลักษณะเฉพาะของ VAE เท่านั้น การเรียนรู้ทีละเลเยอร์ตามลำดับเพื่อสร้างค่าเริ่มต้นของโครงข่ายที่ลึกคือการเรียนรู้ล่วงหน้าด้วย Stacked Autoencoder ในหลักสูตรยังมี VQ-VAE, info VAE, β-VAE อยู่ในหัวข้อกลางเดียวกันด้วย

ข้อ 30 | Mixup

ในบรรดาวิธีเพิ่มปริมาณข้อมูลภาพ (Data Augmentation) การทำงานของ Mixup คือข้อใด

  1. ตัดบางส่วนของภาพออกมาแล้วขยาย เพื่อสร้างเป็นตัวอย่างใหม่
  2. ซ้อนภาพ 2 ภาพเข้าด้วยกัน เพื่อสร้างเป็นตัวอย่างใหม่ 1 ภาพ
  3. พลิกภาพซ้ายขวา เพื่อสร้างตัวอย่างที่มีทิศทางต่างกัน
  4. ทาสีทับบางส่วนของภาพเป็นรูปสี่เหลี่ยม เพื่อซ่อนข้อมูลของส่วนนั้น
คำตอบB. ซ้อนภาพ 2 ภาพเข้าด้วยกัน เพื่อสร้างเป็นตัวอย่างใหม่ 1 ภาพ

Mixup เป็นวิธีเพิ่มปริมาณข้อมูลที่ซ้อนภาพ 2 ภาพเข้าด้วยกันในอัตราส่วนหนึ่ง และผสมป้ายกำกับที่ถูกต้องในอัตราส่วนเดียวกัน เพื่อสร้างข้อมูลเรียนรู้ใหม่ CutMix ที่ชื่อคล้ายกันไม่ได้ซ้อนภาพ แต่ตัดแปะบางส่วนของภาพ 2 ภาพให้เป็นภาพเดียว การทาสีทับบางส่วนของภาพเป็นรูปสี่เหลี่ยมคือ Cutout หรือ Random Erasing การพลิกซ้ายขวาคือ Random Flip การตัดบางส่วนออกมาคือ Crop นอกจากนี้ยังมี Rotate ที่หมุนภาพ, Brightness ที่เปลี่ยนความสว่าง, Contrast ที่เปลี่ยนคอนทราสต์, RandAugument ที่กำหนดโดยอัตโนมัติว่าจะใช้การแปลงแบบใดมากน้อยเพียงใด และสำหรับข้อความมี paraphrasing กับ noising สิ่งสำคัญคือต้องเลือกการแปลงที่ไม่ทำลายความหมาย

ข้อ 31 | GoogLeNet

ข้อใดคือคุณลักษณะของ GoogLeNet

  1. ใช้ Inception Module ที่ใช้ฟิลเตอร์ขนาดต่างกันแบบขนาน
  2. ชนะการแข่งขัน ILSVRC ปี 2012 ใช้ฟังก์ชัน ReLU และการเรียนรู้ด้วย GPU
  3. นำ Skip Connection ที่ข้ามเลเยอร์มาใช้ ทำให้ได้ความลึกเกิน 100 ชั้น
  4. ซ้อนคอนโวลูชันขนาดเล็ก 3 คูณ 3 เท่านั้น ทำให้ได้โครงสร้างที่ลึก
คำตอบA. ใช้ Inception Module ที่ใช้ฟิลเตอร์ขนาดต่างกันแบบขนาน

GoogLeNet ใช้ Inception Module ที่ใช้ฟิลเตอร์ขนาดต่างกันแบบขนานแล้วรวมผลลัพธ์เข้าด้วยกัน ทำให้ได้โครงสร้างที่ลึกในขณะที่กดพารามิเตอร์ไว้ต่ำ โมเดลที่ซ้อนคอนโวลูชันขนาดเล็ก 3 คูณ 3 เท่านั้นด้วยโครงสร้างที่เรียบง่ายแต่ลึกคือ VGG ซึ่งเข้ารอบสูงในการแข่งขัน ILSVRC ปี 2014 เดียวกับ GoogLeNet โมเดลที่นำ Skip Connection ที่ข้ามเลเยอร์มาใช้จนได้ความลึกเกิน 100 ชั้นคือ ResNet ส่วนโมเดลที่ชนะการแข่งขัน ILSVRC ปี 2012 โดยผสาน ReLU, Dropout และการเรียนรู้ด้วย GPU คือ AlexNet หลังจากนั้นได้ขยายไปสู่ Wide ResNet, DenseNet, SENet, EfficientNet, MobileNet และยังมี Vision Transformer ที่นำแนวคิดของ Transformer มาใช้โดยไม่ใช้คอนโวลูชันด้วย

ข้อ 32 | การตรวจจับแบบขั้นตอนเดียว

ข้อใดคือคุณลักษณะร่วมของ YOLO และ SSD

  1. ตรวจจับวัตถุด้วยขั้นตอน 2 ขั้น คือหาพื้นที่ผู้สมัครก่อนแล้วจึงจำแนก
  2. กำหนดคลาสให้กับแต่ละพิกเซล เพื่อระบายสีแบ่งพื้นที่ของภาพ
  3. รวมการดึงพื้นที่ผู้สมัครและการจำแนกไว้ในการอนุมานครั้งเดียว เน้นความเร็ว
  4. ประมาณตำแหน่งข้อต่อของร่างกายมนุษย์ เพื่อหาท่าทาง
คำตอบC. รวมการดึงพื้นที่ผู้สมัครและการจำแนกไว้ในการอนุมานครั้งเดียว เน้นความเร็ว

YOLO และ SSD เป็นโมเดลตรวจจับวัตถุแบบขั้นตอนเดียวที่รวมการดึงพื้นที่ผู้สมัครและการตัดสินคลาสไว้ในการอนุมานครั้งเดียว จุดเด่นคือความเร็ว ในทางตรงกันข้าม สายที่เริ่มจาก R-CNN แล้วพัฒนาไปเป็น Fast R-CNN, Faster R-CNN เป็นวิธีแบบ 2 ขั้นตอนที่หาพื้นที่ผู้สมัครก่อนแล้วจึงจำแนก ช้ากว่าแต่ให้ความแม่นยำสูงกว่า การกำหนดคลาสให้แต่ละพิกเซลคือ Semantic Segmentation ซึ่งมี FCN, SegNet, U-Net, PSPNet, DeepLab เป็นตัวอย่างหลัก ส่วน Instance Segmentation ที่แยกวัตถุคลาสเดียวกันออกเป็นแต่ละตัวคือ Mask R-CNN และการประมาณท่าทางที่หาตำแหน่งข้อต่อของร่างกายมนุษย์คือ OpenPose เป็นตัวแทน

ข้อ 33 | BERT

ข้อใดอธิบาย BERT ได้อย่างเหมาะสม

  1. ทำการจับคู่ภาพและข้อความอธิบายให้อยู่ในปริภูมิเวกเตอร์เดียวกัน เพื่อเชื่อมโยงทั้งสองเข้าด้วยกัน
  2. ย้อนกระบวนการเพิ่มสัญญาณรบกวนกลับ เพื่อสร้างข้อมูลขึ้นมาทีละน้อย
  3. ใช้ Encoder ของ Transformer มองบริบทจากทั้งสองทิศทางหน้าและหลัง
  4. ซ้อนชั้นการเชื่อมต่อแบบวนซ้ำ อ่านคำทีละคำตามลำดับเพื่อสร้างบริบท
คำตอบC. ใช้ Encoder ของ Transformer มองบริบทจากทั้งสองทิศทางหน้าและหลัง

BERT เป็นโมเดลภาษาที่ใช้ Encoder ของ Transformer จุดเด่นคือเรียนรู้ล่วงหน้าโดยมองบริบทของประโยคจากทั้งสองทิศทางหน้าและหลัง เป็นผู้เผยแพร่แนวทางการใช้งานที่เรียนรู้ล่วงหน้าจากข้อความจำนวนมากแล้วปรับใช้กับงานเฉพาะแต่ละอย่าง การซ้อนชั้นการเชื่อมต่อแบบวนซ้ำและอ่านคำตามลำดับคือโมเดลที่ใช้โครงข่ายประสาทเทียมแบบวนซ้ำ ซึ่ง Transformer ไม่มีการเชื่อมต่อแบบวนซ้ำ การจับคู่ภาพและข้อความอธิบายให้อยู่ในปริภูมิเวกเตอร์เดียวกันคือ CLIP ซึ่งในหลักสูตรถูกจัดอยู่ในหมวด Multimodal การย้อนกระบวนการเพิ่มสัญญาณรบกวนกลับเพื่อสร้างข้อมูลคือ Diffusion Model ซึ่งอยู่ในหัวข้อกลางของการสร้างข้อมูล

ข้อ 34 | CBOW

ทิศทางที่ CBOW ของ word2vec เรียนรู้ ข้อใดเหมาะสม

  1. เรียนรู้เพื่อทายคำตรงกลางจากคำที่ปรากฏอยู่รอบ ๆ
  2. เรียนรู้เพื่อทายคำที่ปรากฏอยู่รอบ ๆ จากคำตรงกลาง
  3. เรียนรู้เพื่อทายว่าประโยคทั้งหมดเป็นเชิงบวกหรือเชิงลบ
  4. เรียนรู้เพื่อทายว่าประโยคครึ่งหลังจะตามมาหรือไม่จากประโยคครึ่งแรก
คำตอบA. เรียนรู้เพื่อทายคำตรงกลางจากคำที่ปรากฏอยู่รอบ ๆ

CBOW เป็นวิธีที่เรียนรู้เพื่อทายคำตรงกลางจากคำที่ปรากฏอยู่รอบ ๆ ในทางกลับกัน Skip-gram เรียนรู้เพื่อทายคำรอบ ๆ จากคำตรงกลาง ทิศทางตรงข้ามกันจึงต้องระวังไม่สับสน ทั้งสองเป็นวิธีของ word2vec มีจุดประสงค์เพื่อให้ได้การแทนค่าแบบกระจาย (Distributed Representation) ที่แทนคำด้วยเวกเตอร์หนาแน่น ต่างจาก One-hot Vector ที่กำหนดมิติหนึ่งให้กับหนึ่งคำ ซึ่งมิติจะเท่ากับขนาดคำศัพท์และไม่สามารถแสดงความใกล้ชิดระหว่างคำได้ ในขณะที่การแทนค่าแบบกระจายจะวางคำที่มีความหมายใกล้เคียงกันไว้ใกล้กันในปริภูมิเวกเตอร์ การทายว่าประโยคเป็นเชิงบวกหรือเชิงลบคืองานประยุกต์ที่เรียกว่าการวิเคราะห์ความรู้สึก ไม่ใช่เรื่องวิธีการเรียนรู้การแทนค่าคำ

ข้อ 35 | RLHF

วิธีที่สร้างโมเดลรางวัลจากผลตอบรับของมนุษย์ แล้วปรับโมเดลด้วยการเรียนรู้แบบเสริมกำลัง คือข้อใด

  1. DQN
  2. A3C
  3. PPO
  4. RLHF
คำตอบD. RLHF

RLHF คือวิธีที่สร้างโมเดลรางวัลจากการประเมินความชอบที่มนุษย์ให้ไว้ แล้วใช้เป็นรางวัลในการปรับโมเดลด้วยการเรียนรู้แบบเสริมกำลัง เป็นที่รู้จักในการปรับแต่งโมเดลภาษา แต่ในหลักสูตรถูกจัดอยู่ในหัวข้อกลางของการเรียนรู้แบบเสริมกำลังเชิงลึก ไม่ใช่การประมวลผลภาษาธรรมชาติ ซึ่งเป็นจุดที่คาดไม่ถึงและควรจำไว้ให้แม่น DQN คือวิธีการเรียนรู้แบบเสริมกำลังเชิงลึกที่เป็นตัวแทนซึ่งประมาณฟังก์ชันค่าการกระทำด้วยโครงข่ายประสาทเทียม PPO คือวิธีการเรียนรู้นโยบายที่กดขอบเขตการอัปเดตนโยบายให้เสถียร ส่วน A3C คือวิธีที่รันสภาพแวดล้อมหลายชุดแบบขนานเพื่อดำเนินการเรียนรู้ ในหัวข้อกลางเดียวกันยังมี Double DQN, Dueling Network, Rainbow, APE-X, Agent57 อีกด้วย

ข้อ 36 | Diffusion

ข้อใดอธิบาย Diffusion Model ได้อย่างเหมาะสม

  1. เรียนรู้การมองเห็นแบบ 3 มิติจากภาพถ่ายหลายมุมมอง แล้วสร้างภาพจากมุมมองใหม่
  2. เรียนรู้ปลายทางการบีบอัดเป็นการแจกแจงความน่าจะเป็น แล้วดึงค่ามาคืนค่ากลับ
  3. ให้โครงข่าย 2 ชุดแข่งขันกัน เพื่อสร้างข้อมูลที่ดูเหมือนของจริง
  4. ย้อนกระบวนการเพิ่มสัญญาณรบกวนทีละขั้นกลับ เพื่อสร้างข้อมูล
คำตอบD. ย้อนกระบวนการเพิ่มสัญญาณรบกวนทีละขั้นกลับ เพื่อสร้างข้อมูล

Diffusion Model คือโมเดลกำเนิดที่สร้างข้อมูลเป้าหมายจากสัญญาณรบกวนด้วยการย้อนกระบวนการเพิ่มสัญญาณรบกวนลงในข้อมูลทีละน้อยกลับ กลไกแตกต่างอย่างสิ้นเชิงจาก Generative Adversarial Network (GAN) ที่ให้โครงข่าย 2 ชุดแข่งขันกันเพื่อเรียนรู้ จึงไม่ใช่ GAN ชนิดหนึ่ง จาก GAN มี DCGAN, CycleGAN, Pix2Pix แตกแขนงออกมา การเรียนรู้การมองเห็นแบบ 3 มิติจากภาพถ่ายหลายมุมมองคือ NeRF ส่วนการเรียนรู้ปลายทางการบีบอัดเป็นการแจกแจงความน่าจะเป็นคือ Variational Autoencoder (VAE) ควรจัดระเบียบไว้ว่า GAN, VAE, Diffusion Model เป็นสายที่แยกจากกันวางขนานกัน

ข้อ 37 | การเรียนรู้แบบถ่ายโอน

ความแตกต่างระหว่างการเรียนรู้แบบถ่ายโอน (Transfer Learning) กับ Fine-tuning ข้อใดเหมาะสม

  1. การเรียนรู้แบบถ่ายโอนเรียนรู้น้ำหนักทั้งหมดใหม่ ส่วน Fine-tuning เรียนรู้เฉพาะชั้นเอาต์พุตเท่านั้น
  2. ทั้งการเรียนรู้แบบถ่ายโอนและ Fine-tuning ต่างเรียนรู้น้ำหนักตั้งแต่ต้นโดยไม่มีการเรียนรู้ล่วงหน้า
  3. การเรียนรู้แบบถ่ายโอนเรียนรู้บริเวณใกล้ชั้นเอาต์พุตเป็นหลัก ส่วน Fine-tuning เรียนรู้ใหม่ในช่วงกว้าง
  4. การเรียนรู้แบบถ่ายโอนใช้ได้เฉพาะภาพ ส่วน Fine-tuning ใช้ได้เฉพาะภาษาเท่านั้น
คำตอบC. การเรียนรู้แบบถ่ายโอนเรียนรู้บริเวณใกล้ชั้นเอาต์พุตเป็นหลัก ส่วน Fine-tuning เรียนรู้ใหม่ในช่วงกว้าง

การเรียนรู้แบบถ่ายโอนคือวิธีที่ตรึงส่วนที่ดึงลักษณะเฉพาะของโมเดลที่เรียนรู้ล่วงหน้าไว้คงเดิม แล้วเรียนรู้เฉพาะบริเวณใกล้ชั้นเอาต์พุตเป็นหลักด้วยงานใหม่ ส่วน Fine-tuning คือการเรียนรู้น้ำหนักทั้งหมดหรือในช่วงกว้างใหม่ด้วยข้อมูลใหม่ ต้องการข้อมูลและการคำนวณมากกว่า แต่มักได้ผลดีกว่าเมื่อขอบเขตเป้าหมายต่างจากข้อมูลที่เรียนรู้ล่วงหน้ามาก ใน Fine-tuning อาจเกิด Catastrophic Forgetting ที่ความสามารถเดิมของโมเดลสูญหายไปได้ ทั้งสองวิธีตั้งอยู่บนสมมติฐานว่ามีโมเดลที่เรียนรู้ล่วงหน้าแล้ว ไม่ได้เรียนรู้ตั้งแต่ต้น และไม่ได้แบ่งการใช้งานตามชนิดของข้อมูลที่จัดการ

ข้อ 38 | Foundation Model

คำว่า Foundation Model ถูกวางไว้ในหัวข้อกลางใดของหลักสูตร

  1. อยู่ในการเรียนรู้แบบถ่ายโอนและ Fine-tuning เรียงคู่กับ Few-shot
  2. อยู่ใน Multimodal เรียงคู่กับ CLIP และ DALL-E
  3. อยู่ในการเรียนรู้แบบเสริมกำลังเชิงลึก เรียงคู่กับ DQN และ RLHF
  4. อยู่ในการประมวลผลภาษาธรรมชาติ เรียงคู่กับ Large Language Model (LLM)
คำตอบB. อยู่ใน Multimodal เรียงคู่กับ CLIP และ DALL-E

Foundation Model คือคำที่หมายถึงโมเดลขนาดใหญ่ที่เรียนรู้ล่วงหน้าด้วยข้อมูลจำนวนมากและนำไปใช้กับงานปลายทางที่หลากหลายได้ ในหลักสูตรถูกวางไว้ในหัวข้อกลางที่ 32 Multimodal เรียงคู่กับ CLIP, DALL-E, Flamingo, Unified-IO, Zero-shot คำศัพท์ในกลุ่ม Generative AI ถูกกระจายอยู่ตามที่ต่าง ๆ Large Language Model (LLM) อยู่ในหัวข้อที่ 27 การประมวลผลภาษาธรรมชาติ ส่วน RLHF อยู่ในหัวข้อที่ 29 การเรียนรู้แบบเสริมกำลังเชิงลึก คำที่เรียงคู่ในหัวข้อที่ 31 การเรียนรู้แบบถ่ายโอน・Fine-tuning ได้แก่ Few-shot, One-shot, การเรียนรู้แบบมีผู้สอนด้วยตนเอง, โมเดลที่เรียนรู้ล่วงหน้าแล้ว, Catastrophic Forgetting เป็นต้น การจดจำว่าหัวข้อกลางใดวางอะไรไว้จะช่วยให้เห็นภาพรวมของขอบเขตได้ง่ายขึ้น

ข้อ 39 | SHAP

แนวคิดของ SHAP ซึ่งเป็นวิธี Explainable AI (XAI) ข้อใดเหมาะสม

  1. สลับค่าลักษณะเฉพาะโดยตั้งใจ แล้ววัดความสำคัญจากความแม่นยำที่ลดลง
  2. แสดงว่ามองส่วนไหนของภาพในการตัดสินใจ ในรูปแบบคล้ายแผนที่ความร้อน
  3. สร้างโมเดลง่าย ๆ มาประมาณใกล้ ๆ กับการทำนาย แล้วอธิบายด้วยค่าสัมประสิทธิ์นั้น
  4. ใช้แนวคิดทฤษฎีเกมเชิงร่วมมือ จัดสรรการมีส่วนร่วมของแต่ละลักษณะเฉพาะให้เห็น
คำตอบD. ใช้แนวคิดทฤษฎีเกมเชิงร่วมมือ จัดสรรการมีส่วนร่วมของแต่ละลักษณะเฉพาะให้เห็น

SHAP คือวิธีที่ยืมแนวคิดที่ใช้ในทฤษฎีเกมเชิงร่วมมือมาจัดสรรการมีส่วนร่วมของแต่ละลักษณะเฉพาะต่อการทำนายอย่างเป็นธรรมและแสดงให้เห็น การแสดงว่ามองส่วนไหนของภาพในการตัดสินใจในรูปแบบคล้ายแผนที่ความร้อนคือ CAM หรือ Grad-CAM การสลับค่าลักษณะเฉพาะโดยตั้งใจแล้ววัดความสำคัญจากความแม่นยำที่ลดลงคือ Permutation Importance ส่วนการสร้างโมเดลง่าย ๆ มาประมาณใกล้กับการทำนายแต่ละครั้งแล้วอธิบายด้วยค่าสัมประสิทธิ์นั้นคือ LIME ทั้งหมดนี้ถูกจัดอยู่ในหัวข้อที่ 33 ความสามารถในการตีความของโมเดล การรวบรวมความพยายามที่จะแสดงเหตุผลของการตัดสินใจในรูปแบบที่มนุษย์เข้าใจได้เรียกว่า Explainable AI (XAI)

ข้อ 40 | สมมติฐานสลากกินแบ่ง

เนื้อหาของสมมติฐานสลากกินแบ่ง (Lottery Ticket Hypothesis) ที่เกี่ยวกับการลดขนาดโมเดล ข้อใดเหมาะสม

  1. แนวคิดที่ว่า ถ้าให้โมเดลขนาดเล็กเรียนรู้ตามเอาต์พุตของโมเดลครูขนาดใหญ่ ก็สามารถรักษาประสิทธิภาพไว้ได้
  2. แนวคิดที่ว่า ในโครงข่ายขนาดใหญ่มีส่วนย่อยที่แม้เรียนรู้เดี่ยว ๆ ก็ให้ประสิทธิภาพเทียบเท่ากันอยู่
  3. แนวคิดที่ว่า ยิ่งทำให้โมเดลใหญ่ขึ้น ข้อมูลเรียนรู้ที่จำเป็นก็จะเพิ่มขึ้นแบบเลขชี้กำลัง
  4. แนวคิดที่ว่า แม้ลดความละเอียดของตัวเลขที่แทนน้ำหนัก ประสิทธิภาพก็ลดลงเพียงเล็กน้อยเท่านั้น
คำตอบB. แนวคิดที่ว่า ในโครงข่ายขนาดใหญ่มีส่วนย่อยที่แม้เรียนรู้เดี่ยว ๆ ก็ให้ประสิทธิภาพเทียบเท่ากันอยู่

สมมติฐานสลากกินแบ่งคือสมมติฐานที่ว่าในโครงข่ายขนาดใหญ่มีโครงข่ายย่อยที่เปรียบเสมือนสลากที่ถูกรางวัลซ่อนอยู่ ซึ่งแม้ดึงออกมาเรียนรู้เดี่ยว ๆ ก็ยังให้ประสิทธิภาพเทียบเท่ากับโครงข่ายทั้งหมด ถูกอธิบายเป็นภูมิหลังว่าทำไม Pruning ที่ตัดการเชื่อมต่อหรือเลเยอร์ที่มีส่วนร่วมน้อยออกจึงทำงานได้ดี การให้โมเดลขนาดเล็กเรียนรู้ตามเอาต์พุตของโมเดลครูขนาดใหญ่คือ Distillation การลดความละเอียดของตัวเลขที่แทนน้ำหนักคือ Quantization ทั้งสามอย่างนี้รวมกับ Pruning คือวิธีลดขนาดในหลักสูตร เรียกรวมกันว่า Model Compression การที่ข้อมูลที่จำเป็นเพิ่มขึ้นอย่างรวดเร็วคือคำสาปของมิติ ตัวอย่างทั่วไปที่ต้องการการลดขนาดคือ Edge AI ที่รันการอนุมานบนฝั่งอุปกรณ์ปลายทาง

ฝึกทำ: ทำโจทย์ในหน้านี้

เครื่องมือฝึกทำโจทย์แบบสุ่มคำถาม (ทำงานเมื่อเปิดใช้ JavaScript) โจทย์และคำอธิบายด้านบนสามารถอ่านได้ทั้งหมดตามปกติ

※ คำอธิบายเป็นข้อมูลเพื่อการเรียนรู้ ขอบเขตข้อสอบและระบบการสอบอาจเปลี่ยนแปลงในแต่ละปี โปรดตรวจสอบประกาศอย่างเป็นทางการของหน่วยงานผู้จัดสอบเสมอ

หน้านี้แปลจากต้นฉบับภาษาญี่ปุ่น หากเนื้อหาของคำแปลและต้นฉบับไม่ตรงกัน ให้ถือฉบับภาษาญี่ปุ่นเป็นหลัก ดูต้นฉบับภาษาญี่ปุ่น