ห้องเรียนรู้ Karinoya

คุณวุฒิ · แล็บสอบผ่าน Cloud / AI / Python

วิธีการเรียนรู้ของเครื่องและการประเมินผล

อ่านโจทย์และคำอธิบายเป็นไทยได้ ส่วนบทบรรยาย (บทความอธิบาย) มีเฉพาะฉบับภาษาญี่ปุ่นเท่านั้น

ดูฉบับภาษาญี่ปุ่น (มีบทบรรยาย) →

ข้อ 1 | การใช้งานของ Logistic Regression

ข้อความเกี่ยวกับ Logistic Regression ข้อใดถูกต้อง

  1. ใช้ในการปรับปรุงวิธีการเลือกการกระทำโดยอาศัยรางวัลเป็นเบาะแส
  2. ใช้กับปัญหาการถดถอยตามชื่อ และให้ผลลัพธ์เป็นค่าต่อเนื่องโดยตรง
  3. แม้ชื่อจะขัดกัน แต่ใช้กับปัญหาการจำแนก และให้ผลลัพธ์เป็นความน่าจะเป็นที่จะอยู่ในแต่ละคลาส
  4. ใช้ในการค้นหากลุ่มก้อนของข้อมูลโดยไม่ใช้ข้อมูลสอน
คำตอบC. แม้ชื่อจะขัดกัน แต่ใช้กับปัญหาการจำแนก และให้ผลลัพธ์เป็นความน่าจะเป็นที่จะอยู่ในแต่ละคลาส

Logistic Regression มีคำว่า "Regression" (การถดถอย) อยู่ในชื่อ แต่เป็นวิธีการจำแนกที่แปลงผลการคำนวณเชิงเส้นให้เป็นรูปแบบความน่าจะเป็นเพื่อตัดสินคลาส การพยากรณ์ค่าต่อเนื่องโดยตรงเป็นวิธีการของปัญหาการถดถอย เช่น การถดถอยเชิงเส้น ซึ่งเป็นความผิดพลาดที่พบบ่อยจากการเลือกตามชื่อ การค้นหากลุ่มก้อนโดยไม่ใช้ข้อมูลสอนคือการทำคลัสเตอร์ในการเรียนรู้แบบไม่มีผู้สอน ส่วนการปรับปรุงการเลือกการกระทำด้วยรางวัลคือการเรียนรู้แบบเสริมกำลัง ซึ่งทั้งสองนี้อยู่ในหัวข้อย่อยอื่น

ข้อ 2 | การถดถอยกับการจำแนก

ความแตกต่างระหว่างปัญหาการถดถอยกับปัญหาการจำแนกในการเรียนรู้แบบมีผู้สอน ข้อใดถูกต้อง

  1. ปัญหาการถดถอยใช้ข้อมูลสอน ปัญหาการจำแนกเรียนรู้จากรางวัลเพียงอย่างเดียว
  2. ปัญหาการถดถอยพยากรณ์คลาสแบบไม่ต่อเนื่อง ปัญหาการจำแนกพยากรณ์ค่าต่อเนื่อง
  3. ปัญหาการถดถอยพยากรณ์ค่าต่อเนื่อง ปัญหาการจำแนกพยากรณ์คลาสแบบไม่ต่อเนื่อง
  4. ปัญหาการถดถอยใช้เฉพาะคุณลักษณะ ปัญหาการจำแนกใช้ทั้งคุณลักษณะและข้อมูลสอน
คำตอบC. ปัญหาการถดถอยพยากรณ์ค่าต่อเนื่อง ปัญหาการจำแนกพยากรณ์คลาสแบบไม่ต่อเนื่อง

ปัญหาการถดถอยพยากรณ์ค่าต่อเนื่องเช่นยอดขายหรืออุณหภูมิ ส่วนปัญหาการจำแนกพยากรณ์คลาสแบบไม่ต่อเนื่อง เช่น เป็นอีเมลขยะหรือไม่ คำอธิบายที่สลับสองอย่างนี้เป็นความผิดพลาดที่พบบ่อยที่สุด การเรียนรู้แบบมีผู้สอนต้องใช้คู่ของคุณลักษณะกับข้อมูลสอนไม่ว่าจะเป็นปัญหาแบบใด จึงไม่มีกรณีที่ใช้เพียงคุณลักษณะอย่างเดียว การเรียนรู้จากรางวัลเพียงอย่างเดียวคือการเรียนรู้แบบเสริมกำลัง ไม่ใช่คำอธิบายของการเรียนรู้แบบมีผู้สอน

ข้อ 3 | การถดถอยเชิงเดี่ยวและพหุคูณ

ความแตกต่างระหว่างการวิเคราะห์การถดถอยเชิงเดี่ยวกับการวิเคราะห์การถดถอยพหุคูณ ข้อใดถูกต้อง

  1. การถดถอยเชิงเดี่ยวไม่ต้องใช้ข้อมูลสอน การถดถอยพหุคูณต้องใช้ข้อมูลสอน
  2. การถดถอยเชิงเดี่ยวมีตัวแปรอธิบายหลายตัว การถดถอยพหุคูณมีตัวแปรอธิบาย 1 ตัว
  3. การถดถอยเชิงเดี่ยวมีตัวแปรอธิบาย 1 ตัว การถดถอยพหุคูณมีตัวแปรอธิบายหลายตัว
  4. การถดถอยเชิงเดี่ยวใช้กับการจำแนก การถดถอยพหุคูณใช้พยากรณ์ค่าต่อเนื่อง
คำตอบC. การถดถอยเชิงเดี่ยวมีตัวแปรอธิบาย 1 ตัว การถดถอยพหุคูณมีตัวแปรอธิบายหลายตัว

การถดถอยที่มีตัวแปรอธิบาย 1 ตัวคือการถดถอยเชิงเดี่ยว ส่วนที่มีตัวแปรอธิบายตั้งแต่ 2 ตัวขึ้นไปคือการถดถอยพหุคูณ คำว่า "เดี่ยว" และ "พหุ" แสดงจำนวนตัวแปรอธิบายอยู่แล้วโดยตรง จึงทราบว่าคำอธิบายที่สลับกันเป็นความผิดพลาด ทั้งสองเป็นวิธีการถดถอยที่พยากรณ์ค่าต่อเนื่อง จึงไม่มีข้อความที่ว่าฝ่ายหนึ่งเป็นการจำแนก และการวิเคราะห์การถดถอยเป็นการเรียนรู้แบบมีผู้สอน จึงต้องใช้ข้อมูลสอนไม่ว่าจำนวนตัวแปรจะเป็นเท่าใด

ข้อ 4 | การขยายมาร์จิ้นสูงสุด

แนวคิดที่ Support Vector Machine (SVM) ใช้ในการกำหนดขอบเขต ข้อใดถูกต้อง

  1. เพิ่มน้ำหนักให้กับข้อมูลที่จำแนกผิดพลาด แล้วลากขอบเขตใหม่ซ้ำไปเรื่อย ๆ
  2. ลากขอบเขตให้ผ่านจุดกึ่งกลางของเส้นตรงที่เชื่อมจุดศูนย์กลางของแต่ละคลาส
  3. ลากขอบเขตในตำแหน่งที่ระยะห่างกับจุดข้อมูลที่ใกล้ที่สุดมีค่ามากที่สุด
  4. ลากขอบเขตให้สอดคล้องกับทิศทางที่ความแปรปรวนของตัวแปรอธิบายมีค่ามากที่สุด
คำตอบC. ลากขอบเขตในตำแหน่งที่ระยะห่างกับจุดข้อมูลที่ใกล้ที่สุดมีค่ามากที่สุด

SVM ใช้การขยายมาร์จิ้นสูงสุด กล่าวคือลากขอบเขตในตำแหน่งที่ระยะห่างกับจุดข้อมูลที่ใกล้ที่สุดมีค่ามากที่สุด จุดที่ใกล้ที่สุดนี้เรียกว่าซัพพอร์ตเวกเตอร์ การเพิ่มน้ำหนักให้ข้อมูลที่จำแนกผิดพลาดแล้วเพิ่มตัวเรียนรู้เข้าไปเรื่อย ๆ คือแนวคิดของบูสติ้ง ส่วนการหาทิศทางที่ความแปรปรวนมีค่ามากที่สุดคือแนวคิดของการวิเคราะห์องค์ประกอบหลัก (PCA) ซึ่งทั้งสองไม่ใช่คำอธิบายของ SVM วิธีที่ลากผ่านจุดกึ่งกลางของจุดศูนย์กลางไม่ได้คำนึงถึงมาร์จิ้นเลย

ข้อ 5 | Kernel Trick

สิ่งที่ Kernel Trick ทำให้เป็นไปได้ ข้อใดถูกต้อง

  1. การแยกแบบไม่เชิงเส้นได้โดยไม่ต้องคำนวณพิกัดจริงหลังฉายไปยังมิติที่สูงขึ้น
  2. การคำนวณคุณลักษณะที่มิติสูงจริงทีละตัวก่อนแล้วจึงแยกแบบเชิงเส้น
  3. การแบ่งข้อมูลออกเป็นหลายกลุ่มก้อนโดยอัตโนมัติโดยไม่ใช้ข้อมูลสอน
  4. การลดจำนวนข้อมูลที่ใช้ในการเรียนรู้ลงอย่างมากเพื่อให้เร็วขึ้น
คำตอบA. การแยกแบบไม่เชิงเส้นได้โดยไม่ต้องคำนวณพิกัดจริงหลังฉายไปยังมิติที่สูงขึ้น

Kernel Trick คือการหาผลคูณภายใน (Inner Product) หลังการฉายไปยังพื้นที่มิติสูงโดยตรงด้วยฟังก์ชันเคอร์เนล ทำให้สามารถแยกแบบไม่เชิงเส้นได้โดยไม่ต้องคำนวณพิกัดจริงหลังการฉาย การไม่ต้องคำนวณพิกัดทีละตัวนี้เองที่เป็นเหตุผลที่เรียกว่า "ทริก" ดังนั้นคำอธิบายที่ว่าคำนวณจริงก่อนแล้วจึงแยกจึงมีทิศทางที่กลับกัน การแบ่งกลุ่มโดยไม่ใช้ข้อมูลสอนคือเรื่องของการทำคลัสเตอร์ และไม่ใช่กลไกที่ลดจำนวนข้อมูลที่ใช้ในการเรียนรู้

ข้อ 6 | แบบขนานและแบบต่อเนื่อง

ความแตกต่างระหว่าง Bagging กับ Boosting ในการเรียนรู้แบบรวมกลุ่ม (Ensemble Learning) ข้อใดถูกต้อง

  1. Bagging ใช้ได้เฉพาะกับต้นไม้ตัดสินใจ ส่วน Boosting ใช้ได้เฉพาะกับการถดถอยเชิงเส้น
  2. Bagging เรียนรู้ตัวเรียนรู้อ่อนแบบต่อเนื่อง ส่วน Boosting เรียนรู้แบบขนาน
  3. Bagging เรียนรู้ตัวเรียนรู้อ่อนแบบขนาน ส่วน Boosting เรียนรู้แบบต่อเนื่อง
  4. Bagging ไม่ใช้ข้อมูลสอน ส่วน Boosting ใช้ข้อมูลสอน
คำตอบC. Bagging เรียนรู้ตัวเรียนรู้อ่อนแบบขนาน ส่วน Boosting เรียนรู้แบบต่อเนื่อง

Bagging สร้างตัวเรียนรู้แบบขนานและเป็นอิสระต่อกันจากข้อมูลฝึกที่สร้างด้วยการสุ่มตัวอย่างแบบ Bootstrap แล้วนำมาลงคะแนนเสียงข้างมากหรือหาค่าเฉลี่ย Boosting เพิ่มตัวเรียนรู้ทีละตัวแบบต่อเนื่อง โดยให้น้ำหนักกับตัวอย่างที่ตัวเรียนรู้ก่อนหน้าทำผิดพลาดมากขึ้น จึงขึ้นอยู่กับลำดับและไม่สามารถสร้างแบบขนานได้ การสลับแบบขนานกับแบบต่อเนื่องนี้เป็นความผิดพลาดที่พบบ่อยที่สุด ทั้งสองเป็นการเรียนรู้แบบมีผู้สอนที่ใช้ข้อมูลสอน และไม่ได้จำกัดชนิดของตัวเรียนรู้อ่อนไว้เฉพาะต้นไม้ตัดสินใจหรือการถดถอยเชิงเส้น

ข้อ 7 | Random Forest

วิธีการเรียนรู้ของ Random Forest ข้อใดถูกต้อง

  1. ปลูกต้นไม้ตัดสินใจต้นเดียวให้ลึกที่สุดเท่าที่ทำได้ แล้วปรับจำนวนกิ่งให้เท่ากันในตอนสุดท้าย
  2. เพิ่มต้นไม้ตัดสินใจทีละต้นแบบต่อเนื่อง โดยให้น้ำหนักกับตัวอย่างที่ต้นไม้ก่อนหน้าทำผิดพลาดมากขึ้น
  3. เรียนรู้ต้นไม้ตัดสินใจจำนวนมากแบบขนานจากข้อมูลที่สร้างด้วยการสุ่มตัวอย่างแบบ Bootstrap
  4. ไม่ใช้ต้นไม้ตัดสินใจ แต่หาค่าเฉลี่ยผลพยากรณ์ของการถดถอยเชิงเส้นหลายตัวเพื่อได้ผลลัพธ์
คำตอบC. เรียนรู้ต้นไม้ตัดสินใจจำนวนมากแบบขนานจากข้อมูลที่สร้างด้วยการสุ่มตัวอย่างแบบ Bootstrap

Random Forest เป็นตัวอย่างของ Bagging ที่สร้างข้อมูลฝึกที่ต่างกันเล็กน้อยด้วยการสุ่มตัวอย่างแบบ Bootstrap ซึ่งเป็นการสุ่มตัวอย่างที่ยอมให้ซ้ำได้ แล้วเรียนรู้ต้นไม้ตัดสินใจจำนวนมากแบบขนานและเป็นอิสระต่อกัน จากนั้นลงคะแนนเสียงข้างมากหรือหาค่าเฉลี่ย การเพิ่มต้นไม้ทีละต้นแบบต่อเนื่องโดยให้น้ำหนักกับความผิดพลาดของต้นก่อนหน้าคือคำอธิบายของฝั่ง Boosting เช่น Gradient Boosting ซึ่งการสลับตรงนี้เป็นความผิดพลาดที่พบบ่อย ต้นไม้ที่ใช้ไม่ใช่ต้นเดียวแต่เป็นจำนวนมาก และสิ่งที่รวมกันคือต้นไม้ตัดสินใจไม่ใช่การถดถอยเชิงเส้น

ข้อ 8 | จุดอ่อนของต้นไม้ตัดสินใจ

ข้อความเกี่ยวกับคุณสมบัติของต้นไม้ตัดสินใจ ข้อใดถูกต้อง

  1. ยิ่งแตกกิ่งลึกขึ้น ความสอดคล้องกับข้อมูลฝึกจะยิ่งแย่ลงเสมอ
  2. เป็นวิธีที่ไม่ต้องใช้ข้อมูลสอน จึงไม่สามารถใช้ได้ทั้งการจำแนกและการถดถอย
  3. เงื่อนไขของการแตกกิ่งอ่านไม่ออกด้วยตามนุษย์ แต่เกิด Overfitting ได้ยาก
  4. เงื่อนไขของการแตกกิ่งอ่านออกได้ด้วยมนุษย์ แต่หากใช้เพียงตัวเดียวจะเกิด Overfitting ได้ง่าย
คำตอบD. เงื่อนไขของการแตกกิ่งอ่านออกได้ด้วยมนุษย์ แต่หากใช้เพียงตัวเดียวจะเกิด Overfitting ได้ง่าย

ต้นไม้ตัดสินใจเป็นวิธีที่เรียงเงื่อนไขการแตกกิ่งของคุณลักษณะเป็นรูปทรงต้นไม้ จุดแข็งคือมนุษย์สามารถอ่านได้ว่าเงื่อนไขใดนำไปสู่ทิศทางใด แต่ในทางกลับกัน ยิ่งปลูกต้นไม้ลึกเท่าใด ก็ยิ่งจดจำความเบี้ยวเล็กน้อยของข้อมูลฝึก ทำให้เกิด Overfitting ได้ง่ายหากใช้เพียงตัวเดียว การแตกกิ่งลึกขึ้นจะทำให้ความสอดคล้องกับข้อมูลฝึกดีขึ้นด้วยซ้ำ แต่ปัญหาคือกลับแย่ลงเมื่อเจอข้อมูลใหม่ ดังนั้นข้อความที่ว่าความสอดคล้องจะแย่ลงเสมอจึงไม่ถูกต้อง ต้นไม้ตัดสินใจเป็นการเรียนรู้แบบมีผู้สอน และใช้ได้ทั้งการจำแนกและการถดถอย

ข้อ 9 | AR กับ VAR

ความสัมพันธ์ระหว่างโมเดลถดถอยตนเอง (AR Model) กับโมเดลถดถอยตนเองแบบเวกเตอร์ (VAR Model) ข้อใดถูกต้อง

  1. AR ดึงคุณลักษณะเฉพาะที่ของรูปภาพ ส่วน VAR ดึงองค์ประกอบความถี่ของเสียง
  2. AR จัดการอนุกรมเวลาหลายชุดพร้อมกัน ส่วน VAR อธิบายอนุกรมเวลาเพียงชุดเดียวด้วยค่าในอดีต
  3. AR ไม่ต้องใช้ข้อมูลสอน ส่วน VAR ต้องใช้ข้อมูลสอน
  4. AR อธิบายอนุกรมเวลาชุดเดียวด้วยค่าในอดีตของตนเอง ส่วน VAR อธิบายอนุกรมเวลาหลายชุดด้วยค่าในอดีตของกันและกัน
คำตอบD. AR อธิบายอนุกรมเวลาชุดเดียวด้วยค่าในอดีตของตนเอง ส่วน VAR อธิบายอนุกรมเวลาหลายชุดด้วยค่าในอดีตของกันและกัน

โมเดล AR อธิบายค่าปัจจุบันของอนุกรมเวลา 1 ชุดด้วยค่าในอดีตของอนุกรมนั้นเอง โมเดล VAR ขยายแนวคิดนี้ไปยังอนุกรมเวลาหลายชุด โดยอธิบายด้วยค่าในอดีตของกันและกัน ความแตกต่างจึงอยู่ที่จำนวนอนุกรมว่าเป็นชุดเดียวหรือหลายชุด คำอธิบายที่สลับกันจึงผิดพลาด ทั้งสองเป็นโมเดลที่จัดการอนุกรมเวลา ไม่ใช่เครื่องมือดึงคุณลักษณะเฉพาะที่ของรูปภาพหรือองค์ประกอบความถี่ของเสียง และไม่ได้แยกกันด้วยความจำเป็นในการใช้ข้อมูลสอน

ข้อ 10 | การจำแนกหลายคลาส

ข้อใดตรงกับการจำแนกหลายคลาส (Multi-Class Classification)

  1. จัดสรรภาพตัวเลขที่เขียนด้วยลายมือให้เป็นตัวเลขใดตัวเลขหนึ่งตั้งแต่ 0 ถึง 9
  2. เลือกการเดินหมากถัดไปใหม่จากสถานะของกระดานโดยอาศัยรางวัล
  3. ค้นหากลุ่มก้อนของลูกค้าที่คล้ายกันจากประวัติการซื้อของลูกค้า
  4. พยากรณ์ค่าอุณหภูมิสูงสุดของวันพรุ่งนี้จากอุณหภูมิและความชื้น
คำตอบA. จัดสรรภาพตัวเลขที่เขียนด้วยลายมือให้เป็นตัวเลขใดตัวเลขหนึ่งตั้งแต่ 0 ถึง 9

การจำแนกหลายคลาสคือปัญหาการจำแนกที่ทายว่าอยู่ในคลาสใดจากคลาสที่มีตั้งแต่ 3 คลาสขึ้นไป โดยงานที่จัดสรรภาพตัวเลขลายมือให้เป็นตัวเลขใดตัวเลขหนึ่งตั้งแต่ 0 ถึง 9 เป็นตัวอย่างคลาสสิก การทายค่าต่อเนื่องอย่างอุณหภูมิสูงสุดเป็นปัญหาการถดถอย ไม่ใช่การจำแนก การค้นหากลุ่มก้อนของลูกค้าที่คล้ายกันคือการทำคลัสเตอร์ในการเรียนรู้แบบไม่มีผู้สอน ส่วนการเลือกการเดินหมากใหม่จากรางวัลคือการเรียนรู้แบบเสริมกำลัง ซึ่งทั้งสองไม่ใช่ปัญหาการจำแนกในการเรียนรู้แบบมีผู้สอนตั้งแต่แรก

ข้อ 11 | อินพุตของแบบไม่มีผู้สอน

คำอธิบายของการเรียนรู้แบบไม่มีผู้สอน ข้อใดถูกต้อง

  1. ให้เฉพาะคุณลักษณะ แล้วค้นหาโครงสร้างหรือกฎเกณฑ์ที่มีอยู่ในตัวข้อมูลเอง
  2. ให้คู่ของคุณลักษณะและข้อมูลสอน แล้วลดความแตกต่างจากคำตอบที่ถูกต้อง
  3. ใช้เฉพาะข้อมูลที่มีคำตอบที่ถูกต้องจำนวนน้อย ส่วนที่เหลือจะทิ้งไปแล้วเรียนรู้ต่อ
  4. ปรับปรุงวิธีการเลือกการกระทำโดยอาศัยรางวัลที่ได้รับจากสิ่งแวดล้อมเป็นเบาะแส
คำตอบA. ให้เฉพาะคุณลักษณะ แล้วค้นหาโครงสร้างหรือกฎเกณฑ์ที่มีอยู่ในตัวข้อมูลเอง

หลักสูตรตั้งเป้าหมายไว้ว่า "เข้าใจว่าการเรียนรู้แบบไม่มีผู้สอนต้องการเพียงคุณลักษณะเท่านั้น" การเรียนรู้แบบไม่มีผู้สอนคือการค้นหาโครงสร้างที่มีอยู่ในตัวข้อมูลเองด้วยการทำคลัสเตอร์หรือการลดมิติ โดยไม่มีป้ายกำกับคำตอบที่ถูกต้อง การให้คู่ของคุณลักษณะและข้อมูลสอนเป็นสมมติฐานของการเรียนรู้แบบมีผู้สอน การอาศัยรางวัลเป็นเบาะแสคือการเรียนรู้แบบเสริมกำลัง ซึ่งทั้งสองถูกวางไว้ในหัวข้อย่อยอื่น ขั้นตอนที่ทิ้งข้อมูลที่เหลือไปก็ไม่ใช่คำอธิบายของการเรียนรู้แบบไม่มีผู้สอนเช่นกัน

ข้อ 12 | วิธี k-means

ขั้นตอนการดำเนินการของวิธี k-means ข้อใดถูกต้อง

  1. กำหนดจำนวนคลัสเตอร์ล่วงหน้า แล้วทำซ้ำการปรับปรุงจุดศูนย์กลางกับการจัดสรร
  2. ให้ป้ายกำกับที่ถูกต้อง แล้วขยายมาร์จิ้นของขอบเขตให้มากที่สุด
  3. ไม่กำหนดจำนวนคลัสเตอร์ แล้วรวมกลุ่มที่ใกล้กันเข้าด้วยกันตามลำดับ
  4. ประเมินสัดส่วนของหัวข้อที่แฝงอยู่ในเอกสารจากการปรากฏของคำ
คำตอบA. กำหนดจำนวนคลัสเตอร์ล่วงหน้า แล้วทำซ้ำการปรับปรุงจุดศูนย์กลางกับการจัดสรร

วิธี k-means กำหนดจำนวนคลัสเตอร์ k ไว้ล่วงหน้า แล้วทำซ้ำการจัดสรรแต่ละจุดไปยังจุดศูนย์กลางที่ใกล้ที่สุด และการคำนวณจุดศูนย์กลางใหม่ เป็นการทำคลัสเตอร์แบบไม่เป็นลำดับชั้น การรวมกลุ่มที่ใกล้กันเข้าด้วยกันตามลำดับโดยไม่กำหนดจำนวนคลัสเตอร์ล่วงหน้าคือวิธีวอร์ด (Ward) เป็นต้น ซึ่งเป็นการทำคลัสเตอร์แบบลำดับชั้นและสามารถวาดเดนโดรแกรม (ผังต้นไม้) ได้ การขยายมาร์จิ้นคือ SVM ซึ่งเป็นการเรียนรู้แบบมีผู้สอน ส่วนการประเมินสัดส่วนหัวข้อจากการปรากฏของคำคือโมเดลหัวข้ออย่างวิธี Latent Dirichlet Allocation (LDA)

ข้อ 13 | วิธีวอร์ด

ความสัมพันธ์ระหว่างวิธีวอร์ด (Ward) กับเดนโดรแกรม (ผังต้นไม้) ข้อใดถูกต้อง

  1. เป็นวิธีการลดมิติ และวาดแกน 2 แกนหลังการลดมิติเป็นผังต้นไม้
  2. เป็นวิธีการทำคลัสเตอร์แบบลำดับชั้น และสามารถวาดขั้นตอนการรวมกลุ่มเป็นผังต้นไม้ได้
  3. เป็นวิธีการเรียนรู้แบบมีผู้สอน และวาดขอบเขตการจำแนกเป็นผังต้นไม้
  4. เป็นวิธีการทำคลัสเตอร์แบบไม่เป็นลำดับชั้น และไม่สามารถวาดผังต้นไม้ได้ในหลักการ
คำตอบB. เป็นวิธีการทำคลัสเตอร์แบบลำดับชั้น และสามารถวาดขั้นตอนการรวมกลุ่มเป็นผังต้นไม้ได้

วิธีวอร์ดเป็นการทำคลัสเตอร์แบบลำดับชั้นที่รวมกลุ่มที่ใกล้กันเข้าด้วยกันตามลำดับ และสามารถวาดขั้นตอนการรวมกลุ่มนั้นเป็นเดนโดรแกรม (ผังต้นไม้) ได้ ข้อดีคือสามารถตัดสินใจภายหลังได้ว่าจะตัดที่ความสูงใดเพื่อกำหนดจำนวนคลัสเตอร์ วิธีที่กำหนดจำนวนคลัสเตอร์ล่วงหน้าแบบไม่เป็นลำดับชั้นคือวิธี k-means ซึ่งไม่สร้างผังต้นไม้ วิธีวอร์ดไม่ใช่วิธีการลดมิติหรือการเรียนรู้แบบมีผู้สอน และไม่ใช้ป้ายกำกับที่ถูกต้อง

ข้อ 14 | PCA กับ t-SNE

ความแตกต่างระหว่างการวิเคราะห์องค์ประกอบหลัก (PCA) กับ t-SNE ข้อใดถูกต้อง

  1. PCA เป็นการลดมิติแบบเชิงเส้น ส่วน t-SNE เป็นแบบไม่เชิงเส้นและเหมาะกับการแสดงผล
  2. PCA ต้องใช้ข้อมูลสอน ส่วน t-SNE ทำงานได้ด้วยคุณลักษณะเพียงอย่างเดียว
  3. PCA เป็นการลดมิติแบบไม่เชิงเส้น ส่วน t-SNE เป็นแบบเชิงเส้นและเหมาะกับการแสดงผล
  4. PCA ประเมินหัวข้อของเอกสาร ส่วน t-SNE แยกส่วนเมทริกซ์
คำตอบA. PCA เป็นการลดมิติแบบเชิงเส้น ส่วน t-SNE เป็นแบบไม่เชิงเส้นและเหมาะกับการแสดงผล

PCA เป็นการลดมิติแบบเชิงเส้นที่ปรับแกนใหม่ไปในทิศทางที่ความแปรปรวนมีค่ามากที่สุด ส่วน t-SNE เป็นวิธีแบบไม่เชิงเส้นที่ฉายลงมิติต่ำโดยรักษาความใกล้ของจุดที่อยู่ใกล้กันไว้ มักใช้ในการแสดงผลแบบ 2 หรือ 3 มิติ การสลับเชิงเส้นกับไม่เชิงเส้นเป็นความผิดพลาดที่พบบ่อยที่สุด การประเมินหัวข้อของเอกสารคือโมเดลหัวข้ออย่าง Latent Dirichlet Allocation (LDA) การแยกส่วนเมทริกซ์คือ Singular Value Decomposition (SVD) ทั้ง PCA และ t-SNE เป็นการเรียนรู้แบบไม่มีผู้สอน จึงไม่ต้องใช้ข้อมูลสอน

ข้อ 15 | Cold Start

ปัญหา Cold Start ในการกรองแบบร่วมมือ (Collaborative Filtering) คือข้อใด

  1. สินค้าที่แนะนำหมดสต็อก จึงไม่สามารถส่งมอบให้ผู้ใช้ได้
  2. การแนะนำจะเอนเอียงหากใช้เพียงข้อความบรรยายสินค้าเป็นเบาะแส
  3. ผู้ใช้ที่มีประวัติมากเกินไปทำให้การคำนวณการแนะนำไม่เสร็จสิ้น
  4. ไม่สามารถแนะนำได้ดีให้กับผู้ใช้หรือสินค้าที่ยังไม่มีประวัติ
คำตอบD. ไม่สามารถแนะนำได้ดีให้กับผู้ใช้หรือสินค้าที่ยังไม่มีประวัติ

การกรองแบบร่วมมือใช้ความคล้ายกันของการประเมินระหว่างผู้ใช้ด้วยกันหรือสินค้าด้วยกันเป็นเบาะแสในการแนะนำ จึงไม่มีเบาะแสสำหรับผู้ใช้ใหม่หรือสินค้าใหม่ที่ยังไม่มีประวัติการประเมิน ทำให้แนะนำได้ยาก นี่คือปัญหา Cold Start การกรองแบบใช้เนื้อหา (Content-Based Filtering) ที่ใช้ข้อความบรรยายสินค้าหรือคุณลักษณะเองเป็นเบาะแส มักถูกกล่าวถึงในฐานะแนวทางที่ช่วยชดเชยจุดอ่อนนี้ ไม่ใช่เรื่องของเวลาในการคำนวณหรือสต็อกสินค้า

ข้อ 16 | สัญญาณของการเรียนรู้แบบเสริมกำลัง

สิ่งที่การเรียนรู้แบบเสริมกำลังใช้เป็นเบาะแสในการเรียนรู้ ข้อใดถูกต้อง

  1. สัญญาณรางวัลที่ได้รับจากสิ่งแวดล้อม
  2. จำนวนครั้งที่คำปรากฏในเอกสาร
  3. ป้ายกำกับที่ถูกต้องที่มนุษย์ให้ไว้ทีละรายการ
  4. เพียงระยะห่างระหว่างคุณลักษณะเท่านั้น
คำตอบA. สัญญาณรางวัลที่ได้รับจากสิ่งแวดล้อม

การเรียนรู้แบบเสริมกำลังโต้ตอบกับสิ่งแวดล้อมด้วยการลองผิดลองถูก แล้วเรียนรู้นโยบายที่ทำให้ผลรวมของรางวัลที่ได้รับมีค่ามากขึ้น เบาะแสไม่ใช่ป้ายกำกับที่ถูกต้องทีละครั้ง แต่เป็นรางวัล จึงไม่ใช่การเรียนรู้แบบมีผู้สอนประเภทหนึ่ง การใช้เพียงระยะห่างเป็นเบาะแสเป็นแนวคิดของการทำคลัสเตอร์ในการเรียนรู้แบบไม่มีผู้สอน ส่วนจำนวนครั้งที่คำปรากฏเป็นเรื่องของการแทนคุณลักษณะในการประมวลผลภาษาธรรมชาติ ซึ่งทั้งสองไม่ใช่สัญญาณการเรียนรู้ของการเรียนรู้แบบเสริมกำลัง อีกทั้งการใช้อัตราคิดลดเพื่อประเมินอนาคตในกรณีที่รางวัลไม่คืนกลับมาทันที ก็เป็นลักษณะเฉพาะของกรอบแนวคิดนี้เช่นกัน

ข้อ 17 | ค่าและนโยบาย

คำอธิบายของ 2 แนวทางหลักในการเรียนรู้แบบเสริมกำลัง ข้อใดถูกต้อง

  1. มีเพียงวิธีเรียนรู้ฟังก์ชันค่าเท่านั้น นโยบายจะถูกกำหนดโดยอัตโนมัติจากฟังก์ชันค่า
  2. มีทั้งวิธีเรียนรู้ฟังก์ชันค่าและวิธีเรียนรู้นโยบายโดยตรง และ Actor-Critic คือวิธีที่มีทั้งสองอย่างรวมกัน
  3. มีเพียงวิธีเรียนรู้นโยบายโดยตรงเท่านั้น ฟังก์ชันค่าไม่สามารถใช้ระหว่างการเรียนรู้ได้
  4. ทั้งฟังก์ชันค่าและนโยบายเป็นสิ่งที่มนุษย์ออกแบบด้วยมือ ไม่ใช่เป้าหมายของการเรียนรู้
คำตอบB. มีทั้งวิธีเรียนรู้ฟังก์ชันค่าและวิธีเรียนรู้นโยบายโดยตรง และ Actor-Critic คือวิธีที่มีทั้งสองอย่างรวมกัน

หลักสูตรตั้งเป้าหมายไว้ว่า "เข้าใจ 2 แนวทางหลัก คือการเรียนรู้ฟังก์ชันค่าและการเรียนรู้นโยบาย" แนวทางแรกคือการประเมินฟังก์ชันค่าสถานะหรือฟังก์ชันค่าการกระทำก่อนแล้วจึงเลือกการกระทำ ตัวแทนคือ Q-Learning และ SARSA แนวทางที่สองคือการแทนนโยบายด้วยพารามิเตอร์แล้วอัปเดตโดยตรง ตัวแทนคือ Policy Gradient และ REINFORCE Actor-Critic รวม Actor ที่รับผิดชอบนโยบายและ Critic ที่รับผิดชอบค่าเข้าด้วยกัน จึงมีทั้งสองอย่าง คำอธิบายที่ว่ามีเพียงอย่างเดียว หรือไม่ใช่เป้าหมายของการเรียนรู้ ล้วนไม่ถูกต้อง

ข้อ 18 | Q-Learning กับ SARSA

ความแตกต่างระหว่าง Q-Learning กับ SARSA ข้อใดถูกต้อง

  1. Q-Learning ใช้ค่าของการกระทำที่เลือกจริง ส่วน SARSA ใช้ค่าการกระทำที่มากที่สุดในสถานะถัดไป
  2. Q-Learning ต้องใช้ข้อมูลสอน ส่วน SARSA อัปเดตโดยไม่ใช้ข้อมูลสอน
  3. Q-Learning ไม่ใช้ฟังก์ชันค่าการกระทำ มีเพียง SARSA เท่านั้นที่อัปเดตฟังก์ชันค่าการกระทำ
  4. Q-Learning ใช้ค่าการกระทำที่มากที่สุดในสถานะถัดไป ส่วน SARSA ใช้ค่าของการกระทำที่เลือกจริง
คำตอบD. Q-Learning ใช้ค่าการกระทำที่มากที่สุดในสถานะถัดไป ส่วน SARSA ใช้ค่าของการกระทำที่เลือกจริง

ทั้งสองเป็นวิธีการเรียนรู้แบบเสริมกำลังที่อัปเดตฟังก์ชันค่าการกระทำ ความแตกต่างอยู่ที่ว่าใช้อะไรในการอัปเดต Q-Learning ใช้ค่าที่มากที่สุดในบรรดาการกระทำที่เป็นไปได้ในสถานะถัดไป ส่วน SARSA อัปเดตโดยใช้ค่าของการกระทำถัดไปที่เลือกจริง คำอธิบายที่สลับสองอย่างนี้เป็นความผิดพลาดที่พบบ่อยที่สุด Q-Learning ก็อัปเดตฟังก์ชันค่าการกระทำเช่นกัน จึงไม่ถูกต้องที่จะบอกว่ามีเพียงฝ่ายเดียวที่ใช้ การเรียนรู้แบบเสริมกำลังทั้งสองแบบเรียนรู้จากรางวัล จึงไม่ถูกต้องที่จะบอกว่าต้องใช้ข้อมูลสอน

ข้อ 19 | ε-greedy

ในปัญหาแบนดิตที่มีแขน 4 แขน ใช้นโยบาย ε-greedy ที่เลือกแขนแบบสุ่มสม่ำเสมอ 1 แขนจาก 4 แขนด้วยความน่าจะเป็น ε และเลือกแขนที่มีค่าประเมินมากที่สุดด้วยความน่าจะเป็น 1-ε เมื่อ ε เท่ากับ 0.1 ความน่าจะเป็นที่การเลือก 1 ครั้งจะได้แขนที่มีค่าประเมินมากที่สุดเป็นผลลัพธ์ คือข้อใด

  1. 0.900
  2. 0.100
  3. 0.250
  4. 0.925
คำตอบD. 0.925

แขนที่มีค่าประเมินมากที่สุดจะถูกเลือกได้ใน 2 กรณี คือกรณีที่เลือกแบบโลภ (Greedy) และกรณีที่เลือกแบบสุ่มแล้วบังเอิญได้แขนนั้น กรณีแรกคือ 1 ลบ 0.1 เท่ากับ 0.900 กรณีหลังคือ 0.1 หารด้วย 4 เท่ากับ 0.025 รวมกันได้ 0.925 คำตอบ 0.900 คือค่าที่นับไม่ครบส่วนที่บังเอิญได้จากการสุ่ม 0.250 คือความน่าจะเป็นที่เลือกแบบสม่ำเสมอจาก 4 แขน และ 0.100 คือค่า ε เอง ยิ่งเพิ่ม ε มากขึ้น การสำรวจก็จะยิ่งมากขึ้น และความน่าจะเป็นนี้ก็จะยิ่งลดลง

ข้อ 20 | การคำนวณอัตราคิดลด

ณ จุดเวลาหนึ่ง ได้รับรางวัล 4 หลังจาก 1 ก้าว รางวัล 12 หลังจาก 2 ก้าว และรางวัล 8 หลังจาก 3 ก้าว เมื่อคูณรางวัลหลัง 1 ก้าวด้วย 0.5 คูณรางวัลหลัง 2 ก้าวด้วย 0.5 ยกกำลัง 2 และคูณรางวัลหลัง 3 ก้าวด้วย 0.5 ยกกำลัง 3 แล้วรวมกัน ค่าที่ได้คือข้อใด

  1. 24.0
  2. 6.0
  3. 7.5
  4. 12.0
คำตอบB. 6.0

4 คูณ 0.5 ได้ 2, 12 คูณ 0.5 ยกกำลัง 2 คือ 0.25 ได้ 3, 8 คูณ 0.5 ยกกำลัง 3 คือ 0.125 ได้ 1 รวมกันได้ 6.0 ค่า 24.0 คือค่าที่ไม่คูณส่วนลดใด ๆ เลย เพียงบวก 4, 12, 8 เข้าด้วยกัน ค่า 12.0 คือค่า 24 นั้นคูณด้วย 0.5 เพียง 1 ครั้ง ส่วนค่า 7.5 คือค่าที่สลับลำดับการคูณ โดยคูณ 4 ด้วย 0.125, 12 ด้วย 0.25, 8 ด้วย 0.5 ซึ่งทั้งหมดนี้เป็นความผิดพลาดที่พบบ่อย บทบาทของอัตราคิดลดคือประเมินรางวัลในอนาคตที่ไกลออกไปให้มีค่าน้อยลง ดังนั้นน้ำหนักที่มากกว่าจะตกอยู่กับรางวัลที่ใกล้กว่า

ข้อ 21 | การคำนวณ Precision

ผลการพยากรณ์ของโมเดลหนึ่งมี True Positive 40 รายการ, False Positive 10 รายการ, False Negative 20 รายการ, True Negative 130 รายการ ค่า Precision คือเท่าใด

  1. 0.85
  2. 0.80
  3. 0.73
  4. 0.67
คำตอบB. 0.80

Precision ใช้จำนวนที่พยากรณ์เป็นบวกเป็นตัวส่วน จึงเป็น True Positive 40 หารด้วยผลรวมของ True Positive 40 กับ False Positive 10 คือ 50 ได้ 0.80 ค่า 0.67 คือ Recall ที่ใช้จำนวนที่เป็นบวกจริงเป็นตัวส่วน นั่นคือ 40 หารด้วยผลรวมของ True Positive 40 กับ False Negative 20 คือ 60 ค่า 0.85 คือ Accuracy ซึ่งเป็นสัดส่วนที่ทายถูก 170 รายการจากทั้งหมด 200 รายการ ส่วนค่า 0.73 คือ F-Measure ซึ่งเป็นค่าเฉลี่ยฮาร์มอนิกของ Precision 0.80 กับ Recall 0.67 ซึ่งล้วนเป็นตัวชี้วัดอื่นที่คำนวณผิดไป

ข้อ 22 | ความแตกต่างของตัวส่วน

ความแตกต่างของตัวส่วนระหว่าง Precision กับ Recall ข้อใดถูกต้อง

  1. Precision ใช้จำนวนที่เป็นบวกจริงเป็นตัวส่วน ส่วน Recall ใช้จำนวนที่พยากรณ์เป็นบวกเป็นตัวส่วน
  2. Precision ใช้เฉพาะจำนวน True Negative ส่วน Recall ใช้เฉพาะจำนวน False Negative เป็นตัวส่วน
  3. ทั้ง Precision และ Recall ต่างใช้จำนวนข้อมูลทั้งหมดเป็นตัวส่วนโดยตรง
  4. Precision ใช้จำนวนที่พยากรณ์เป็นบวกเป็นตัวส่วน ส่วน Recall ใช้จำนวนที่เป็นบวกจริงเป็นตัวส่วน
คำตอบD. Precision ใช้จำนวนที่พยากรณ์เป็นบวกเป็นตัวส่วน ส่วน Recall ใช้จำนวนที่เป็นบวกจริงเป็นตัวส่วน

Precision คือ "สัดส่วนของสิ่งที่เป็นบวกจริงในบรรดาสิ่งที่พยากรณ์ว่าเป็นบวก" ดังนั้นตัวส่วนจึงอยู่ฝั่งการพยากรณ์ Recall คือ "สัดส่วนที่จับได้ในบรรดาสิ่งที่เป็นบวกจริง" ดังนั้นตัวส่วนจึงอยู่ฝั่งข้อเท็จจริง ความผิดพลาดที่สลับสองอย่างนี้พบบ่อยที่สุด จึงควรจำจากว่าตัวส่วนเป็นฝั่งการพยากรณ์หรือฝั่งข้อเท็จจริง การใช้ข้อมูลทั้งหมดเป็นตัวส่วนคือ Accuracy ส่วนตัวชี้วัดที่ใช้เฉพาะ True Negative หรือ False Negative เป็นตัวส่วนไม่ใช่ทั้งสองอย่างนี้ เมื่อต้องการลดการตรวจจับผิดพลาด ให้ให้ความสำคัญกับ Precision เมื่อต้องการลดการมองข้าม ให้ให้ความสำคัญกับ Recall

ข้อ 23 | การคำนวณ F-Measure

เมื่อ Precision เท่ากับ 0.6 และ Recall เท่ากับ 0.9 ค่า F-Measure คือเท่าใด

  1. 1.50
  2. 0.54
  3. 0.75
  4. 0.72
คำตอบD. 0.72

F-Measure คือค่าเฉลี่ยฮาร์มอนิกของ Precision กับ Recall จึงคำนวณได้จาก 2 คูณผลคูณของ 0.6 กับ 0.9 คือ 0.54 ได้ 1.08 แล้วหารด้วยผลรวมของ 0.6 กับ 0.9 คือ 1.5 ได้ 0.72 ค่า 0.75 คือค่าที่คำนวณเป็นค่าเฉลี่ยเลขคณิตแทนที่จะเป็นค่าเฉลี่ยฮาร์มอนิก ค่า 0.54 คือค่าที่เพียงคูณสองค่าเข้าด้วยกัน และค่า 1.50 คือค่าที่เพียงบวกกัน ควรตรวจสอบด้วยว่าค่าเฉลี่ยฮาร์มอนิกจะถูกดึงเข้าหาค่าที่น้อยกว่า จึงมีค่าน้อยกว่าค่าเฉลี่ยเลขคณิตที่ 0.75

ข้อ 24 | ข้อมูลไม่สมดุล

สร้างโมเดลที่พยากรณ์ว่าเป็นลบทั้งหมด สำหรับข้อมูลที่มีค่าบวกเพียง 1 เปอร์เซ็นต์ของทั้งหมด คำอธิบายของสถานการณ์นี้ ข้อใดถูกต้อง

  1. Accuracy จะเป็น 50 เปอร์เซ็นต์ ซึ่งแสดงว่าประสิทธิภาพเทียบเท่ากับการเดาสุ่ม
  2. Accuracy สูงถึง 99 เปอร์เซ็นต์ แต่ Recall เป็น 0 เปอร์เซ็นต์ ไม่สามารถจับค่าบวกได้แม้แต่รายการเดียว
  3. Accuracy ต่ำอยู่ที่ 1 เปอร์เซ็นต์ และ Recall ก็เป็น 0 เปอร์เซ็นต์ ทั้งสองตัวชี้วัดจึงเห็นปัญหา
  4. ทั้ง Accuracy และ Recall สูงถึง 99 เปอร์เซ็นต์ จึงสามารถใช้งานจริงได้
คำตอบB. Accuracy สูงถึง 99 เปอร์เซ็นต์ แต่ Recall เป็น 0 เปอร์เซ็นต์ ไม่สามารถจับค่าบวกได้แม้แต่รายการเดียว

เนื่องจากค่าบวกมีเพียง 1 เปอร์เซ็นต์ เพียงตอบว่าเป็นลบทั้งหมดก็จะถูก 99 เปอร์เซ็นต์แล้ว ทำให้ Accuracy สูงถึง 99 เปอร์เซ็นต์ แต่เนื่องจากไม่สามารถจับค่าบวกจริงได้แม้แต่รายการเดียว Recall จึงเป็น 0 เปอร์เซ็นต์ ทำให้โมเดลนี้ไม่มีประโยชน์ในการใช้งานจริง เมื่อจำนวนของแต่ละคลาสไม่สมดุลกัน หากดูเพียง Accuracy จะตัดสินใจผิดพลาด จึงจำเป็นต้องดู Recall, F-Measure และเส้นโค้ง ROC กับ AUC ควบคู่กันด้วย ในสถานการณ์นี้ Accuracy จะไม่กลายเป็น 1 เปอร์เซ็นต์หรือ 50 เปอร์เซ็นต์

ข้อ 25 | แกนของเส้นโค้ง ROC

การจับคู่แกนตั้งกับแกนนอนของเส้นโค้ง ROC ข้อใดถูกต้อง

  1. แกนตั้งคือขนาดของความคลาดเคลื่อน แกนนอนคือจำนวนครั้งของการทำซ้ำในการเรียนรู้
  2. แกนตั้งคือ Accuracy แกนนอนคือจำนวนข้อมูลที่ใช้ในการเรียนรู้
  3. แกนตั้งคือ True Positive Rate แกนนอนคือ False Positive Rate และพื้นที่ใต้เส้นโค้งคือ AUC
  4. แกนตั้งคือ Precision แกนนอนคือ Recall และพื้นที่ใต้เส้นโค้งคือ AUC
คำตอบC. แกนตั้งคือ True Positive Rate แกนนอนคือ False Positive Rate และพื้นที่ใต้เส้นโค้งคือ AUC

เส้นโค้ง ROC เป็นเส้นโค้งที่วาดโดยเปลี่ยนค่าขีดแบ่งของการตัดสิน โดยแกนตั้งคือ True Positive Rate และแกนนอนคือ False Positive Rate พื้นที่ใต้เส้นโค้งนี้คือ AUC ค่า AUC ยิ่งใกล้ 1 ยิ่งดี ส่วน 0.5 หมายถึงระดับเดียวกับการตัดสินแบบสุ่มเดา หากให้แกนตั้งเป็น Precision และแกนนอนเป็น Recall จะกลายเป็นเส้นโค้งแบบอื่น จึงเป็นจุดที่มักสับสนกัน การจับคู่ Accuracy กับจำนวนข้อมูล หรือความคลาดเคลื่อนกับจำนวนครั้งของการทำซ้ำ เป็นกราฟอื่นที่ใช้ดูความคืบหน้าของการเรียนรู้

ข้อ 26 | AIC กับ BIC

วิธีใช้เกณฑ์สารสนเทศอาไคเกะ (AIC) และเกณฑ์สารสนเทศแบบเบย์ (BIC) ข้อใดถูกต้อง

  1. ดูความสมดุลระหว่างความสอดคล้องกับจำนวนพารามิเตอร์ แล้วเลือกโมเดลที่มีค่ามาก
  2. ดูเฉพาะจำนวนพารามิเตอร์ แล้วเลือกโมเดลที่มีพารามิเตอร์มากที่สุด
  3. ดูเฉพาะความสอดคล้องกับข้อมูลฝึก แล้วเลือกโมเดลที่ความคลาดเคลื่อนน้อยที่สุด
  4. ดูความสมดุลระหว่างความสอดคล้องกับจำนวนพารามิเตอร์ แล้วเลือกโมเดลที่มีค่าน้อย
คำตอบD. ดูความสมดุลระหว่างความสอดคล้องกับจำนวนพารามิเตอร์ แล้วเลือกโมเดลที่มีค่าน้อย

ทั้ง AIC และ BIC เป็นตัวชี้วัดที่รวมความสอดคล้องกับข้อมูลและบทลงโทษสำหรับการเพิ่มพารามิเตอร์เข้าด้วยกัน ยิ่งมีค่าน้อยยิ่งถือว่าเป็นโมเดลที่ดี การมองว่ายิ่งมากยิ่งดีเป็นความผิดพลาด และเป็นจุดที่มักถูกถามมากที่สุด หากเลือกโดยดูเพียงความสอดคล้องกับข้อมูลฝึก จะมีแนวโน้มเลือกแต่โมเดลที่มีพารามิเตอร์มากซึ่งนำไปสู่ Overfitting จึงต้องมีบทลงโทษเพื่อสร้างความสมดุล เป็นแนวคิดทิศทางเดียวกับหลักการมีดโกนอ็อคแคมที่ไม่ทำให้ซับซ้อนเกินความจำเป็น

ข้อ 27 | จำนวนครั้งของการแบ่ง 5 ส่วน

เมื่อทำ 5-Fold Cross-Validation กับข้อมูล 200 รายการ การจับคู่จำนวนข้อมูลตรวจสอบต่อครั้งกับจำนวนครั้งที่ทำการเรียนรู้และประเมินซ้ำ ข้อใดถูกต้อง

  1. ตรวจสอบ 160 รายการ ทำการเรียนรู้และประเมินซ้ำ 5 ครั้ง
  2. ตรวจสอบ 40 รายการ ทำการเรียนรู้และประเมินซ้ำ 5 ครั้ง
  3. ตรวจสอบ 40 รายการ ทำการเรียนรู้และประเมินเพียง 1 ครั้ง
  4. ตรวจสอบ 100 รายการ ทำการเรียนรู้และประเมินซ้ำ 2 ครั้ง
คำตอบB. ตรวจสอบ 40 รายการ ทำการเรียนรู้และประเมินซ้ำ 5 ครั้ง

การทำ k-Fold Cross-Validation แบ่งข้อมูลออกเป็น k ส่วน แล้วทำซ้ำขั้นตอนที่ใช้ 1 ส่วนเป็นข้อมูลตรวจสอบ ส่วนที่เหลือใช้ในการเรียนรู้ เป็นจำนวน k ครั้ง แล้วหาค่าเฉลี่ยของผลลัพธ์ หากแบ่งข้อมูล 200 รายการเป็น 5 ส่วน แต่ละก้อนจะมี 40 รายการ ดังนั้นการตรวจสอบจะใช้ 40 รายการทุกครั้ง และการเรียนรู้จะใช้ที่เหลือ 160 รายการ ทำซ้ำทั้งหมด 5 ครั้ง การแบ่งเพียงครั้งเดียวจบคือ Holdout Validation ซึ่งคำนวณเบา แต่ผลลัพธ์จะไวต่อวิธีการแบ่งข้อมูล การใช้ 160 รายการเป็นข้อมูลตรวจสอบเป็นการนับที่สลับระหว่างการเรียนรู้กับการตรวจสอบ

ข้อ 28 | การคำนวณ RMSE

จากผลการพยากรณ์ 4 รายการ ค่าคลาดเคลื่อนที่ได้จากค่าจริงลบด้วยค่าพยากรณ์เรียงตามลำดับคือ 2, 4, -4, 0 ค่ารากที่สองของค่าคลาดเคลื่อนกำลังสองเฉลี่ย (RMSE) คือเท่าใด

  1. 6.0
  2. 9.0
  3. 2.5
  4. 3.0
คำตอบD. 3.0

ค่ากำลังสองของความคลาดเคลื่อนคือ 4, 16, 16, 0 รวมกันได้ 36 เมื่อหารด้วยจำนวนรายการ 4 จะได้ 9 ซึ่งคือค่าคลาดเคลื่อนกำลังสองเฉลี่ย (MSE) และรากที่สองของค่านี้คือ 3.0 ซึ่งคือ RMSE ค่า 9.0 คือค่าที่ตอบเป็น MSE โดยไม่ได้ถอดรากที่สอง ค่า 2.5 คือค่าเฉลี่ยของค่าสัมบูรณ์ของความคลาดเคลื่อน 2, 4, 4, 0 ซึ่งคือค่าคลาดเคลื่อนสัมบูรณ์เฉลี่ย (MAE) ค่า 6.0 คือค่าที่ลืมหารด้วยจำนวนรายการแล้วถอดรากที่สองของผลรวมกำลังสอง 36 โดยตรง RMSE มีหน่วยเดียวกับความคลาดเคลื่อนเดิม จึงอ่านง่าย

ข้อ 29 | ค่าเฉลี่ยและค่ามัธยฐาน

ข้อมูล 7 รายการคือ 2, 4, 4, 6, 8, 10, 50 การจับคู่ค่าเฉลี่ย ค่ามัธยฐาน และฐานนิยม ข้อใดถูกต้อง

  1. ค่าเฉลี่ย 12, ค่ามัธยฐาน 4, ฐานนิยม 6
  2. ค่าเฉลี่ย 12, ค่ามัธยฐาน 6, ฐานนิยม 4
  3. ค่าเฉลี่ย 6, ค่ามัธยฐาน 12, ฐานนิยม 4
  4. ค่าเฉลี่ย 6, ค่ามัธยฐาน 4, ฐานนิยม 10
คำตอบB. ค่าเฉลี่ย 12, ค่ามัธยฐาน 6, ฐานนิยม 4

ผลรวม 84 หารด้วยจำนวนรายการ 7 ได้ค่าเฉลี่ย 12 เมื่อเรียงจากน้อยไปมาก รายการที่ 4 คือ 6 จึงเป็นค่ามัธยฐาน และค่า 4 ที่ปรากฏ 2 ครั้งคือฐานนิยม จุดสำคัญคือค่าผิดปกติ 50 ดึงเฉพาะค่าเฉลี่ยให้สูงขึ้นมาก ในขณะที่ค่ามัธยฐานและฐานนิยมแทบไม่ขยับ นี่คือตัวอย่างที่แสดงว่าไม่ควรตัดสินโดยดูค่าตัวแทนเพียงตัวเดียว ค่าที่สลับค่าเฉลี่ยกับค่ามัธยฐาน หรือสลับค่ามัธยฐานกับฐานนิยม เป็นความผิดพลาดที่พบบ่อย

ข้อ 30 | สหสัมพันธ์เทียม

ข้อความเกี่ยวกับสหสัมพันธ์เทียม (Spurious Correlation) ข้อใดถูกต้อง

  1. หากสัมประสิทธิ์สหสัมพันธ์เป็น 0 จะยืนยันได้ว่าทั้งสองอย่างไม่มีความสัมพันธ์กันเลย
  2. กฎที่ว่าต้องกำจัดค่าผิดปกติออกเสมอในการคำนวณสัมประสิทธิ์สหสัมพันธ์
  3. สหสัมพันธ์ปรากฏขึ้นระหว่างสองสิ่งที่ไม่มีความเป็นเหตุเป็นผลกัน เพราะมีปัจจัยร่วมอยู่
  4. หากสัมประสิทธิ์สหสัมพันธ์เป็นบวก จะกล่าวได้ว่าฝ่ายหนึ่งเป็นสาเหตุของอีกฝ่ายหนึ่งเสมอ
คำตอบC. สหสัมพันธ์ปรากฏขึ้นระหว่างสองสิ่งที่ไม่มีความเป็นเหตุเป็นผลกัน เพราะมีปัจจัยร่วมอยู่

สหสัมพันธ์เทียมคือปรากฏการณ์ที่สหสัมพันธ์ปรากฏขึ้นระหว่างสองสิ่งที่ไม่มีความเป็นเหตุเป็นผลโดยตรง เนื่องจากมีปัจจัยร่วม เช่น ยอดขายไอศกรีมกับจำนวนอุบัติเหตุทางน้ำเคลื่อนไหวไปด้วยกันเพราะมีอุณหภูมิเป็นปัจจัยร่วม บทเรียนในที่นี้คือแม้จะมีสหสัมพันธ์ก็ไม่ได้แปลว่ามีเหตุเป็นผลเสมอไป ดังนั้นแม้สัมประสิทธิ์สหสัมพันธ์จะเป็นบวกก็ไม่สามารถกล่าวได้ว่าเป็นเหตุและผลกัน อีกทั้งแม้สัมประสิทธิ์สหสัมพันธ์จะเป็น 0 ก็อาจมีความสัมพันธ์ที่ไม่เป็นเส้นตรงซ่อนอยู่ จึงไม่สามารถยืนยันได้ว่าไม่มีความสัมพันธ์เลย การจัดการค่าผิดปกติเป็นประเด็นที่แยกจากนี้

ฝึกทำ: ทำโจทย์ในหน้านี้

เครื่องมือฝึกทำโจทย์แบบสุ่มคำถาม (ทำงานเมื่อเปิดใช้ JavaScript) โจทย์และคำอธิบายด้านบนสามารถอ่านได้ทั้งหมดตามปกติ

※ คำอธิบายเป็นข้อมูลเพื่อการเรียนรู้ ขอบเขตข้อสอบและระบบการสอบอาจเปลี่ยนแปลงในแต่ละปี โปรดตรวจสอบประกาศอย่างเป็นทางการของหน่วยงานผู้จัดสอบเสมอ

หน้านี้แปลจากต้นฉบับภาษาญี่ปุ่น หากเนื้อหาของคำแปลและต้นฉบับไม่ตรงกัน ให้ถือฉบับภาษาญี่ปุ่นเป็นหลัก ดูต้นฉบับภาษาญี่ปุ่น