Ruang Belajar Karinoya

Kualifikasi · Lab Lulus Cloud / AI / Python

Metode dan Penerapan Deep Learning

Soal dan pembahasan dapat dibaca dalam Bahasa Indonesia. Materi kuliah (artikel penjelasan) hanya tersedia dalam bahasa Jepang.

Lihat versi bahasa Jepang (dengan materi kuliah) →

Soal 1 | Perceptron sederhana

Manakah pernyataan yang benar tentang perceptron sederhana (simple perceptron)?

  1. Hanya terdiri dari input layer dan output layer, sehingga hanya bisa menyelesaikan masalah yang dapat dipisahkan secara linear
  2. Mahir mengambil fitur lokal dengan menggeser filter di atas gambar
  3. Memiliki koneksi yang mengembalikan status ke arah waktu sebelumnya, sehingga dapat menangani data sekuensial sesuai urutannya
  4. Memiliki beberapa hidden layer sehingga bisa melakukan pemisahan non-linear, termasuk merepresentasikan XOR
JawabanA. Hanya terdiri dari input layer dan output layer, sehingga hanya bisa menyelesaikan masalah yang dapat dipisahkan secara linear

Perceptron sederhana adalah neural network paling sederhana yang hanya terdiri dari input layer dan output layer, dan hanya bisa menyelesaikan masalah yang dapat dipisahkan secara linear dengan satu garis lurus. XOR (exclusive OR) memiliki titik-titik output 1 dan 0 yang tersusun bergantian secara diagonal, sehingga tidak bisa dipisahkan dengan garis lurus mana pun dan tidak dapat direpresentasikan oleh perceptron sederhana. Multilayer perceptron yang menambahkan hidden layer sehingga batasnya bisa dilipat dapat merepresentasikan XOR, dan pilihan pertama menggambarkan multilayer perceptron tersebut. Yang mengembalikan status waktu sebelumnya untuk menangani data sekuensial adalah recurrent neural network, dan yang mengambil fitur lokal dengan menggeser filter adalah convolutional layer.

Soal 2 | Keunggulan GPU

Apa alasan yang paling tepat mengapa GPU dianggap cocok untuk pelatihan (training) deep learning?

  1. Karena kapasitas penyimpanan untuk menyimpan data pelatihan jauh lebih besar dibanding CPU
  2. Karena rantai turunan (chain rule) yang dipakai pada backpropagation sudah tertanam sebagai sirkuit khusus sejak awal
  3. Karena mampu menjalankan proses kompleks dengan banyak percabangan secara cepat dan berurutan dengan sedikit core yang kuat
  4. Karena memiliki banyak core komputasi kecil dan bisa memproses perhitungan yang sama secara paralel sekaligus
JawabanD. Karena memiliki banyak core komputasi kecil dan bisa memproses perhitungan yang sama secara paralel sekaligus

Pelatihan deep learning adalah komputasi yang mengulang perkalian dan penjumlahan matriks dan vektor dalam jumlah sangat besar. GPU memiliki banyak core kecil yang melakukan operasi sederhana dan cocok untuk menjalankan perhitungan yang sama secara paralel sekaligus, sehingga sangat sesuai dengan bentuk komputasi ini. Menjalankan proses dengan banyak percabangan secara cepat dan berurutan dengan sedikit core yang kuat justru merupakan keunggulan CPU, yang jumlah core-nya tidak banyak. Keunggulan GPU bukan pada kapasitas penyimpanan, melainkan pada tingkat paralelisme. Tidak benar bahwa chain rule tertanam sebagai sirkuit khusus, dan yang dirancang khusus untuk operasi tensor deep learning adalah TPU.

Soal 3 | Penyebab vanishing gradient

Mengapa penggunaan fungsi sigmoid pada hidden layer mudah menyebabkan masalah vanishing gradient?

  1. Karena output berada dalam rentang 0 sampai 1, sehingga output itu sendiri mendekati 0 saat layer ditumpuk
  2. Karena jumlah total output dinormalisasi menjadi 1, sehingga nilainya mengecil di setiap layer
  3. Karena nilai maksimum turunannya adalah 0,25, dan nilai ini terus dikalikan setiap kali mundur ke layer sebelumnya
  4. Karena output selalu 0 untuk input negatif, sehingga unit tersebut berhenti belajar
JawabanC. Karena nilai maksimum turunannya adalah 0,25, dan nilai ini terus dikalikan setiap kali mundur ke layer sebelumnya

Masalah vanishing gradient adalah fenomena ketika gradient mendekati 0 selama backpropagation sehingga layer di sisi input tidak lagi belajar. Fungsi sigmoid memiliki nilai maksimum turunan hanya 0,25, sehingga setiap kali mundur ke layer sebelumnya, angka sebesar 0,25 atau kurang terus dikalikan, dan pada jaringan yang dalam gradient hampir tidak tersisa. Yang menjadi masalah bukan nilai output itu sendiri, melainkan besarnya turunannya. Gradient menjadi 0 untuk input negatif sehingga pembelajaran berhenti adalah kelemahan fungsi ReLU, dan fungsi Leaky ReLU dibuat untuk mengatasi hal ini. Yang menormalisasi jumlah total output menjadi 1 adalah fungsi softmax.

Soal 4 | Fungsi ReLU

Manakah penjelasan yang tepat mengenai fungsi ReLU?

  1. Fungsi berbentuk kurva S yang memampatkan input ke rentang 0 sampai 1
  2. Fungsi yang menormalisasi seluruh output secara bersamaan agar jumlah totalnya menjadi 1
  3. Fungsi yang memampatkan input ke rentang -1 sampai 1 dan berbentuk simetris terhadap titik asal
  4. Fungsi yang mengembalikan nilai input apa adanya jika positif, dan mengembalikan 0 jika negatif
JawabanD. Fungsi yang mengembalikan nilai input apa adanya jika positif, dan mengembalikan 0 jika negatif

Fungsi ReLU adalah fungsi sederhana yang mengembalikan nilai input apa adanya jika positif, dan 0 jika negatif. Karena turunannya selalu 1 pada daerah positif, gradient tidak mengecil meski mundur ke layer sebelumnya, sehingga masalah vanishing gradient dapat banyak dikurangi. Namun pada daerah negatif turunannya menjadi 0, sehingga unit yang terlanjur masuk ke sisi negatif bisa berhenti belajar, dan untuk itu disediakan fungsi Leaky ReLU yang memberi sedikit kemiringan pada sisi negatif. Kurva berbentuk S yang memampatkan ke 0 sampai 1 adalah fungsi sigmoid, yang simetris terhadap titik asal pada rentang -1 sampai 1 adalah fungsi tanh, dan yang menormalisasi jumlah total output menjadi 1 adalah fungsi softmax.

Soal 5 | Leaky ReLU

Fungsi Leaky ReLU dibuat untuk mengatasi kelemahan fungsi ReLU yang seperti apa?

  1. Jumlah total output tidak menjadi 1 sehingga tidak dapat diinterpretasikan sebagai probabilitas
  2. Gradient menjadi 0 untuk input negatif sehingga unit tersebut berhenti belajar
  3. Perhitungannya mengandung fungsi eksponensial sehingga beban proses per operasi menjadi berat
  4. Gradient tetap 1 untuk input positif sehingga besar update-nya menjadi berlebihan
JawabanB. Gradient menjadi 0 untuk input negatif sehingga unit tersebut berhenti belajar

Fungsi ReLU menghasilkan output maupun turunan 0 pada daerah negatif, sehingga jika input sebuah unit terus-menerus negatif, gradient tidak mengalir dan unit tersebut tidak akan pernah belajar lagi. Fungsi Leaky ReLU menghindari jalan buntu ini dengan memberikan sedikit kemiringan juga pada sisi negatif. Gradient yang bernilai 1 pada daerah positif justru merupakan keunggulan fungsi ReLU, bukan kelemahan, dan sifat inilah yang mencegah vanishing gradient. Jumlah total output yang tidak menjadi 1 adalah hal wajar bagi fungsi aktivasi, dan untuk output layer yang ingin dibaca sebagai probabilitas digunakan fungsi softmax. Yang perhitungannya mengandung fungsi eksponensial adalah fungsi sigmoid dan tanh, sedangkan fungsi ReLU justru ringan secara komputasi.

Soal 6 | Softmax

Manakah penggunaan khas dari fungsi softmax?

  1. Ditempatkan pada output layer masalah regresi, mengeluarkan nilai kontinu apa adanya
  2. Digunakan sebagai fungsi aktivasi hidden layer, memberi non-linearitas pada layer
  3. Ditempatkan pada output layer klasifikasi biner, mengeluarkan probabilitas salah satu kelas
  4. Ditempatkan pada output layer klasifikasi multi-kelas, mengeluarkan probabilitas tiap kelas
JawabanD. Ditempatkan pada output layer klasifikasi multi-kelas, mengeluarkan probabilitas tiap kelas

Fungsi softmax menormalisasi keseluruhan output agar jumlah totalnya tepat 1, sehingga ditempatkan pada output layer klasifikasi multi-kelas (kelas berjumlah 3 atau lebih) dan dibaca sebagai probabilitas keanggotaan tiap kelas. Fungsi error yang biasa dipasangkan adalah cross entropy. Yang ditempatkan pada output layer klasifikasi biner untuk mengeluarkan probabilitas adalah fungsi sigmoid, dan yang banyak digunakan sebagai fungsi aktivasi hidden layer adalah fungsi ReLU atau tanh. Pada masalah regresi, output layer mengeluarkan nilai apa adanya dan fungsi error yang digunakan adalah mean squared error.

Soal 7 | Fungsi error untuk regresi

Pada masalah regresi yang memprediksi nilai kontinu seperti harga rumah, fungsi error apa yang secara umum dipilih sebagai dasar?

  1. Cross entropy, yang mengukur selisih antara distribusi probabilitas prediksi dan distribusi jawaban benar
  2. Triplet loss, yang melatih hubungan jarak dari tiga data sekaligus
  3. Contrastive loss, yang melatih apakah dua data sama atau tidak berdasarkan jarak
  4. Mean squared error, yang mengkuadratkan selisih antara prediksi dan jawaban benar lalu merata-ratakannya
JawabanD. Mean squared error, yang mengkuadratkan selisih antara prediksi dan jawaban benar lalu merata-ratakannya

Karena regresi adalah masalah menebak nilai kontinu, mean squared error yang langsung mengkuadratkan selisih antara prediksi dan jawaban benar lalu merata-ratakannya menjadi pilihan yang wajar. Cross entropy adalah fungsi yang mengukur selisih antar distribusi probabilitas dan digunakan untuk masalah klasifikasi, umumnya dipasangkan dengan fungsi softmax pada output layer untuk klasifikasi multi-kelas. Triplet loss melatih hubungan jarak dari tiga data (anchor, positif, negatif), sedangkan contrastive loss melatih apakah dua data sama atau tidak berdasarkan jarak; keduanya adalah fungsi error untuk mendapatkan representasi yang mengukur kemiripan. Memilih fungsi error sesuai tugas adalah inti dari bagian materi ini.

Soal 8 | Error dari tiga data

Manakah penjelasan yang tepat mengenai fungsi error Triplet Loss?

  1. Mengkuadratkan selisih antara prediksi dan jawaban benar lalu merata-ratakannya, mengukur langsung selisih besaran nilai
  2. Mengukur selisih antara distribusi probabilitas prediksi dan distribusi jawaban benar, digunakan luas untuk pelatihan klasifikasi
  3. Menggunakan tiga data yaitu anchor, contoh positif, dan contoh negatif, agar contoh positif lebih dekat dibanding contoh negatif
  4. Mengukur jarak antara dua distribusi probabilitas dan bekerja untuk mendekatkan keduanya
JawabanC. Menggunakan tiga data yaitu anchor, contoh positif, dan contoh negatif, agar contoh positif lebih dekat dibanding contoh negatif

Triplet loss adalah fungsi error yang menggunakan tiga data yaitu data acuan (anchor), data sejenis (contoh positif), dan data berbeda jenis (contoh negatif), lalu melatih agar jarak antara anchor dan contoh positif menjadi lebih kecil daripada jarak antara anchor dan contoh negatif. Fungsi ini digunakan saat membangun ruang representasi yang menyatakan kemiripan lewat jarak. Yang mengukur jarak antara dua distribusi probabilitas adalah Kullback-Leibler divergence (KL), yang mengkuadratkan selisih prediksi dan jawaban benar lalu merata-ratakannya adalah mean squared error, dan yang mengukur selisih distribusi probabilitas serta digunakan luas untuk klasifikasi adalah cross entropy. Perlu dicatat, contrastive loss yang melatih sama-tidaknya dua data juga termasuk dalam bagian materi yang sama.

Soal 9 | Backpropagation

Manakah penjelasan yang paling tepat mengenai backpropagation (metode propagasi balik error)?

  1. Prosedur update itu sendiri yang langsung menulis ulang bobot secara berurutan mulai dari output layer
  2. Prosedur yang menggerakkan bobot sedikit demi sedikit secara acak dan memilih arah yang mengurangi error
  3. Prosedur yang menjalankan perhitungan secara berurutan dari sisi input ke sisi output untuk mendapatkan output
  4. Prosedur yang menggunakan chain rule untuk menelusuri mundur dari sisi output ke sisi input guna mencari gradient
JawabanD. Prosedur yang menggunakan chain rule untuk menelusuri mundur dari sisi output ke sisi input guna mencari gradient

Backpropagation adalah metode yang menggunakan chain rule, yaitu memecah turunan fungsi komposisi menjadi perkalian turunan tiap komponennya, untuk mencari gradient tiap bobot secara efisien dengan menelusuri mundur dari sisi output ke sisi input. Yang diperoleh di sini hanyalah gradient, sedangkan yang benar-benar menggerakkan bobot menggunakan gradient tersebut adalah tugas gradient descent. Perlu hati-hati karena mengatakan backpropagation itu sendiri yang mengupdate bobot adalah kurang tepat. Menggerakkan secara acak lalu memilih arah yang baik adalah pendekatan pencarian tanpa gradient, sedangkan menjalankan perhitungan dari sisi input ke sisi output adalah forward propagation, yaitu prosedur inferensi.

Soal 10 | Credit assignment problem

Masalah menentukan seberapa besar tanggung jawab setiap unit di setiap layer atas error akhir disebut apa?

  1. Credit assignment problem
  2. Masalah exploding gradient
  3. Masalah vanishing gradient
  4. Kutukan dimensi (curse of dimensionality)
JawabanA. Credit assignment problem

Credit assignment problem adalah masalah menentukan seberapa besar tanggung jawab yang harus dibebankan pada unit di layer mana untuk error yang muncul di output. Backpropagation diposisikan sebagai metode yang membuat pembagian tanggung jawab ini dapat dihitung melalui chain rule. Masalah vanishing gradient adalah fenomena ketika gradient mendekati 0 saat ditelusuri mundur sehingga layer sisi input tidak lagi belajar, sedangkan masalah exploding gradient adalah kebalikannya, yaitu gradient membesar berlebihan hingga divergen; keduanya adalah masalah yang muncul ketika menerapkan backpropagation. Kutukan dimensi adalah fenomena kebutuhan data yang melonjak seiring bertambahnya dimensi fitur, dan dalam silabus ditempatkan pada bagian materi machine learning.

Soal 11 | Regularisasi L1

Manakah ciri khas regularisasi L1?

  1. Menjadikan jumlah kuadrat bobot sebagai penalti, membuat nilai menjadi kecil merata tetapi sulit menjadi 0
  2. Menjadikan jumlah nilai absolut bobot sebagai penalti, membuat nilai mudah menjadi tepat 0
  3. Menonaktifkan unit secara acak setiap kali pelatihan untuk mencegah ketergantungan yang timpang
  4. Menghentikan pelatihan begitu error pada data validasi mulai memburuk
JawabanB. Menjadikan jumlah nilai absolut bobot sebagai penalti, membuat nilai mudah menjadi tepat 0

Regularisasi L1 adalah regularisasi yang menambahkan jumlah nilai absolut bobot sebagai penalti ke fungsi error, sehingga bobot mudah terdorong hingga tepat 0. Akibatnya, koefisien fitur yang tidak terpakai menjadi 0 dan otomatis tereliminasi, sehingga muncul efek seleksi fitur. Kondisi ini disebut sparse. Yang menjadikan jumlah kuadrat bobot sebagai penalti adalah regularisasi L2, yang membuat nilai kecil merata tetapi sulit menjadi 0. Yang menonaktifkan unit secara acak saat pelatihan adalah dropout, dan yang menghentikan pelatihan saat error validasi mulai memburuk adalah early stopping; keduanya sama-sama mengatasi overfitting tetapi dengan mekanisme berbeda.

Soal 12 | Ridge regression

Regularisasi apa yang digunakan pada ridge regression?

  1. Regularisasi L0, yang menjadikan banyaknya bobot yang tidak nol sebagai penalti
  2. Regularisasi L2, yang menambahkan jumlah kuadrat bobot sebagai penalti
  3. Regularisasi L1, yang menjadikan jumlah nilai absolut bobot sebagai penalti
  4. Dropout, yang menonaktifkan unit secara acak saat pelatihan
JawabanB. Regularisasi L2, yang menambahkan jumlah kuadrat bobot sebagai penalti

Ridge regression adalah metode yang menggabungkan regresi linear dengan regularisasi L2. Karena jumlah kuadrat bobot ditambahkan sebagai penalti, seluruh koefisien tertekan menjadi kecil sehingga overfitting dapat dicegah. Yang menggabungkan regresi linear dengan regularisasi L1 adalah lasso regression, yang koefisiennya mudah menjadi tepat 0 sehingga menghasilkan solusi sparse. Kesesuaian L1 dengan lasso dan L2 dengan ridge mudah tertukar, sehingga sebaiknya diingat sebagai pasangan. Regularisasi L0 adalah gagasan yang menjadikan banyaknya bobot yang tidak nol itu sendiri sebagai penalti, tetapi karena jumlah tersebut tidak dapat diturunkan, sulit dimasukkan ke pelatihan berbasis gradient. Dropout adalah metode regularisasi untuk neural network.

Soal 13 | Dropout

Manakah penjelasan yang tepat mengenai dropout?

  1. Membalik gambar secara horizontal atau memotongnya untuk memperbanyak data pelatihan itu sendiri
  2. Menonaktifkan sebagian unit secara acak dengan proporsi tertentu saat pelatihan untuk menekan overfitting
  3. Menghentikan pelatihan begitu error pada data validasi mulai naik untuk mencegah overfitting
  4. Menata output hidden layer dalam mini-batch agar rata-rata 0 dan variansi 1 supaya pelatihan lebih stabil
JawabanB. Menonaktifkan sebagian unit secara acak dengan proporsi tertentu saat pelatihan untuk menekan overfitting

Dropout adalah metode yang menonaktifkan sebagian unit hidden layer secara acak dengan proporsi tertentu setiap kali pelatihan dilakukan. Karena setiap kali pelatihan dilakukan dengan bentuk jaringan yang sedikit berbeda, model tidak bisa bergantung sepenuhnya pada kombinasi unit tertentu, sehingga diperoleh efek seperti merata-ratakan banyak model. Penonaktifan hanya dilakukan saat pelatihan, sedangkan saat inferensi semua unit digunakan. Meski namanya mirip, dalam silabus dropout diklasifikasikan sebagai regularisasi nomor 14, bukan sebagai normalization layer nomor 19. Yang menata distribusi dalam mini-batch adalah batch normalization, yang memperbanyak data adalah data augmentation, dan yang menghentikan pelatihan karena error memburuk adalah early stopping.

Soal 14 | Pembelajaran mini-batch

Manakah penjelasan yang tepat mengenai pembelajaran mini-batch?

  1. Cara yang tidak mengupdate bobot dan terus memakai nilai yang sudah ditentukan sebelumnya
  2. Cara yang mencari gradient dari seluruh data pelatihan lalu mengupdate bobot hanya satu kali
  3. Cara yang mengupdate bobot per kelompok berisi puluhan hingga ratusan data
  4. Cara yang mengupdate bobot setiap kali satu data pelatihan digunakan
JawabanC. Cara yang mengupdate bobot per kelompok berisi puluhan hingga ratusan data

Pembelajaran mini-batch adalah cara yang membagi data pelatihan menjadi kelompok berisi puluhan hingga ratusan data, lalu mencari gradient dan mengupdate bobot per kelompok tersebut. Sifatnya berada di tengah antara online learning yang mengupdate per satu data (sehingga gradient-nya tidak terlalu bervariasi tiap kali) dan batch learning yang mengupdate hanya sekali dengan seluruh data (sehingga tidak terlalu berat secara komputasi), sehingga dalam praktiknya cara inilah yang paling banyak dipakai. Stochastic gradient descent (SGD) mencari gradient hanya dari sebagian data, sehingga fluktuasinya justru membantu keluar dari saddle point atau local optimum yang dangkal. Tidak mengupdate bobot bukanlah pembelajaran, melainkan sekadar inferensi.

Soal 15 | Epoch

Manakah hubungan yang tepat antara epoch dan iterasi?

  1. Epoch menunjuk pada ukuran mini-batch, iterasi menunjuk pada besar learning rate
  2. Epoch menunjuk pada satu putaran penuh data, iterasi menunjuk pada satu kali update bobot
  3. Epoch menunjuk pada satu kali update bobot, iterasi menunjuk pada satu putaran penuh data
  4. Epoch dan iterasi sama-sama menunjuk pada satu putaran penuh data
JawabanB. Epoch menunjuk pada satu putaran penuh data, iterasi menunjuk pada satu kali update bobot

Epoch menunjuk pada satu putaran penuh seluruh data pelatihan, sedangkan iterasi menunjuk pada satu kali update bobot. Keduanya terhubung melalui ukuran mini-batch, sehingga jumlah iterasi per epoch sama dengan jumlah data dibagi ukuran mini-batch. Misalnya jika 3000 data diproses dengan ukuran mini-batch 50, maka 1 epoch sama dengan 60 iterasi. Jika ukuran mini-batch diperbesar, gradient tiap kali menjadi lebih stabil tetapi jumlah update per epoch berkurang; jika diperkecil, update bertambah tetapi variasinya membesar. Baik ukuran mini-batch maupun learning rate adalah hyperparameter yang ditentukan manusia sebelumnya, dan berbeda konsep dari epoch maupun iterasi.

Soal 16 | Saddle point

Manakah penjelasan yang tepat mengenai saddle point?

  1. Titik yang tampak sebagai minimum jika dilihat dari satu arah, tetapi menjadi maksimum jika dilihat dari arah lain
  2. Titik dengan error paling kecil di sekitarnya saja, padahal ada titik yang lebih baik secara keseluruhan
  3. Wilayah dengan nilai error yang tetap sama di seluruh rentang tanpa kemiringan ke arah mana pun
  4. Titik dengan error paling kecil di antara seluruh rentang nilai yang mungkin
JawabanA. Titik yang tampak sebagai minimum jika dilihat dari satu arah, tetapi menjadi maksimum jika dilihat dari arah lain

Saddle point adalah titik yang tampak seperti lembah dari satu arah, tetapi menjadi puncak jika dilihat dari arah lain, sehingga dinamai demikian karena bentuknya menyerupai pelana kuda. Pada deep learning yang memiliki jumlah parameter sangat besar, terjebak di saddle point dianggap lebih sering terjadi dibanding menemukan local optimum yang menjadi lembah dari segala arah sekaligus. Titik dengan error paling kecil di seluruh rentang adalah global optimum, sedangkan yang paling kecil hanya di sekitarnya saja adalah local optimum. Stochastic gradient descent (SGD) memiliki gradient yang bervariasi, sehingga lebih mudah keluar dari kemacetan semacam ini.

Soal 17 | Adam

Adam merupakan metode optimasi yang menggabungkan gagasan apa saja?

  1. Menggabungkan dua jenis penalti, yaitu jumlah nilai absolut bobot dan jumlah kuadrat bobot
  2. Menggabungkan gagasan yang memakai inersia dan gagasan yang mengadaptasikan learning rate
  3. Bergantian menerapkan dua cara, yaitu batch learning dan online learning
  4. Menggabungkan dua jenis pencarian, yaitu grid search dan random search
JawabanB. Menggabungkan gagasan yang memakai inersia dan gagasan yang mengadaptasikan learning rate

Adam adalah metode optimasi yang menggabungkan gagasan momentum, yang menambahkan besar update sebelumnya sebagai inersia, dengan gagasan RMSprop, yang menyesuaikan learning rate secara otomatis untuk setiap parameter, dan sering dipakai sebagai nilai baku dalam praktik. Rangkaian metode yang mengadaptasikan learning rate dimulai dari AdaGrad; AdaGrad menurunkan learning rate untuk parameter yang updatenya besar, tetapi karena terus menurun tanpa henti, RMSprop melonggarkannya lewat rata-rata bergerak eksponensial. Dalam rangkaian yang sama juga terdapat AdaDelta, AdaBound, dan AMSBound. Penalti pada bobot adalah topik regularisasi, sedangkan grid search dan random search adalah topik pencarian hyperparameter; keduanya bukan aturan update itu sendiri.

Soal 18 | No free lunch

Apa yang dinyatakan oleh teorema no free lunch?

  1. Tidak ada algoritma serbaguna yang lebih unggul dibanding algoritma lain untuk segala masalah
  2. Kebutuhan data pelatihan meningkat drastis seiring bertambahnya dimensi fitur
  3. Jika learning rate terus diturunkan, global optimum pasti akan tercapai
  4. Error model sempat memburuk lebih dulu lalu turun kembali ketika model diperbesar
JawabanA. Tidak ada algoritma serbaguna yang lebih unggul dibanding algoritma lain untuk segala masalah

Teorema no free lunch menyatakan bahwa jika dirata-ratakan pada seluruh kemungkinan masalah, tidak ada algoritma serbaguna yang lebih unggul dibanding semua algoritma lainnya. Oleh karena itu, pemilihan metode harus dipikirkan per masalah, dan tidak ada jawaban yang selalu berlaku untuk digunakan kapan saja. Error yang sempat memburuk lalu turun kembali saat model diperbesar adalah double descent, yang juga termasuk dalam bagian materi yang sama. Kebutuhan data yang melonjak drastis seiring bertambahnya dimensi fitur adalah kutukan dimensi (curse of dimensionality). Tidak ada jaminan bahwa terus menurunkan learning rate pasti akan mencapai global optimum, karena bisa saja berhenti di local optimum atau saddle point.

Soal 19 | Random search

Manakah penjelasan yang tepat mengenai random search sebagai metode pencarian hyperparameter?

  1. Menyusun nilai kandidat dalam bentuk kisi (grid) lalu mencoba seluruh kombinasi secara berurutan
  2. Menonaktifkan unit secara acak setiap kali pelatihan untuk mendapatkan perilaku rata-rata
  3. Menghentikan pelatihan itu sendiri begitu error data validasi mulai memburuk
  4. Memilih titik secara acak dari dalam rentang pencarian lalu mencoba kombinasi tersebut
JawabanD. Memilih titik secara acak dari dalam rentang pencarian lalu mencoba kombinasi tersebut

Random search adalah metode yang memilih titik secara acak dari dalam rentang pencarian hyperparameter lalu mencobanya. Berbeda dengan grid search yang menyusun kandidat dalam bentuk kisi dan mencoba semuanya secara menyeluruh, random search tidak banyak menghabiskan percobaan pada hyperparameter yang tidak berpengaruh, sehingga bisa mengeksplorasi sumbu yang berpengaruh dengan lebih rinci pada jumlah percobaan yang sama. Nilai yang ditentukan manusia sebelumnya seperti learning rate, ukuran mini-batch, atau jumlah layer adalah hyperparameter. Menghentikan pelatihan karena error validasi memburuk adalah early stopping, dan menonaktifkan unit secara acak saat pelatihan adalah dropout; keduanya bukan metode pencarian.

Soal 20 | Fenomena double descent

Fenomena ketika error validasi sempat memburuk terlebih dahulu lalu turun kembali seiring bertambahnya ukuran model atau jumlah pelatihan disebut apa?

  1. Masalah exploding gradient
  2. Perolehan invariansi
  3. Fenomena double descent
  4. Credit assignment problem
JawabanC. Fenomena double descent

Fenomena double descent adalah fenomena ketika error validasi sempat memburuk lebih dulu saat ukuran model atau jumlah pelatihan diperbesar, lalu jika terus diperbesar lagi error tersebut mulai turun kembali. Namanya berasal dari kurva error yang turun dua kali. Fenomena ini bertentangan dengan intuisi sederhana bahwa model yang semakin besar akan semakin overfitting dan memburuk, tetapi dimasukkan ke dalam bagian metode optimasi pada silabus sebagai salah satu kerangka yang menjelaskan pengalaman belakangan ini bahwa model yang lebih besar terkadang justru memberi hasil yang lebih baik. Credit assignment problem adalah masalah menentukan unit mana yang bertanggung jawab atas error, masalah exploding gradient adalah masalah gradient yang divergen saat backpropagation, dan perolehan invariansi adalah peran dari pooling layer.

Soal 21 | Convolutional layer

Manakah ciri khas convolutional layer dibandingkan dengan fully connected layer?

  1. Terhubung dengan seluruh unit di layer sebelumnya, sehingga bobot bertambah seiring besarnya input
  2. Memakai ulang filter yang sama dengan menggeser posisinya, sehingga bisa mengambil fitur dengan sedikit bobot
  3. Mengembalikan status waktu sebelumnya ke input, sehingga bisa menangani data sekuensial yang punya urutan
  4. Sama sekali tidak memiliki bobot yang dipelajari, dan mengecilkan output dengan mengambil nilai representatif suatu wilayah
JawabanB. Memakai ulang filter yang sama dengan menggeser posisinya, sehingga bisa mengambil fitur dengan sedikit bobot

Convolutional layer mengambil fitur lokal dengan menggeser filter kecil di atas input sambil memakai ulang bobot yang sama. Karena koneksi hanya terbatas pada elemen di sekitarnya dan bobot yang sama dipakai ulang meski posisinya berubah, jumlah parameter untuk menangani gambar menjadi jauh lebih sedikit dibanding fully connected layer. Sebagai efek samping dari pemakaian ulang ini, objek dapat dikenali sebagai fitur yang sama di mana pun posisinya dalam gambar. Yang terhubung dengan seluruh unit di layer sebelumnya adalah fully connected layer, yang tidak memiliki bobot yang dipelajari dan mengambil nilai representatif adalah pooling layer, dan yang mengembalikan status waktu sebelumnya adalah recurrent layer. Hasil melewatkan satu filter disebut feature map, lebar pergeseran disebut stride, dan pengisian di sekeliling input disebut padding.

Soal 22 | Batch normalization

Manakah penjelasan yang tepat mengenai batch normalization?

  1. Menambahkan jumlah kuadrat bobot sebagai penalti ke fungsi error untuk membuat bobot kecil merata
  2. Menonaktifkan unit dengan proporsi tertentu setiap kali pelatihan untuk menghilangkan ketergantungan yang timpang
  3. Menata nilai seluruh layer dalam satu sampel sekaligus sehingga tidak terpengaruh ukuran mini-batch
  4. Menata nilai pada channel yang sama dalam satu mini-batch agar rata-rata 0 dan variansi 1
JawabanD. Menata nilai pada channel yang sama dalam satu mini-batch agar rata-rata 0 dan variansi 1

Batch normalization adalah normalization layer yang menata nilai pada channel yang sama dalam satu mini-batch agar rata-rata 0 dan variansi 1, sehingga pelatihan menjadi lebih stabil dan cepat. Kelemahannya adalah statistiknya menjadi kurang bisa diandalkan jika ukuran mini-batch kecil. Yang menata nilai seluruh layer dalam satu sampel adalah layer normalization, yang tidak terpengaruh ukuran mini-batch sehingga sering dipakai pada model yang menangani data sekuensial. Selain itu ada instance normalization dan group normalization, dan keempatnya inilah yang tercantum sebagai normalization layer pada silabus. Perlu dicatat, pada versi 1.1 nama bagian materi ini berubah dari regularization layer menjadi normalization layer. Regularisasi L2 yang menjadikan jumlah kuadrat bobot sebagai penalti dan dropout yang menonaktifkan unit diklasifikasikan sebagai regularisasi, bukan normalization layer.

Soal 23 | Pooling layer

Apa peran yang paling tepat dari pooling layer?

  1. Melompati layer dan menambahkan input ke layer yang lebih jauh, membuat jalur agar gradient bisa sampai
  2. Menata distribusi output hidden layer agar pelatihan menjadi stabil dan cepat
  3. Mereduksi suatu wilayah menjadi nilai representatif, membuat model tahan terhadap pergeseran posisi kecil
  4. Mengompresi input ke dimensi yang lebih rendah lalu memungkinkan input asli direkonstruksi kembali
JawabanC. Mereduksi suatu wilayah menjadi nilai representatif, membuat model tahan terhadap pergeseran posisi kecil

Pooling layer adalah layer yang mereduksi wilayah berukuran tertentu menjadi satu nilai representatif, dengan max pooling yang mengambil nilai maksimum wilayah dan average pooling yang mengambil rata-ratanya. Selain resolusi menurun sehingga komputasi menjadi lebih ringan, nilai representatif juga tidak mudah berubah meski objek bergeser beberapa piksel, sehingga model menjadi tahan terhadap pergeseran posisi. Hal ini disebut perolehan invariansi. Global average pooling (GAP), yang meratakan seluruh satu feature map menjadi satu nilai, dapat mengurangi jumlah parameter secara besar jika dipakai sebagai pengganti fully connected layer di akhir jaringan. Pooling layer juga berbeda dari convolutional layer karena tidak memiliki bobot yang dipelajari. Yang melompati layer untuk menambahkan input adalah skip connection, yang menata distribusi adalah normalization layer, dan yang mengompresi lalu merekonstruksi adalah autoencoder.

Soal 24 | Skip connection

Mengapa penerapan skip connection membuat pelatihan tetap berjalan meski pada jaringan yang sangat dalam?

  1. Karena terbentuk jalur yang melompati layer, sehingga gradient bisa mencapai sisi input lewat jalur yang dangkal
  2. Karena unit dinonaktifkan secara acak, sehingga tidak lagi bergantung pada jalur tertentu
  3. Karena distribusi output tiap layer menjadi seragam, sehingga variasi nilai tertekan di setiap layer
  4. Karena jumlah bobot berkurang, sehingga tidak mudah overfitting meski data terbatas
JawabanA. Karena terbentuk jalur yang melompati layer, sehingga gradient bisa mencapai sisi input lewat jalur yang dangkal

Skip connection adalah koneksi yang melompati beberapa layer dan menambahkan input langsung ke output layer yang lebih jauh. Saat backpropagation, gradient bisa mencapai sisi input tidak hanya lewat jalur panjang yang melalui banyak layer, tetapi juga lewat jalur pendek yang melompat, sehingga gradient tidak mudah hilang meski ditumpuk sangat dalam. Contoh terkenal yang mewujudkan kedalaman lebih dari 100 layer dengan gagasan ini adalah ResNet, dan dalam silabus ResNet menjadi satu-satunya kata kunci yang ditempatkan di bagian materi skip connection. Yang menonaktifkan unit secara acak adalah dropout, dan yang menata distribusi tiap layer adalah normalization layer; keduanya adalah mekanisme yang berbeda dari skip connection. Skip connection juga bukan cara untuk mengurangi jumlah bobot.

Soal 25 | LSTM dan GRU

Manakah kombinasi yang benar mengenai gate yang dimiliki LSTM dan GRU?

  1. LSTM dan GRU sama-sama memiliki 2 gate yang sama yaitu reset dan update
  2. LSTM dan GRU sama-sama memiliki 3 gate yang sama yaitu input, output, dan forget
  3. LSTM memiliki 3 gate yaitu input, output, dan forget, GRU memiliki 2 gate yaitu reset dan update
  4. LSTM memiliki 2 gate yaitu reset dan update, GRU memiliki 3 gate yaitu input, output, dan forget
JawabanC. LSTM memiliki 3 gate yaitu input, output, dan forget, GRU memiliki 2 gate yaitu reset dan update

LSTM memiliki jalur memori yang disebut CEC untuk menyimpan informasi, dan mengendalikan proses keluar-masuknya dengan 3 gate: input gate yang menentukan apa yang ditulis ke sana, forget gate yang menentukan apa yang dibuang, dan output gate yang menentukan apa yang dikeluarkan. Dengan mekanisme ini, ketergantungan jangka panjang dapat dipertahankan dan masalah vanishing gradient pada recurrent neural network banyak berkurang. GRU adalah versi sederhana dari LSTM, dan hanya memiliki 2 gate yaitu reset gate dan update gate. Parameternya lebih sedikit dan komputasinya lebih ringan, tetapi tidak selalu lebih unggul dibanding LSTM. Perbedaan jumlah gate (3 dan 2), serta fakta bahwa CEC adalah istilah khusus LSTM, adalah pembeda yang berulang kali ditanyakan.

Soal 26 | Jordan network

Manakah struktur yang tepat dari Jordan network?

  1. Mengembalikan output dari output layer ke hidden layer pada waktu berikutnya sebagai input
  2. Mengembalikan output hidden layer ke hidden layer pada waktu berikutnya sebagai input
  3. Mengembalikan output dari output layer ke input layer pada waktu yang sama sebagai input
  4. Melompati input layer langsung ke output layer dan menambahkannya di sana
JawabanA. Mengembalikan output dari output layer ke hidden layer pada waktu berikutnya sebagai input

Jordan network adalah recurrent neural network yang mengembalikan output dari output layer ke hidden layer pada waktu berikutnya sebagai input. Sebaliknya, yang mengembalikan output hidden layer ke hidden layer pada waktu berikutnya adalah Elman network; perbedaan keduanya terletak pada apa yang dikembalikan. Keduanya adalah struktur untuk menangani data time series sesuai urutannya, dan pelatihannya menggunakan BPTT, yaitu menerapkan backpropagation setelah jaringan dibentangkan ke arah waktu. Pada sekuens yang panjang, masalah vanishing gradient dan exploding gradient muncul dengan kuat, sehingga digunakan LSTM atau GRU yang memiliki mekanisme gate. Yang melompati layer untuk menambahkan input adalah skip connection, dan itu bukan tentang arah waktu.

Soal 27 | Attention

Manakah penjelasan yang tepat mengenai Source-Target Attention?

  1. Mekanisme yang menghitung kekuatan hubungan antar elemen di dalam sekuens yang sama
  2. Mekanisme yang menghitung kekuatan hubungan antara dua sekuens yang berbeda
  3. Mekanisme yang menjalankan beberapa cara memperhatikan (attention) secara paralel lalu merangkum hasilnya
  4. Mekanisme yang menambahkan sinyal khas pada tiap posisi untuk memberikan informasi urutan kata
JawabanB. Mekanisme yang menghitung kekuatan hubungan antara dua sekuens yang berbeda

Attention adalah mekanisme yang menghitung bagian mana dari input yang perlu diperhatikan sebagai bobot, dinyatakan dengan tiga komponen yaitu query, key, dan value. Di antaranya, Source-Target Attention menghitung kekuatan hubungan antara dua sekuens yang berbeda, seperti pada penerjemahan di mana sekuens input dan sekuens output terpisah. Yang menghitung hubungan antar elemen di dalam sekuens yang sama adalah Self-Attention, yang menjadi komponen inti dari Transformer. Yang menambahkan sinyal khas pada tiap posisi untuk memberi urutan kata adalah positional encoding, dan yang menjalankan beberapa cara attention secara paralel lalu merangkum hasilnya adalah Multi-Head Attention; keduanya adalah komponen berbeda yang menyusun Transformer.

Soal 28 | Positional encoding

Manakah penjelasan yang tepat mengenai Transformer?

  1. Model yang mengompresi input ke dimensi rendah lalu belajar merekonstruksi kembali input aslinya
  2. Model yang menumpuk convolution dan pooling secara bergantian untuk mengumpulkan fitur lokal secara bertahap
  3. Model yang disusun dengan Attention tanpa koneksi rekursif, dan urutan kata diberikan lewat positional encoding
  4. Model yang menumpuk koneksi rekursif, meneruskan status waktu sebelumnya secara berurutan
JawabanC. Model yang disusun dengan Attention tanpa koneksi rekursif, dan urutan kata diberikan lewat positional encoding

Transformer adalah model sekuens yang disusun dengan Attention sebagai pusatnya tanpa menggunakan koneksi rekursif. Karena tidak perlu menunggu perhitungan waktu sebelumnya, seluruh sekuens dapat diproses secara paralel, dan hubungan antar kata yang berjauhan pun bisa langsung ditangkap dalam satu kali perhitungan. Namun karena diproses secara paralel, informasi urutan kata menjadi hilang, sehingga positional encoding yang menambahkan sinyal khas pada tiap posisi digunakan untuk memberikan urutan kata. Poin jebakan yang sering muncul adalah Transformer bukan salah satu jenis recurrent neural network. Yang menumpuk koneksi rekursif untuk meneruskan status waktu sebelumnya adalah RNN, yang menumpuk convolution dan pooling adalah CNN, dan yang mengompresi lalu merekonstruksi adalah autoencoder.

Soal 29 | VAE

Apa yang membedakan variational autoencoder (VAE) dari autoencoder biasa?

  1. Mengompresi input ke dimensi rendah terlebih dahulu, lalu merekonstruksi input aslinya
  2. Mempelajari hasil kompresi sebagai distribusi probabilitas, bukan sebagai satu titik, sehingga bisa membuat data baru
  3. Dapat melanjutkan pelatihan tanpa perlu menyiapkan label jawaban
  4. Melatih layer satu per satu secara berurutan untuk membuat nilai awal jaringan yang dalam
JawabanB. Mempelajari hasil kompresi sebagai distribusi probabilitas, bukan sebagai satu titik, sehingga bisa membuat data baru

Variational autoencoder (VAE) mempelajari hasil kompresi input sebagai distribusi probabilitas, bukan sebagai satu titik. Dengan mengambil nilai dari distribusi tersebut lalu merekonstruksinya, data baru yang tidak ada pada data pelatihan bisa dibuat, sehingga VAE diperlakukan sebagai model generatif. Mengompresi ke dimensi rendah lalu merekonstruksi, dan bisa dilatih tanpa label jawaban, adalah sifat yang sama-sama dimiliki oleh autoencoder biasa, bukan ciri khusus VAE. Melatih layer satu per satu secara berurutan untuk membuat nilai awal jaringan yang dalam adalah pra-pelatihan menggunakan stacked autoencoder. Silabus juga mencantumkan VQ-VAE, info VAE, dan β-VAE pada bagian materi yang sama.

Soal 30 | Mixup

Di antara metode data augmentation untuk gambar, operasi apa yang dilakukan Mixup?

  1. Memotong sebagian gambar lalu memperbesarnya menjadi contoh baru
  2. Menggabungkan dua gambar menjadi satu contoh baru
  3. Membalik gambar secara horizontal untuk membuat contoh dengan arah yang berbeda
  4. Menutup sebagian gambar dengan kotak untuk menyembunyikan informasi di bagian itu
JawabanB. Menggabungkan dua gambar menjadi satu contoh baru

Mixup adalah metode data augmentation yang menggabungkan dua gambar dengan rasio tertentu, sekaligus mencampur label jawaban dengan rasio yang sama untuk membuat data pelatihan baru. CutMix yang namanya mirip bukan menggabungkan, melainkan memotong sebagian dari dua gambar lalu menempelkannya menjadi satu. Menutup sebagian gambar dengan kotak adalah Cutout atau Random Erasing, membalik secara horizontal adalah Random Flip, dan memotong sebagian gambar adalah Crop. Selain itu ada Rotate yang memutar gambar, Brightness yang mengubah kecerahan, Contrast yang mengubah kontras, dan RandAugment yang menentukan secara otomatis transformasi apa dan seberapa besar diterapkan; untuk teks disebutkan paraphrasing dan noising. Yang penting adalah tidak memilih transformasi yang merusak makna.

Soal 31 | GoogLeNet

Manakah ciri khas GoogLeNet?

  1. Menggunakan Inception module yang menerapkan filter dengan ukuran berbeda-beda secara paralel
  2. Menjuarai ILSVRC 2012 dengan menggunakan fungsi ReLU dan pelatihan berbasis GPU
  3. Memperkenalkan skip connection yang melompati layer, mewujudkan kedalaman lebih dari 100 layer
  4. Menumpuk hanya konvolusi kecil berukuran 3 kali 3 untuk mendapat struktur yang dalam
JawabanA. Menggunakan Inception module yang menerapkan filter dengan ukuran berbeda-beda secara paralel

GoogLeNet adalah model yang menggunakan Inception module, yaitu menerapkan filter dengan ukuran berbeda-beda secara paralel lalu merangkum hasilnya, sehingga mewujudkan struktur yang dalam sambil menekan jumlah parameter. Yang menumpuk hanya konvolusi kecil 3 kali 3 dengan struktur sederhana namun dalam adalah VGG, yang masuk peringkat atas di ILSVRC 2014 bersama GoogLeNet. Yang mewujudkan kedalaman lebih dari 100 layer dengan skip connection yang melompati layer adalah ResNet, dan yang menjuarai ILSVRC 2012 dengan menggabungkan fungsi ReLU, dropout, dan pelatihan berbasis GPU adalah AlexNet. Setelah itu berkembang ke Wide ResNet, DenseNet, SENet, EfficientNet, MobileNet, dan lain-lain, serta Vision Transformer yang membawa gagasan Transformer tanpa menggunakan konvolusi juga tercakup.

Soal 32 | Deteksi satu tahap

Manakah ciri khas yang sama dimiliki oleh YOLO dan SSD?

  1. Mendeteksi objek dengan prosedur dua tahap, yaitu mengeluarkan kandidat wilayah lalu mengklasifikasikannya
  2. Memberi kelas pada setiap piksel untuk mewarnai wilayah gambar
  3. Melakukan ekstraksi kandidat wilayah dan klasifikasi sekaligus dalam satu kali inferensi, mengutamakan kecepatan
  4. Bertujuan untuk memperkirakan posisi titik sendi tubuh manusia guna mendapatkan postur tubuh
JawabanC. Melakukan ekstraksi kandidat wilayah dan klasifikasi sekaligus dalam satu kali inferensi, mengutamakan kecepatan

YOLO dan SSD adalah model deteksi objek satu tahap yang melakukan ekstraksi kandidat wilayah dan penentuan kelas sekaligus dalam satu kali inferensi, dengan kecepatan sebagai keunggulannya. Sebaliknya, rangkaian yang dimulai dari R-CNN dan berkembang menjadi Fast R-CNN serta Faster R-CNN adalah metode dua tahap yang mengeluarkan kandidat wilayah terlebih dahulu baru mengklasifikasikannya, sehingga lebih lambat namun cenderung lebih akurat. Memberi kelas pada tiap piksel adalah semantic segmentation, dengan contoh representatif FCN, SegNet, U-Net, PSPNet, dan DeepLab. Instance segmentation yang membedakan objek dari kelas sama hingga per individu ditangani oleh Mask R-CNN, dan estimasi postur tubuh yang memperkirakan titik sendi tubuh manusia diwakili oleh OpenPose.

Soal 33 | BERT

Manakah penjelasan yang tepat mengenai BERT?

  1. Memetakan gambar dan teks deskripsi ke ruang vektor yang sama untuk menghubungkan keduanya
  2. Membalik proses penambahan noise secara bertahap untuk menghasilkan data sedikit demi sedikit
  3. Menggunakan encoder Transformer, melihat konteks dari kedua arah, depan dan belakang
  4. Menumpuk recurrent layer dan membaca kata satu per satu secara berurutan untuk membentuk konteks
JawabanC. Menggunakan encoder Transformer, melihat konteks dari kedua arah, depan dan belakang

BERT adalah model bahasa yang menggunakan encoder Transformer, dengan ciri khas pra-pelatihan yang melihat konteks dari kedua arah, depan dan belakang kalimat. BERT mempopulerkan cara pemakaian yang melakukan pra-pelatihan dengan teks dalam jumlah besar lalu mengadaptasikannya ke tugas masing-masing. Menumpuk recurrent layer dan membaca kata satu per satu secara berurutan adalah model yang menggunakan recurrent neural network, sedangkan Transformer tidak memiliki koneksi rekursif. Yang memetakan gambar dan teks deskripsi ke ruang vektor yang sama adalah CLIP, yang dalam silabus ditempatkan pada bagian multimodal. Yang membalik proses penambahan noise untuk menghasilkan data adalah Diffusion Model, yang termasuk bagian materi pembuatan data (data generation).

Soal 34 | CBOW

Manakah arah pembelajaran yang tepat dari CBOW pada word2vec?

  1. Belajar menebak kata pusat dari kata-kata yang muncul di sekitarnya
  2. Belajar menebak kata-kata yang muncul di sekitarnya dari kata pusat
  3. Belajar menebak apakah suatu kalimat positif atau negatif dari keseluruhan kalimat
  4. Belajar menebak apakah kalimat lanjutan akan muncul dari kalimat sebelumnya
JawabanA. Belajar menebak kata pusat dari kata-kata yang muncul di sekitarnya

CBOW adalah metode yang belajar menebak kata pusat dari kata-kata yang muncul di sekitarnya. Sebaliknya, yang belajar menebak kata-kata di sekitar dari kata pusat adalah skip-gram, sehingga arahnya berlawanan dan perlu hati-hati agar tidak tertukar. Keduanya adalah metode pada word2vec, dengan tujuan mendapatkan distributed representation, yaitu merepresentasikan kata sebagai vektor padat. Berbeda dari one-hot vector yang memberikan satu dimensi untuk satu kata (sehingga dimensinya menjadi sebesar ukuran kosakata dan tidak bisa merepresentasikan kedekatan antar kata), pada distributed representation kata-kata yang bermakna dekat ditempatkan berdekatan dalam ruang vektor. Menebak apakah suatu kalimat positif atau negatif adalah tugas terapan bernama analisis sentimen, bukan metode pembelajaran representasi kata.

Soal 35 | RLHF

Metode apa yang membuat model reward dari umpan balik manusia lalu menyesuaikan model dengan reinforcement learning?

  1. DQN
  2. A3C
  3. PPO
  4. RLHF
JawabanD. RLHF

RLHF adalah metode yang membuat model reward dari penilaian preferensi yang diberikan manusia, lalu menyesuaikan model dengan reinforcement learning menggunakan reward tersebut. Metode ini dikenal luas dalam penyesuaian model bahasa, tetapi dalam silabus ditempatkan bukan pada bagian natural language processing, melainkan pada bagian deep reinforcement learning, sebuah hal mengejutkan yang perlu diingat karena berguna. DQN adalah metode representatif deep reinforcement learning yang mengaproksimasi fungsi nilai aksi dengan neural network, PPO adalah metode pembelajaran kebijakan yang menekan besar update kebijakan agar stabil, dan A3C adalah metode yang menjalankan beberapa environment secara paralel untuk mempercepat pembelajaran. Pada bagian materi yang sama juga tercantum Double DQN, Dueling Network, Rainbow, Ape-X, dan Agent57.

Soal 36 | Diffusion

Manakah penjelasan yang tepat mengenai Diffusion Model?

  1. Belajar tampilan tiga dimensi dari foto beberapa sudut pandang untuk membuat gambar dari sudut pandang baru
  2. Mempelajari hasil kompresi sebagai distribusi probabilitas, lalu mengambil nilai darinya untuk merekonstruksi
  3. Membuat data yang tampak asli dengan mengadu dua jaringan satu sama lain
  4. Membalik proses penambahan noise secara bertahap untuk menghasilkan data
JawabanD. Membalik proses penambahan noise secara bertahap untuk menghasilkan data

Diffusion Model adalah model generatif yang menghasilkan data dari noise dengan membalik proses penambahan noise secara bertahap pada data. Mekanismenya sama sekali berbeda dari generative adversarial network (GAN), yang belajar dengan mengadu dua jaringan satu sama lain, dan Diffusion Model bukan salah satu jenis GAN. Dari GAN muncul turunan seperti DCGAN, CycleGAN, dan Pix2Pix. Yang belajar tampilan tiga dimensi dari foto beberapa sudut pandang adalah NeRF, dan yang mempelajari hasil kompresi sebagai distribusi probabilitas adalah variational autoencoder (VAE). Perlu dipahami bahwa GAN, VAE, dan Diffusion Model adalah rangkaian yang berbeda dan sejajar satu sama lain.

Soal 37 | Transfer learning

Manakah perbedaan yang tepat antara transfer learning dan fine-tuning?

  1. Transfer learning melatih ulang seluruh bobot, fine-tuning hanya melatih output layer
  2. Baik transfer learning maupun fine-tuning sama-sama melatih bobot dari awal tanpa pra-pelatihan
  3. Transfer learning terutama melatih bagian dekat output layer, fine-tuning melatih ulang rentang yang luas
  4. Transfer learning hanya bisa dipakai untuk gambar, fine-tuning hanya bisa dipakai untuk bahasa
JawabanC. Transfer learning terutama melatih bagian dekat output layer, fine-tuning melatih ulang rentang yang luas

Transfer learning adalah metode yang membiarkan bagian ekstraksi fitur dari model yang sudah dipra-latih tetap tetap, dan hanya melatih bagian dekat output layer dengan tugas baru. Fine-tuning melatih ulang seluruh atau sebagian besar bobot dengan data baru, sehingga membutuhkan lebih banyak data dan komputasi, tetapi cenderung memberikan hasil lebih baik jika domain target jauh berbeda dari data pra-pelatihan. Pada fine-tuning bisa terjadi catastrophic forgetting, yaitu hilangnya kemampuan yang sebelumnya dimiliki model asli. Keduanya sama-sama mengandaikan penggunaan model yang sudah dipra-latih, bukan melatih dari awal. Pemilihan keduanya juga tidak ditentukan oleh jenis data yang ditangani.

Soal 38 | Foundation model

Pada silabus, istilah foundation model ditempatkan di bagian materi apa?

  1. Ditempatkan di transfer learning dan fine-tuning, berjajar dengan Few-shot
  2. Ditempatkan di multimodal, berjajar dengan CLIP dan DALL-E
  3. Ditempatkan di deep reinforcement learning, berjajar dengan DQN dan RLHF
  4. Ditempatkan di natural language processing, berjajar dengan large language model (LLM)
JawabanB. Ditempatkan di multimodal, berjajar dengan CLIP dan DALL-E

Foundation model adalah istilah untuk model besar yang dipra-latih dengan data dalam jumlah besar dan bisa dialihgunakan ke berbagai tugas turunan (downstream task); pada silabus ditempatkan di bagian ke-32, yaitu multimodal, berjajar dengan CLIP, DALL-E, Flamingo, Unified-IO, dan Zero-shot. Istilah-istilah seputar generative AI tersebar penempatannya: large language model (LLM) tercantum di bagian ke-27, natural language processing, dan RLHF tercantum di bagian ke-29, deep reinforcement learning. Yang berjajar di bagian ke-31, transfer learning dan fine-tuning, adalah Few-shot, One-shot, self-supervised learning, model yang sudah dipra-latih, dan catastrophic forgetting. Memahami bagian materi mana yang memuat istilah apa memudahkan menangkap gambaran keseluruhan cakupan materi.

Soal 39 | SHAP

Apa gagasan dasar SHAP, salah satu metode explainable AI (XAI)?

  1. Mengukur pentingnya fitur dari penurunan akurasi setelah nilai fitur sengaja ditukar
  2. Menunjukkan bagian gambar mana yang dilihat untuk mengambil keputusan dalam bentuk seperti peta panas
  3. Menerapkan model sederhana di sekitar prediksi lalu menjelaskan dengan koefisiennya
  4. Menggunakan gagasan teori permainan kooperatif untuk menunjukkan kontribusi tiap fitur secara terbagi
JawabanD. Menggunakan gagasan teori permainan kooperatif untuk menunjukkan kontribusi tiap fitur secara terbagi

SHAP adalah metode yang meminjam gagasan dari teori permainan kooperatif untuk membagi kontribusi tiap fitur terhadap prediksi secara adil. Yang menunjukkan bagian gambar mana yang dilihat untuk mengambil keputusan dalam bentuk seperti peta panas adalah CAM atau Grad-CAM, yang mengukur pentingnya fitur dari penurunan akurasi setelah nilai fitur sengaja ditukar adalah Permutation Importance, dan yang menerapkan model sederhana di sekitar tiap prediksi lalu menjelaskan dengan koefisiennya adalah LIME. Semua ini tercantum pada bagian ke-33, interpretabilitas model, pada silabus, dan upaya menunjukkan dasar pengambilan keputusan dalam bentuk yang dapat dipahami manusia secara keseluruhan disebut explainable AI (XAI).

Soal 40 | Lottery ticket hypothesis

Apa isi dari lottery ticket hypothesis terkait pengecilan (kompresi) model?

  1. Gagasan bahwa performa dapat dipertahankan dengan membuat model kecil belajar dari output model guru yang besar
  2. Gagasan bahwa di dalam jaringan besar terdapat bagian yang bisa mencapai performa setara meski dilatih sendirian
  3. Gagasan bahwa semakin besar model, kebutuhan data pelatihan meningkat secara eksponensial
  4. Gagasan bahwa penurunan presisi angka yang merepresentasikan bobot hanya menyebabkan penurunan akurasi yang sangat kecil
JawabanB. Gagasan bahwa di dalam jaringan besar terdapat bagian yang bisa mencapai performa setara meski dilatih sendirian

Lottery ticket hypothesis adalah hipotesis bahwa di dalam jaringan besar terdapat sub-jaringan tertentu, yang jika diambil dan dilatih sendirian pun bisa mencapai performa setara dengan keseluruhan jaringan; sub-jaringan semacam ini disebut bagian 'pemenang undian'. Hipotesis ini diceritakan sebagai latar belakang yang menjelaskan mengapa pruning, yaitu memangkas koneksi atau layer dengan kontribusi kecil, dapat berhasil. Yang membuat model kecil belajar dari output model guru yang besar adalah distilasi, dan yang menurunkan presisi angka yang merepresentasikan bobot adalah kuantisasi; ketiganya bersama pruning inilah yang menjadi metode pengecilan pada silabus, dan secara keseluruhan disebut kompresi model. Kebutuhan data pelatihan yang melonjak drastis adalah topik kutukan dimensi. Contoh khas yang membutuhkan pengecilan model adalah edge AI, yang menjalankan inferensi di sisi perangkat.

Latihan: kerjakan soal di halaman ini

Ini adalah alat latihan dengan soal acak (berfungsi jika JavaScript aktif). Semua soal dan penjelasan di atas tetap dapat dibaca tanpa alat ini.

* Pembahasan ini merupakan informasi untuk keperluan belajar. Cakupan dan sistem ujian dapat berubah setiap tahun, jadi selalu periksa pengumuman resmi dari lembaga penyelenggara ujian.

Halaman ini adalah terjemahan dari teks asli berbahasa Jepang. Jika terdapat perbedaan antara terjemahan dan teks asli, versi bahasa Jepang yang berlaku. Lihat teks asli bahasa Jepang