Manakah pernyataan yang benar tentang perceptron sederhana (simple perceptron)?
Hanya terdiri dari input layer dan output layer, sehingga hanya bisa menyelesaikan masalah yang dapat dipisahkan secara linear
Mahir mengambil fitur lokal dengan menggeser filter di atas gambar
Memiliki koneksi yang mengembalikan status ke arah waktu sebelumnya, sehingga dapat menangani data sekuensial sesuai urutannya
Memiliki beberapa hidden layer sehingga bisa melakukan pemisahan non-linear, termasuk merepresentasikan XOR
JawabanA. Hanya terdiri dari input layer dan output layer, sehingga hanya bisa menyelesaikan masalah yang dapat dipisahkan secara linear
Perceptron sederhana adalah neural network paling sederhana yang hanya terdiri dari input layer dan output layer, dan hanya bisa menyelesaikan masalah yang dapat dipisahkan secara linear dengan satu garis lurus. XOR (exclusive OR) memiliki titik-titik output 1 dan 0 yang tersusun bergantian secara diagonal, sehingga tidak bisa dipisahkan dengan garis lurus mana pun dan tidak dapat direpresentasikan oleh perceptron sederhana. Multilayer perceptron yang menambahkan hidden layer sehingga batasnya bisa dilipat dapat merepresentasikan XOR, dan pilihan pertama menggambarkan multilayer perceptron tersebut. Yang mengembalikan status waktu sebelumnya untuk menangani data sekuensial adalah recurrent neural network, dan yang mengambil fitur lokal dengan menggeser filter adalah convolutional layer.
Soal 2 | Keunggulan GPU
Apa alasan yang paling tepat mengapa GPU dianggap cocok untuk pelatihan (training) deep learning?
Karena kapasitas penyimpanan untuk menyimpan data pelatihan jauh lebih besar dibanding CPU
Karena rantai turunan (chain rule) yang dipakai pada backpropagation sudah tertanam sebagai sirkuit khusus sejak awal
Karena mampu menjalankan proses kompleks dengan banyak percabangan secara cepat dan berurutan dengan sedikit core yang kuat
Karena memiliki banyak core komputasi kecil dan bisa memproses perhitungan yang sama secara paralel sekaligus
JawabanD. Karena memiliki banyak core komputasi kecil dan bisa memproses perhitungan yang sama secara paralel sekaligus
Pelatihan deep learning adalah komputasi yang mengulang perkalian dan penjumlahan matriks dan vektor dalam jumlah sangat besar. GPU memiliki banyak core kecil yang melakukan operasi sederhana dan cocok untuk menjalankan perhitungan yang sama secara paralel sekaligus, sehingga sangat sesuai dengan bentuk komputasi ini. Menjalankan proses dengan banyak percabangan secara cepat dan berurutan dengan sedikit core yang kuat justru merupakan keunggulan CPU, yang jumlah core-nya tidak banyak. Keunggulan GPU bukan pada kapasitas penyimpanan, melainkan pada tingkat paralelisme. Tidak benar bahwa chain rule tertanam sebagai sirkuit khusus, dan yang dirancang khusus untuk operasi tensor deep learning adalah TPU.
Soal 3 | Penyebab vanishing gradient
Mengapa penggunaan fungsi sigmoid pada hidden layer mudah menyebabkan masalah vanishing gradient?
Karena output berada dalam rentang 0 sampai 1, sehingga output itu sendiri mendekati 0 saat layer ditumpuk
Karena jumlah total output dinormalisasi menjadi 1, sehingga nilainya mengecil di setiap layer
Karena nilai maksimum turunannya adalah 0,25, dan nilai ini terus dikalikan setiap kali mundur ke layer sebelumnya
Karena output selalu 0 untuk input negatif, sehingga unit tersebut berhenti belajar
JawabanC. Karena nilai maksimum turunannya adalah 0,25, dan nilai ini terus dikalikan setiap kali mundur ke layer sebelumnya
Masalah vanishing gradient adalah fenomena ketika gradient mendekati 0 selama backpropagation sehingga layer di sisi input tidak lagi belajar. Fungsi sigmoid memiliki nilai maksimum turunan hanya 0,25, sehingga setiap kali mundur ke layer sebelumnya, angka sebesar 0,25 atau kurang terus dikalikan, dan pada jaringan yang dalam gradient hampir tidak tersisa. Yang menjadi masalah bukan nilai output itu sendiri, melainkan besarnya turunannya. Gradient menjadi 0 untuk input negatif sehingga pembelajaran berhenti adalah kelemahan fungsi ReLU, dan fungsi Leaky ReLU dibuat untuk mengatasi hal ini. Yang menormalisasi jumlah total output menjadi 1 adalah fungsi softmax.
Soal 4 | Fungsi ReLU
Manakah penjelasan yang tepat mengenai fungsi ReLU?
Fungsi berbentuk kurva S yang memampatkan input ke rentang 0 sampai 1
Fungsi yang menormalisasi seluruh output secara bersamaan agar jumlah totalnya menjadi 1
Fungsi yang memampatkan input ke rentang -1 sampai 1 dan berbentuk simetris terhadap titik asal
Fungsi yang mengembalikan nilai input apa adanya jika positif, dan mengembalikan 0 jika negatif
JawabanD. Fungsi yang mengembalikan nilai input apa adanya jika positif, dan mengembalikan 0 jika negatif
Fungsi ReLU adalah fungsi sederhana yang mengembalikan nilai input apa adanya jika positif, dan 0 jika negatif. Karena turunannya selalu 1 pada daerah positif, gradient tidak mengecil meski mundur ke layer sebelumnya, sehingga masalah vanishing gradient dapat banyak dikurangi. Namun pada daerah negatif turunannya menjadi 0, sehingga unit yang terlanjur masuk ke sisi negatif bisa berhenti belajar, dan untuk itu disediakan fungsi Leaky ReLU yang memberi sedikit kemiringan pada sisi negatif. Kurva berbentuk S yang memampatkan ke 0 sampai 1 adalah fungsi sigmoid, yang simetris terhadap titik asal pada rentang -1 sampai 1 adalah fungsi tanh, dan yang menormalisasi jumlah total output menjadi 1 adalah fungsi softmax.
Soal 5 | Leaky ReLU
Fungsi Leaky ReLU dibuat untuk mengatasi kelemahan fungsi ReLU yang seperti apa?
Jumlah total output tidak menjadi 1 sehingga tidak dapat diinterpretasikan sebagai probabilitas
Gradient menjadi 0 untuk input negatif sehingga unit tersebut berhenti belajar
Perhitungannya mengandung fungsi eksponensial sehingga beban proses per operasi menjadi berat
Gradient tetap 1 untuk input positif sehingga besar update-nya menjadi berlebihan
JawabanB. Gradient menjadi 0 untuk input negatif sehingga unit tersebut berhenti belajar
Fungsi ReLU menghasilkan output maupun turunan 0 pada daerah negatif, sehingga jika input sebuah unit terus-menerus negatif, gradient tidak mengalir dan unit tersebut tidak akan pernah belajar lagi. Fungsi Leaky ReLU menghindari jalan buntu ini dengan memberikan sedikit kemiringan juga pada sisi negatif. Gradient yang bernilai 1 pada daerah positif justru merupakan keunggulan fungsi ReLU, bukan kelemahan, dan sifat inilah yang mencegah vanishing gradient. Jumlah total output yang tidak menjadi 1 adalah hal wajar bagi fungsi aktivasi, dan untuk output layer yang ingin dibaca sebagai probabilitas digunakan fungsi softmax. Yang perhitungannya mengandung fungsi eksponensial adalah fungsi sigmoid dan tanh, sedangkan fungsi ReLU justru ringan secara komputasi.
Soal 6 | Softmax
Manakah penggunaan khas dari fungsi softmax?
Ditempatkan pada output layer masalah regresi, mengeluarkan nilai kontinu apa adanya
Digunakan sebagai fungsi aktivasi hidden layer, memberi non-linearitas pada layer
Ditempatkan pada output layer klasifikasi biner, mengeluarkan probabilitas salah satu kelas
Ditempatkan pada output layer klasifikasi multi-kelas, mengeluarkan probabilitas tiap kelas
JawabanD. Ditempatkan pada output layer klasifikasi multi-kelas, mengeluarkan probabilitas tiap kelas
Fungsi softmax menormalisasi keseluruhan output agar jumlah totalnya tepat 1, sehingga ditempatkan pada output layer klasifikasi multi-kelas (kelas berjumlah 3 atau lebih) dan dibaca sebagai probabilitas keanggotaan tiap kelas. Fungsi error yang biasa dipasangkan adalah cross entropy. Yang ditempatkan pada output layer klasifikasi biner untuk mengeluarkan probabilitas adalah fungsi sigmoid, dan yang banyak digunakan sebagai fungsi aktivasi hidden layer adalah fungsi ReLU atau tanh. Pada masalah regresi, output layer mengeluarkan nilai apa adanya dan fungsi error yang digunakan adalah mean squared error.
Soal 7 | Fungsi error untuk regresi
Pada masalah regresi yang memprediksi nilai kontinu seperti harga rumah, fungsi error apa yang secara umum dipilih sebagai dasar?
Cross entropy, yang mengukur selisih antara distribusi probabilitas prediksi dan distribusi jawaban benar
Triplet loss, yang melatih hubungan jarak dari tiga data sekaligus
Contrastive loss, yang melatih apakah dua data sama atau tidak berdasarkan jarak
Mean squared error, yang mengkuadratkan selisih antara prediksi dan jawaban benar lalu merata-ratakannya
JawabanD. Mean squared error, yang mengkuadratkan selisih antara prediksi dan jawaban benar lalu merata-ratakannya
Karena regresi adalah masalah menebak nilai kontinu, mean squared error yang langsung mengkuadratkan selisih antara prediksi dan jawaban benar lalu merata-ratakannya menjadi pilihan yang wajar. Cross entropy adalah fungsi yang mengukur selisih antar distribusi probabilitas dan digunakan untuk masalah klasifikasi, umumnya dipasangkan dengan fungsi softmax pada output layer untuk klasifikasi multi-kelas. Triplet loss melatih hubungan jarak dari tiga data (anchor, positif, negatif), sedangkan contrastive loss melatih apakah dua data sama atau tidak berdasarkan jarak; keduanya adalah fungsi error untuk mendapatkan representasi yang mengukur kemiripan. Memilih fungsi error sesuai tugas adalah inti dari bagian materi ini.
Soal 8 | Error dari tiga data
Manakah penjelasan yang tepat mengenai fungsi error Triplet Loss?
Mengkuadratkan selisih antara prediksi dan jawaban benar lalu merata-ratakannya, mengukur langsung selisih besaran nilai
Mengukur selisih antara distribusi probabilitas prediksi dan distribusi jawaban benar, digunakan luas untuk pelatihan klasifikasi
Menggunakan tiga data yaitu anchor, contoh positif, dan contoh negatif, agar contoh positif lebih dekat dibanding contoh negatif
Mengukur jarak antara dua distribusi probabilitas dan bekerja untuk mendekatkan keduanya
JawabanC. Menggunakan tiga data yaitu anchor, contoh positif, dan contoh negatif, agar contoh positif lebih dekat dibanding contoh negatif
Triplet loss adalah fungsi error yang menggunakan tiga data yaitu data acuan (anchor), data sejenis (contoh positif), dan data berbeda jenis (contoh negatif), lalu melatih agar jarak antara anchor dan contoh positif menjadi lebih kecil daripada jarak antara anchor dan contoh negatif. Fungsi ini digunakan saat membangun ruang representasi yang menyatakan kemiripan lewat jarak. Yang mengukur jarak antara dua distribusi probabilitas adalah Kullback-Leibler divergence (KL), yang mengkuadratkan selisih prediksi dan jawaban benar lalu merata-ratakannya adalah mean squared error, dan yang mengukur selisih distribusi probabilitas serta digunakan luas untuk klasifikasi adalah cross entropy. Perlu dicatat, contrastive loss yang melatih sama-tidaknya dua data juga termasuk dalam bagian materi yang sama.
Soal 9 | Backpropagation
Manakah penjelasan yang paling tepat mengenai backpropagation (metode propagasi balik error)?
Prosedur update itu sendiri yang langsung menulis ulang bobot secara berurutan mulai dari output layer
Prosedur yang menggerakkan bobot sedikit demi sedikit secara acak dan memilih arah yang mengurangi error
Prosedur yang menjalankan perhitungan secara berurutan dari sisi input ke sisi output untuk mendapatkan output
Prosedur yang menggunakan chain rule untuk menelusuri mundur dari sisi output ke sisi input guna mencari gradient
JawabanD. Prosedur yang menggunakan chain rule untuk menelusuri mundur dari sisi output ke sisi input guna mencari gradient
Backpropagation adalah metode yang menggunakan chain rule, yaitu memecah turunan fungsi komposisi menjadi perkalian turunan tiap komponennya, untuk mencari gradient tiap bobot secara efisien dengan menelusuri mundur dari sisi output ke sisi input. Yang diperoleh di sini hanyalah gradient, sedangkan yang benar-benar menggerakkan bobot menggunakan gradient tersebut adalah tugas gradient descent. Perlu hati-hati karena mengatakan backpropagation itu sendiri yang mengupdate bobot adalah kurang tepat. Menggerakkan secara acak lalu memilih arah yang baik adalah pendekatan pencarian tanpa gradient, sedangkan menjalankan perhitungan dari sisi input ke sisi output adalah forward propagation, yaitu prosedur inferensi.
Soal 10 | Credit assignment problem
Masalah menentukan seberapa besar tanggung jawab setiap unit di setiap layer atas error akhir disebut apa?
Credit assignment problem
Masalah exploding gradient
Masalah vanishing gradient
Kutukan dimensi (curse of dimensionality)
JawabanA. Credit assignment problem
Credit assignment problem adalah masalah menentukan seberapa besar tanggung jawab yang harus dibebankan pada unit di layer mana untuk error yang muncul di output. Backpropagation diposisikan sebagai metode yang membuat pembagian tanggung jawab ini dapat dihitung melalui chain rule. Masalah vanishing gradient adalah fenomena ketika gradient mendekati 0 saat ditelusuri mundur sehingga layer sisi input tidak lagi belajar, sedangkan masalah exploding gradient adalah kebalikannya, yaitu gradient membesar berlebihan hingga divergen; keduanya adalah masalah yang muncul ketika menerapkan backpropagation. Kutukan dimensi adalah fenomena kebutuhan data yang melonjak seiring bertambahnya dimensi fitur, dan dalam silabus ditempatkan pada bagian materi machine learning.
Soal 11 | Regularisasi L1
Manakah ciri khas regularisasi L1?
Menjadikan jumlah kuadrat bobot sebagai penalti, membuat nilai menjadi kecil merata tetapi sulit menjadi 0
Menjadikan jumlah nilai absolut bobot sebagai penalti, membuat nilai mudah menjadi tepat 0
Menonaktifkan unit secara acak setiap kali pelatihan untuk mencegah ketergantungan yang timpang
Menghentikan pelatihan begitu error pada data validasi mulai memburuk
JawabanB. Menjadikan jumlah nilai absolut bobot sebagai penalti, membuat nilai mudah menjadi tepat 0
Regularisasi L1 adalah regularisasi yang menambahkan jumlah nilai absolut bobot sebagai penalti ke fungsi error, sehingga bobot mudah terdorong hingga tepat 0. Akibatnya, koefisien fitur yang tidak terpakai menjadi 0 dan otomatis tereliminasi, sehingga muncul efek seleksi fitur. Kondisi ini disebut sparse. Yang menjadikan jumlah kuadrat bobot sebagai penalti adalah regularisasi L2, yang membuat nilai kecil merata tetapi sulit menjadi 0. Yang menonaktifkan unit secara acak saat pelatihan adalah dropout, dan yang menghentikan pelatihan saat error validasi mulai memburuk adalah early stopping; keduanya sama-sama mengatasi overfitting tetapi dengan mekanisme berbeda.
Soal 12 | Ridge regression
Regularisasi apa yang digunakan pada ridge regression?
Regularisasi L0, yang menjadikan banyaknya bobot yang tidak nol sebagai penalti
Regularisasi L2, yang menambahkan jumlah kuadrat bobot sebagai penalti
Regularisasi L1, yang menjadikan jumlah nilai absolut bobot sebagai penalti
Dropout, yang menonaktifkan unit secara acak saat pelatihan
JawabanB. Regularisasi L2, yang menambahkan jumlah kuadrat bobot sebagai penalti
Ridge regression adalah metode yang menggabungkan regresi linear dengan regularisasi L2. Karena jumlah kuadrat bobot ditambahkan sebagai penalti, seluruh koefisien tertekan menjadi kecil sehingga overfitting dapat dicegah. Yang menggabungkan regresi linear dengan regularisasi L1 adalah lasso regression, yang koefisiennya mudah menjadi tepat 0 sehingga menghasilkan solusi sparse. Kesesuaian L1 dengan lasso dan L2 dengan ridge mudah tertukar, sehingga sebaiknya diingat sebagai pasangan. Regularisasi L0 adalah gagasan yang menjadikan banyaknya bobot yang tidak nol itu sendiri sebagai penalti, tetapi karena jumlah tersebut tidak dapat diturunkan, sulit dimasukkan ke pelatihan berbasis gradient. Dropout adalah metode regularisasi untuk neural network.
Soal 13 | Dropout
Manakah penjelasan yang tepat mengenai dropout?
Membalik gambar secara horizontal atau memotongnya untuk memperbanyak data pelatihan itu sendiri
Menonaktifkan sebagian unit secara acak dengan proporsi tertentu saat pelatihan untuk menekan overfitting
Menghentikan pelatihan begitu error pada data validasi mulai naik untuk mencegah overfitting
Menata output hidden layer dalam mini-batch agar rata-rata 0 dan variansi 1 supaya pelatihan lebih stabil
JawabanB. Menonaktifkan sebagian unit secara acak dengan proporsi tertentu saat pelatihan untuk menekan overfitting
Dropout adalah metode yang menonaktifkan sebagian unit hidden layer secara acak dengan proporsi tertentu setiap kali pelatihan dilakukan. Karena setiap kali pelatihan dilakukan dengan bentuk jaringan yang sedikit berbeda, model tidak bisa bergantung sepenuhnya pada kombinasi unit tertentu, sehingga diperoleh efek seperti merata-ratakan banyak model. Penonaktifan hanya dilakukan saat pelatihan, sedangkan saat inferensi semua unit digunakan. Meski namanya mirip, dalam silabus dropout diklasifikasikan sebagai regularisasi nomor 14, bukan sebagai normalization layer nomor 19. Yang menata distribusi dalam mini-batch adalah batch normalization, yang memperbanyak data adalah data augmentation, dan yang menghentikan pelatihan karena error memburuk adalah early stopping.
Soal 14 | Pembelajaran mini-batch
Manakah penjelasan yang tepat mengenai pembelajaran mini-batch?
Cara yang tidak mengupdate bobot dan terus memakai nilai yang sudah ditentukan sebelumnya
Cara yang mencari gradient dari seluruh data pelatihan lalu mengupdate bobot hanya satu kali
Cara yang mengupdate bobot per kelompok berisi puluhan hingga ratusan data
Cara yang mengupdate bobot setiap kali satu data pelatihan digunakan
JawabanC. Cara yang mengupdate bobot per kelompok berisi puluhan hingga ratusan data
Pembelajaran mini-batch adalah cara yang membagi data pelatihan menjadi kelompok berisi puluhan hingga ratusan data, lalu mencari gradient dan mengupdate bobot per kelompok tersebut. Sifatnya berada di tengah antara online learning yang mengupdate per satu data (sehingga gradient-nya tidak terlalu bervariasi tiap kali) dan batch learning yang mengupdate hanya sekali dengan seluruh data (sehingga tidak terlalu berat secara komputasi), sehingga dalam praktiknya cara inilah yang paling banyak dipakai. Stochastic gradient descent (SGD) mencari gradient hanya dari sebagian data, sehingga fluktuasinya justru membantu keluar dari saddle point atau local optimum yang dangkal. Tidak mengupdate bobot bukanlah pembelajaran, melainkan sekadar inferensi.
Soal 15 | Epoch
Manakah hubungan yang tepat antara epoch dan iterasi?
Epoch menunjuk pada ukuran mini-batch, iterasi menunjuk pada besar learning rate
Epoch menunjuk pada satu putaran penuh data, iterasi menunjuk pada satu kali update bobot
Epoch menunjuk pada satu kali update bobot, iterasi menunjuk pada satu putaran penuh data
Epoch dan iterasi sama-sama menunjuk pada satu putaran penuh data
JawabanB. Epoch menunjuk pada satu putaran penuh data, iterasi menunjuk pada satu kali update bobot
Epoch menunjuk pada satu putaran penuh seluruh data pelatihan, sedangkan iterasi menunjuk pada satu kali update bobot. Keduanya terhubung melalui ukuran mini-batch, sehingga jumlah iterasi per epoch sama dengan jumlah data dibagi ukuran mini-batch. Misalnya jika 3000 data diproses dengan ukuran mini-batch 50, maka 1 epoch sama dengan 60 iterasi. Jika ukuran mini-batch diperbesar, gradient tiap kali menjadi lebih stabil tetapi jumlah update per epoch berkurang; jika diperkecil, update bertambah tetapi variasinya membesar. Baik ukuran mini-batch maupun learning rate adalah hyperparameter yang ditentukan manusia sebelumnya, dan berbeda konsep dari epoch maupun iterasi.
Soal 16 | Saddle point
Manakah penjelasan yang tepat mengenai saddle point?
Titik yang tampak sebagai minimum jika dilihat dari satu arah, tetapi menjadi maksimum jika dilihat dari arah lain
Titik dengan error paling kecil di sekitarnya saja, padahal ada titik yang lebih baik secara keseluruhan
Wilayah dengan nilai error yang tetap sama di seluruh rentang tanpa kemiringan ke arah mana pun
Titik dengan error paling kecil di antara seluruh rentang nilai yang mungkin
JawabanA. Titik yang tampak sebagai minimum jika dilihat dari satu arah, tetapi menjadi maksimum jika dilihat dari arah lain
Saddle point adalah titik yang tampak seperti lembah dari satu arah, tetapi menjadi puncak jika dilihat dari arah lain, sehingga dinamai demikian karena bentuknya menyerupai pelana kuda. Pada deep learning yang memiliki jumlah parameter sangat besar, terjebak di saddle point dianggap lebih sering terjadi dibanding menemukan local optimum yang menjadi lembah dari segala arah sekaligus. Titik dengan error paling kecil di seluruh rentang adalah global optimum, sedangkan yang paling kecil hanya di sekitarnya saja adalah local optimum. Stochastic gradient descent (SGD) memiliki gradient yang bervariasi, sehingga lebih mudah keluar dari kemacetan semacam ini.
Soal 17 | Adam
Adam merupakan metode optimasi yang menggabungkan gagasan apa saja?
Menggabungkan dua jenis penalti, yaitu jumlah nilai absolut bobot dan jumlah kuadrat bobot
Menggabungkan gagasan yang memakai inersia dan gagasan yang mengadaptasikan learning rate
Bergantian menerapkan dua cara, yaitu batch learning dan online learning
Menggabungkan dua jenis pencarian, yaitu grid search dan random search
JawabanB. Menggabungkan gagasan yang memakai inersia dan gagasan yang mengadaptasikan learning rate
Adam adalah metode optimasi yang menggabungkan gagasan momentum, yang menambahkan besar update sebelumnya sebagai inersia, dengan gagasan RMSprop, yang menyesuaikan learning rate secara otomatis untuk setiap parameter, dan sering dipakai sebagai nilai baku dalam praktik. Rangkaian metode yang mengadaptasikan learning rate dimulai dari AdaGrad; AdaGrad menurunkan learning rate untuk parameter yang updatenya besar, tetapi karena terus menurun tanpa henti, RMSprop melonggarkannya lewat rata-rata bergerak eksponensial. Dalam rangkaian yang sama juga terdapat AdaDelta, AdaBound, dan AMSBound. Penalti pada bobot adalah topik regularisasi, sedangkan grid search dan random search adalah topik pencarian hyperparameter; keduanya bukan aturan update itu sendiri.
Soal 18 | No free lunch
Apa yang dinyatakan oleh teorema no free lunch?
Tidak ada algoritma serbaguna yang lebih unggul dibanding algoritma lain untuk segala masalah
Kebutuhan data pelatihan meningkat drastis seiring bertambahnya dimensi fitur
Jika learning rate terus diturunkan, global optimum pasti akan tercapai
Error model sempat memburuk lebih dulu lalu turun kembali ketika model diperbesar
JawabanA. Tidak ada algoritma serbaguna yang lebih unggul dibanding algoritma lain untuk segala masalah
Teorema no free lunch menyatakan bahwa jika dirata-ratakan pada seluruh kemungkinan masalah, tidak ada algoritma serbaguna yang lebih unggul dibanding semua algoritma lainnya. Oleh karena itu, pemilihan metode harus dipikirkan per masalah, dan tidak ada jawaban yang selalu berlaku untuk digunakan kapan saja. Error yang sempat memburuk lalu turun kembali saat model diperbesar adalah double descent, yang juga termasuk dalam bagian materi yang sama. Kebutuhan data yang melonjak drastis seiring bertambahnya dimensi fitur adalah kutukan dimensi (curse of dimensionality). Tidak ada jaminan bahwa terus menurunkan learning rate pasti akan mencapai global optimum, karena bisa saja berhenti di local optimum atau saddle point.
Soal 19 | Random search
Manakah penjelasan yang tepat mengenai random search sebagai metode pencarian hyperparameter?
Menyusun nilai kandidat dalam bentuk kisi (grid) lalu mencoba seluruh kombinasi secara berurutan
Menonaktifkan unit secara acak setiap kali pelatihan untuk mendapatkan perilaku rata-rata
Menghentikan pelatihan itu sendiri begitu error data validasi mulai memburuk
Memilih titik secara acak dari dalam rentang pencarian lalu mencoba kombinasi tersebut
JawabanD. Memilih titik secara acak dari dalam rentang pencarian lalu mencoba kombinasi tersebut
Random search adalah metode yang memilih titik secara acak dari dalam rentang pencarian hyperparameter lalu mencobanya. Berbeda dengan grid search yang menyusun kandidat dalam bentuk kisi dan mencoba semuanya secara menyeluruh, random search tidak banyak menghabiskan percobaan pada hyperparameter yang tidak berpengaruh, sehingga bisa mengeksplorasi sumbu yang berpengaruh dengan lebih rinci pada jumlah percobaan yang sama. Nilai yang ditentukan manusia sebelumnya seperti learning rate, ukuran mini-batch, atau jumlah layer adalah hyperparameter. Menghentikan pelatihan karena error validasi memburuk adalah early stopping, dan menonaktifkan unit secara acak saat pelatihan adalah dropout; keduanya bukan metode pencarian.
Soal 20 | Fenomena double descent
Fenomena ketika error validasi sempat memburuk terlebih dahulu lalu turun kembali seiring bertambahnya ukuran model atau jumlah pelatihan disebut apa?
Masalah exploding gradient
Perolehan invariansi
Fenomena double descent
Credit assignment problem
JawabanC. Fenomena double descent
Fenomena double descent adalah fenomena ketika error validasi sempat memburuk lebih dulu saat ukuran model atau jumlah pelatihan diperbesar, lalu jika terus diperbesar lagi error tersebut mulai turun kembali. Namanya berasal dari kurva error yang turun dua kali. Fenomena ini bertentangan dengan intuisi sederhana bahwa model yang semakin besar akan semakin overfitting dan memburuk, tetapi dimasukkan ke dalam bagian metode optimasi pada silabus sebagai salah satu kerangka yang menjelaskan pengalaman belakangan ini bahwa model yang lebih besar terkadang justru memberi hasil yang lebih baik. Credit assignment problem adalah masalah menentukan unit mana yang bertanggung jawab atas error, masalah exploding gradient adalah masalah gradient yang divergen saat backpropagation, dan perolehan invariansi adalah peran dari pooling layer.
Soal 21 | Convolutional layer
Manakah ciri khas convolutional layer dibandingkan dengan fully connected layer?
Terhubung dengan seluruh unit di layer sebelumnya, sehingga bobot bertambah seiring besarnya input
Memakai ulang filter yang sama dengan menggeser posisinya, sehingga bisa mengambil fitur dengan sedikit bobot
Mengembalikan status waktu sebelumnya ke input, sehingga bisa menangani data sekuensial yang punya urutan
Sama sekali tidak memiliki bobot yang dipelajari, dan mengecilkan output dengan mengambil nilai representatif suatu wilayah
JawabanB. Memakai ulang filter yang sama dengan menggeser posisinya, sehingga bisa mengambil fitur dengan sedikit bobot
Convolutional layer mengambil fitur lokal dengan menggeser filter kecil di atas input sambil memakai ulang bobot yang sama. Karena koneksi hanya terbatas pada elemen di sekitarnya dan bobot yang sama dipakai ulang meski posisinya berubah, jumlah parameter untuk menangani gambar menjadi jauh lebih sedikit dibanding fully connected layer. Sebagai efek samping dari pemakaian ulang ini, objek dapat dikenali sebagai fitur yang sama di mana pun posisinya dalam gambar. Yang terhubung dengan seluruh unit di layer sebelumnya adalah fully connected layer, yang tidak memiliki bobot yang dipelajari dan mengambil nilai representatif adalah pooling layer, dan yang mengembalikan status waktu sebelumnya adalah recurrent layer. Hasil melewatkan satu filter disebut feature map, lebar pergeseran disebut stride, dan pengisian di sekeliling input disebut padding.
Soal 22 | Batch normalization
Manakah penjelasan yang tepat mengenai batch normalization?
Menambahkan jumlah kuadrat bobot sebagai penalti ke fungsi error untuk membuat bobot kecil merata
Menonaktifkan unit dengan proporsi tertentu setiap kali pelatihan untuk menghilangkan ketergantungan yang timpang
Menata nilai seluruh layer dalam satu sampel sekaligus sehingga tidak terpengaruh ukuran mini-batch
Menata nilai pada channel yang sama dalam satu mini-batch agar rata-rata 0 dan variansi 1
JawabanD. Menata nilai pada channel yang sama dalam satu mini-batch agar rata-rata 0 dan variansi 1
Batch normalization adalah normalization layer yang menata nilai pada channel yang sama dalam satu mini-batch agar rata-rata 0 dan variansi 1, sehingga pelatihan menjadi lebih stabil dan cepat. Kelemahannya adalah statistiknya menjadi kurang bisa diandalkan jika ukuran mini-batch kecil. Yang menata nilai seluruh layer dalam satu sampel adalah layer normalization, yang tidak terpengaruh ukuran mini-batch sehingga sering dipakai pada model yang menangani data sekuensial. Selain itu ada instance normalization dan group normalization, dan keempatnya inilah yang tercantum sebagai normalization layer pada silabus. Perlu dicatat, pada versi 1.1 nama bagian materi ini berubah dari regularization layer menjadi normalization layer. Regularisasi L2 yang menjadikan jumlah kuadrat bobot sebagai penalti dan dropout yang menonaktifkan unit diklasifikasikan sebagai regularisasi, bukan normalization layer.
Soal 23 | Pooling layer
Apa peran yang paling tepat dari pooling layer?
Melompati layer dan menambahkan input ke layer yang lebih jauh, membuat jalur agar gradient bisa sampai
Menata distribusi output hidden layer agar pelatihan menjadi stabil dan cepat
Mereduksi suatu wilayah menjadi nilai representatif, membuat model tahan terhadap pergeseran posisi kecil
Mengompresi input ke dimensi yang lebih rendah lalu memungkinkan input asli direkonstruksi kembali
JawabanC. Mereduksi suatu wilayah menjadi nilai representatif, membuat model tahan terhadap pergeseran posisi kecil
Pooling layer adalah layer yang mereduksi wilayah berukuran tertentu menjadi satu nilai representatif, dengan max pooling yang mengambil nilai maksimum wilayah dan average pooling yang mengambil rata-ratanya. Selain resolusi menurun sehingga komputasi menjadi lebih ringan, nilai representatif juga tidak mudah berubah meski objek bergeser beberapa piksel, sehingga model menjadi tahan terhadap pergeseran posisi. Hal ini disebut perolehan invariansi. Global average pooling (GAP), yang meratakan seluruh satu feature map menjadi satu nilai, dapat mengurangi jumlah parameter secara besar jika dipakai sebagai pengganti fully connected layer di akhir jaringan. Pooling layer juga berbeda dari convolutional layer karena tidak memiliki bobot yang dipelajari. Yang melompati layer untuk menambahkan input adalah skip connection, yang menata distribusi adalah normalization layer, dan yang mengompresi lalu merekonstruksi adalah autoencoder.
Soal 24 | Skip connection
Mengapa penerapan skip connection membuat pelatihan tetap berjalan meski pada jaringan yang sangat dalam?
Karena terbentuk jalur yang melompati layer, sehingga gradient bisa mencapai sisi input lewat jalur yang dangkal
Karena unit dinonaktifkan secara acak, sehingga tidak lagi bergantung pada jalur tertentu
Karena distribusi output tiap layer menjadi seragam, sehingga variasi nilai tertekan di setiap layer
Karena jumlah bobot berkurang, sehingga tidak mudah overfitting meski data terbatas
JawabanA. Karena terbentuk jalur yang melompati layer, sehingga gradient bisa mencapai sisi input lewat jalur yang dangkal
Skip connection adalah koneksi yang melompati beberapa layer dan menambahkan input langsung ke output layer yang lebih jauh. Saat backpropagation, gradient bisa mencapai sisi input tidak hanya lewat jalur panjang yang melalui banyak layer, tetapi juga lewat jalur pendek yang melompat, sehingga gradient tidak mudah hilang meski ditumpuk sangat dalam. Contoh terkenal yang mewujudkan kedalaman lebih dari 100 layer dengan gagasan ini adalah ResNet, dan dalam silabus ResNet menjadi satu-satunya kata kunci yang ditempatkan di bagian materi skip connection. Yang menonaktifkan unit secara acak adalah dropout, dan yang menata distribusi tiap layer adalah normalization layer; keduanya adalah mekanisme yang berbeda dari skip connection. Skip connection juga bukan cara untuk mengurangi jumlah bobot.
Soal 25 | LSTM dan GRU
Manakah kombinasi yang benar mengenai gate yang dimiliki LSTM dan GRU?
LSTM dan GRU sama-sama memiliki 2 gate yang sama yaitu reset dan update
LSTM dan GRU sama-sama memiliki 3 gate yang sama yaitu input, output, dan forget
LSTM memiliki 3 gate yaitu input, output, dan forget, GRU memiliki 2 gate yaitu reset dan update
LSTM memiliki 2 gate yaitu reset dan update, GRU memiliki 3 gate yaitu input, output, dan forget
JawabanC. LSTM memiliki 3 gate yaitu input, output, dan forget, GRU memiliki 2 gate yaitu reset dan update
LSTM memiliki jalur memori yang disebut CEC untuk menyimpan informasi, dan mengendalikan proses keluar-masuknya dengan 3 gate: input gate yang menentukan apa yang ditulis ke sana, forget gate yang menentukan apa yang dibuang, dan output gate yang menentukan apa yang dikeluarkan. Dengan mekanisme ini, ketergantungan jangka panjang dapat dipertahankan dan masalah vanishing gradient pada recurrent neural network banyak berkurang. GRU adalah versi sederhana dari LSTM, dan hanya memiliki 2 gate yaitu reset gate dan update gate. Parameternya lebih sedikit dan komputasinya lebih ringan, tetapi tidak selalu lebih unggul dibanding LSTM. Perbedaan jumlah gate (3 dan 2), serta fakta bahwa CEC adalah istilah khusus LSTM, adalah pembeda yang berulang kali ditanyakan.
Soal 26 | Jordan network
Manakah struktur yang tepat dari Jordan network?
Mengembalikan output dari output layer ke hidden layer pada waktu berikutnya sebagai input
Mengembalikan output hidden layer ke hidden layer pada waktu berikutnya sebagai input
Mengembalikan output dari output layer ke input layer pada waktu yang sama sebagai input
Melompati input layer langsung ke output layer dan menambahkannya di sana
JawabanA. Mengembalikan output dari output layer ke hidden layer pada waktu berikutnya sebagai input
Jordan network adalah recurrent neural network yang mengembalikan output dari output layer ke hidden layer pada waktu berikutnya sebagai input. Sebaliknya, yang mengembalikan output hidden layer ke hidden layer pada waktu berikutnya adalah Elman network; perbedaan keduanya terletak pada apa yang dikembalikan. Keduanya adalah struktur untuk menangani data time series sesuai urutannya, dan pelatihannya menggunakan BPTT, yaitu menerapkan backpropagation setelah jaringan dibentangkan ke arah waktu. Pada sekuens yang panjang, masalah vanishing gradient dan exploding gradient muncul dengan kuat, sehingga digunakan LSTM atau GRU yang memiliki mekanisme gate. Yang melompati layer untuk menambahkan input adalah skip connection, dan itu bukan tentang arah waktu.
Soal 27 | Attention
Manakah penjelasan yang tepat mengenai Source-Target Attention?
Mekanisme yang menghitung kekuatan hubungan antar elemen di dalam sekuens yang sama
Mekanisme yang menghitung kekuatan hubungan antara dua sekuens yang berbeda
Mekanisme yang menjalankan beberapa cara memperhatikan (attention) secara paralel lalu merangkum hasilnya
Mekanisme yang menambahkan sinyal khas pada tiap posisi untuk memberikan informasi urutan kata
JawabanB. Mekanisme yang menghitung kekuatan hubungan antara dua sekuens yang berbeda
Attention adalah mekanisme yang menghitung bagian mana dari input yang perlu diperhatikan sebagai bobot, dinyatakan dengan tiga komponen yaitu query, key, dan value. Di antaranya, Source-Target Attention menghitung kekuatan hubungan antara dua sekuens yang berbeda, seperti pada penerjemahan di mana sekuens input dan sekuens output terpisah. Yang menghitung hubungan antar elemen di dalam sekuens yang sama adalah Self-Attention, yang menjadi komponen inti dari Transformer. Yang menambahkan sinyal khas pada tiap posisi untuk memberi urutan kata adalah positional encoding, dan yang menjalankan beberapa cara attention secara paralel lalu merangkum hasilnya adalah Multi-Head Attention; keduanya adalah komponen berbeda yang menyusun Transformer.
Soal 28 | Positional encoding
Manakah penjelasan yang tepat mengenai Transformer?
Model yang mengompresi input ke dimensi rendah lalu belajar merekonstruksi kembali input aslinya
Model yang menumpuk convolution dan pooling secara bergantian untuk mengumpulkan fitur lokal secara bertahap
Model yang disusun dengan Attention tanpa koneksi rekursif, dan urutan kata diberikan lewat positional encoding
Model yang menumpuk koneksi rekursif, meneruskan status waktu sebelumnya secara berurutan
JawabanC. Model yang disusun dengan Attention tanpa koneksi rekursif, dan urutan kata diberikan lewat positional encoding
Transformer adalah model sekuens yang disusun dengan Attention sebagai pusatnya tanpa menggunakan koneksi rekursif. Karena tidak perlu menunggu perhitungan waktu sebelumnya, seluruh sekuens dapat diproses secara paralel, dan hubungan antar kata yang berjauhan pun bisa langsung ditangkap dalam satu kali perhitungan. Namun karena diproses secara paralel, informasi urutan kata menjadi hilang, sehingga positional encoding yang menambahkan sinyal khas pada tiap posisi digunakan untuk memberikan urutan kata. Poin jebakan yang sering muncul adalah Transformer bukan salah satu jenis recurrent neural network. Yang menumpuk koneksi rekursif untuk meneruskan status waktu sebelumnya adalah RNN, yang menumpuk convolution dan pooling adalah CNN, dan yang mengompresi lalu merekonstruksi adalah autoencoder.
Soal 29 | VAE
Apa yang membedakan variational autoencoder (VAE) dari autoencoder biasa?
Mengompresi input ke dimensi rendah terlebih dahulu, lalu merekonstruksi input aslinya
Mempelajari hasil kompresi sebagai distribusi probabilitas, bukan sebagai satu titik, sehingga bisa membuat data baru
Dapat melanjutkan pelatihan tanpa perlu menyiapkan label jawaban
Melatih layer satu per satu secara berurutan untuk membuat nilai awal jaringan yang dalam
JawabanB. Mempelajari hasil kompresi sebagai distribusi probabilitas, bukan sebagai satu titik, sehingga bisa membuat data baru
Variational autoencoder (VAE) mempelajari hasil kompresi input sebagai distribusi probabilitas, bukan sebagai satu titik. Dengan mengambil nilai dari distribusi tersebut lalu merekonstruksinya, data baru yang tidak ada pada data pelatihan bisa dibuat, sehingga VAE diperlakukan sebagai model generatif. Mengompresi ke dimensi rendah lalu merekonstruksi, dan bisa dilatih tanpa label jawaban, adalah sifat yang sama-sama dimiliki oleh autoencoder biasa, bukan ciri khusus VAE. Melatih layer satu per satu secara berurutan untuk membuat nilai awal jaringan yang dalam adalah pra-pelatihan menggunakan stacked autoencoder. Silabus juga mencantumkan VQ-VAE, info VAE, dan β-VAE pada bagian materi yang sama.
Soal 30 | Mixup
Di antara metode data augmentation untuk gambar, operasi apa yang dilakukan Mixup?
Memotong sebagian gambar lalu memperbesarnya menjadi contoh baru
Menggabungkan dua gambar menjadi satu contoh baru
Membalik gambar secara horizontal untuk membuat contoh dengan arah yang berbeda
Menutup sebagian gambar dengan kotak untuk menyembunyikan informasi di bagian itu
JawabanB. Menggabungkan dua gambar menjadi satu contoh baru
Mixup adalah metode data augmentation yang menggabungkan dua gambar dengan rasio tertentu, sekaligus mencampur label jawaban dengan rasio yang sama untuk membuat data pelatihan baru. CutMix yang namanya mirip bukan menggabungkan, melainkan memotong sebagian dari dua gambar lalu menempelkannya menjadi satu. Menutup sebagian gambar dengan kotak adalah Cutout atau Random Erasing, membalik secara horizontal adalah Random Flip, dan memotong sebagian gambar adalah Crop. Selain itu ada Rotate yang memutar gambar, Brightness yang mengubah kecerahan, Contrast yang mengubah kontras, dan RandAugment yang menentukan secara otomatis transformasi apa dan seberapa besar diterapkan; untuk teks disebutkan paraphrasing dan noising. Yang penting adalah tidak memilih transformasi yang merusak makna.
Soal 31 | GoogLeNet
Manakah ciri khas GoogLeNet?
Menggunakan Inception module yang menerapkan filter dengan ukuran berbeda-beda secara paralel
Menjuarai ILSVRC 2012 dengan menggunakan fungsi ReLU dan pelatihan berbasis GPU
Memperkenalkan skip connection yang melompati layer, mewujudkan kedalaman lebih dari 100 layer
Menumpuk hanya konvolusi kecil berukuran 3 kali 3 untuk mendapat struktur yang dalam
JawabanA. Menggunakan Inception module yang menerapkan filter dengan ukuran berbeda-beda secara paralel
GoogLeNet adalah model yang menggunakan Inception module, yaitu menerapkan filter dengan ukuran berbeda-beda secara paralel lalu merangkum hasilnya, sehingga mewujudkan struktur yang dalam sambil menekan jumlah parameter. Yang menumpuk hanya konvolusi kecil 3 kali 3 dengan struktur sederhana namun dalam adalah VGG, yang masuk peringkat atas di ILSVRC 2014 bersama GoogLeNet. Yang mewujudkan kedalaman lebih dari 100 layer dengan skip connection yang melompati layer adalah ResNet, dan yang menjuarai ILSVRC 2012 dengan menggabungkan fungsi ReLU, dropout, dan pelatihan berbasis GPU adalah AlexNet. Setelah itu berkembang ke Wide ResNet, DenseNet, SENet, EfficientNet, MobileNet, dan lain-lain, serta Vision Transformer yang membawa gagasan Transformer tanpa menggunakan konvolusi juga tercakup.
Soal 32 | Deteksi satu tahap
Manakah ciri khas yang sama dimiliki oleh YOLO dan SSD?
Mendeteksi objek dengan prosedur dua tahap, yaitu mengeluarkan kandidat wilayah lalu mengklasifikasikannya
Memberi kelas pada setiap piksel untuk mewarnai wilayah gambar
Melakukan ekstraksi kandidat wilayah dan klasifikasi sekaligus dalam satu kali inferensi, mengutamakan kecepatan
Bertujuan untuk memperkirakan posisi titik sendi tubuh manusia guna mendapatkan postur tubuh
JawabanC. Melakukan ekstraksi kandidat wilayah dan klasifikasi sekaligus dalam satu kali inferensi, mengutamakan kecepatan
YOLO dan SSD adalah model deteksi objek satu tahap yang melakukan ekstraksi kandidat wilayah dan penentuan kelas sekaligus dalam satu kali inferensi, dengan kecepatan sebagai keunggulannya. Sebaliknya, rangkaian yang dimulai dari R-CNN dan berkembang menjadi Fast R-CNN serta Faster R-CNN adalah metode dua tahap yang mengeluarkan kandidat wilayah terlebih dahulu baru mengklasifikasikannya, sehingga lebih lambat namun cenderung lebih akurat. Memberi kelas pada tiap piksel adalah semantic segmentation, dengan contoh representatif FCN, SegNet, U-Net, PSPNet, dan DeepLab. Instance segmentation yang membedakan objek dari kelas sama hingga per individu ditangani oleh Mask R-CNN, dan estimasi postur tubuh yang memperkirakan titik sendi tubuh manusia diwakili oleh OpenPose.
Soal 33 | BERT
Manakah penjelasan yang tepat mengenai BERT?
Memetakan gambar dan teks deskripsi ke ruang vektor yang sama untuk menghubungkan keduanya
Membalik proses penambahan noise secara bertahap untuk menghasilkan data sedikit demi sedikit
Menggunakan encoder Transformer, melihat konteks dari kedua arah, depan dan belakang
Menumpuk recurrent layer dan membaca kata satu per satu secara berurutan untuk membentuk konteks
JawabanC. Menggunakan encoder Transformer, melihat konteks dari kedua arah, depan dan belakang
BERT adalah model bahasa yang menggunakan encoder Transformer, dengan ciri khas pra-pelatihan yang melihat konteks dari kedua arah, depan dan belakang kalimat. BERT mempopulerkan cara pemakaian yang melakukan pra-pelatihan dengan teks dalam jumlah besar lalu mengadaptasikannya ke tugas masing-masing. Menumpuk recurrent layer dan membaca kata satu per satu secara berurutan adalah model yang menggunakan recurrent neural network, sedangkan Transformer tidak memiliki koneksi rekursif. Yang memetakan gambar dan teks deskripsi ke ruang vektor yang sama adalah CLIP, yang dalam silabus ditempatkan pada bagian multimodal. Yang membalik proses penambahan noise untuk menghasilkan data adalah Diffusion Model, yang termasuk bagian materi pembuatan data (data generation).
Soal 34 | CBOW
Manakah arah pembelajaran yang tepat dari CBOW pada word2vec?
Belajar menebak kata pusat dari kata-kata yang muncul di sekitarnya
Belajar menebak kata-kata yang muncul di sekitarnya dari kata pusat
Belajar menebak apakah suatu kalimat positif atau negatif dari keseluruhan kalimat
Belajar menebak apakah kalimat lanjutan akan muncul dari kalimat sebelumnya
JawabanA. Belajar menebak kata pusat dari kata-kata yang muncul di sekitarnya
CBOW adalah metode yang belajar menebak kata pusat dari kata-kata yang muncul di sekitarnya. Sebaliknya, yang belajar menebak kata-kata di sekitar dari kata pusat adalah skip-gram, sehingga arahnya berlawanan dan perlu hati-hati agar tidak tertukar. Keduanya adalah metode pada word2vec, dengan tujuan mendapatkan distributed representation, yaitu merepresentasikan kata sebagai vektor padat. Berbeda dari one-hot vector yang memberikan satu dimensi untuk satu kata (sehingga dimensinya menjadi sebesar ukuran kosakata dan tidak bisa merepresentasikan kedekatan antar kata), pada distributed representation kata-kata yang bermakna dekat ditempatkan berdekatan dalam ruang vektor. Menebak apakah suatu kalimat positif atau negatif adalah tugas terapan bernama analisis sentimen, bukan metode pembelajaran representasi kata.
Soal 35 | RLHF
Metode apa yang membuat model reward dari umpan balik manusia lalu menyesuaikan model dengan reinforcement learning?
DQN
A3C
PPO
RLHF
JawabanD. RLHF
RLHF adalah metode yang membuat model reward dari penilaian preferensi yang diberikan manusia, lalu menyesuaikan model dengan reinforcement learning menggunakan reward tersebut. Metode ini dikenal luas dalam penyesuaian model bahasa, tetapi dalam silabus ditempatkan bukan pada bagian natural language processing, melainkan pada bagian deep reinforcement learning, sebuah hal mengejutkan yang perlu diingat karena berguna. DQN adalah metode representatif deep reinforcement learning yang mengaproksimasi fungsi nilai aksi dengan neural network, PPO adalah metode pembelajaran kebijakan yang menekan besar update kebijakan agar stabil, dan A3C adalah metode yang menjalankan beberapa environment secara paralel untuk mempercepat pembelajaran. Pada bagian materi yang sama juga tercantum Double DQN, Dueling Network, Rainbow, Ape-X, dan Agent57.
Soal 36 | Diffusion
Manakah penjelasan yang tepat mengenai Diffusion Model?
Belajar tampilan tiga dimensi dari foto beberapa sudut pandang untuk membuat gambar dari sudut pandang baru
Mempelajari hasil kompresi sebagai distribusi probabilitas, lalu mengambil nilai darinya untuk merekonstruksi
Membuat data yang tampak asli dengan mengadu dua jaringan satu sama lain
Membalik proses penambahan noise secara bertahap untuk menghasilkan data
JawabanD. Membalik proses penambahan noise secara bertahap untuk menghasilkan data
Diffusion Model adalah model generatif yang menghasilkan data dari noise dengan membalik proses penambahan noise secara bertahap pada data. Mekanismenya sama sekali berbeda dari generative adversarial network (GAN), yang belajar dengan mengadu dua jaringan satu sama lain, dan Diffusion Model bukan salah satu jenis GAN. Dari GAN muncul turunan seperti DCGAN, CycleGAN, dan Pix2Pix. Yang belajar tampilan tiga dimensi dari foto beberapa sudut pandang adalah NeRF, dan yang mempelajari hasil kompresi sebagai distribusi probabilitas adalah variational autoencoder (VAE). Perlu dipahami bahwa GAN, VAE, dan Diffusion Model adalah rangkaian yang berbeda dan sejajar satu sama lain.
Soal 37 | Transfer learning
Manakah perbedaan yang tepat antara transfer learning dan fine-tuning?
Transfer learning melatih ulang seluruh bobot, fine-tuning hanya melatih output layer
Baik transfer learning maupun fine-tuning sama-sama melatih bobot dari awal tanpa pra-pelatihan
Transfer learning terutama melatih bagian dekat output layer, fine-tuning melatih ulang rentang yang luas
Transfer learning hanya bisa dipakai untuk gambar, fine-tuning hanya bisa dipakai untuk bahasa
JawabanC. Transfer learning terutama melatih bagian dekat output layer, fine-tuning melatih ulang rentang yang luas
Transfer learning adalah metode yang membiarkan bagian ekstraksi fitur dari model yang sudah dipra-latih tetap tetap, dan hanya melatih bagian dekat output layer dengan tugas baru. Fine-tuning melatih ulang seluruh atau sebagian besar bobot dengan data baru, sehingga membutuhkan lebih banyak data dan komputasi, tetapi cenderung memberikan hasil lebih baik jika domain target jauh berbeda dari data pra-pelatihan. Pada fine-tuning bisa terjadi catastrophic forgetting, yaitu hilangnya kemampuan yang sebelumnya dimiliki model asli. Keduanya sama-sama mengandaikan penggunaan model yang sudah dipra-latih, bukan melatih dari awal. Pemilihan keduanya juga tidak ditentukan oleh jenis data yang ditangani.
Soal 38 | Foundation model
Pada silabus, istilah foundation model ditempatkan di bagian materi apa?
Ditempatkan di transfer learning dan fine-tuning, berjajar dengan Few-shot
Ditempatkan di multimodal, berjajar dengan CLIP dan DALL-E
Ditempatkan di deep reinforcement learning, berjajar dengan DQN dan RLHF
Ditempatkan di natural language processing, berjajar dengan large language model (LLM)
JawabanB. Ditempatkan di multimodal, berjajar dengan CLIP dan DALL-E
Foundation model adalah istilah untuk model besar yang dipra-latih dengan data dalam jumlah besar dan bisa dialihgunakan ke berbagai tugas turunan (downstream task); pada silabus ditempatkan di bagian ke-32, yaitu multimodal, berjajar dengan CLIP, DALL-E, Flamingo, Unified-IO, dan Zero-shot. Istilah-istilah seputar generative AI tersebar penempatannya: large language model (LLM) tercantum di bagian ke-27, natural language processing, dan RLHF tercantum di bagian ke-29, deep reinforcement learning. Yang berjajar di bagian ke-31, transfer learning dan fine-tuning, adalah Few-shot, One-shot, self-supervised learning, model yang sudah dipra-latih, dan catastrophic forgetting. Memahami bagian materi mana yang memuat istilah apa memudahkan menangkap gambaran keseluruhan cakupan materi.
Soal 39 | SHAP
Apa gagasan dasar SHAP, salah satu metode explainable AI (XAI)?
Mengukur pentingnya fitur dari penurunan akurasi setelah nilai fitur sengaja ditukar
Menunjukkan bagian gambar mana yang dilihat untuk mengambil keputusan dalam bentuk seperti peta panas
Menerapkan model sederhana di sekitar prediksi lalu menjelaskan dengan koefisiennya
Menggunakan gagasan teori permainan kooperatif untuk menunjukkan kontribusi tiap fitur secara terbagi
JawabanD. Menggunakan gagasan teori permainan kooperatif untuk menunjukkan kontribusi tiap fitur secara terbagi
SHAP adalah metode yang meminjam gagasan dari teori permainan kooperatif untuk membagi kontribusi tiap fitur terhadap prediksi secara adil. Yang menunjukkan bagian gambar mana yang dilihat untuk mengambil keputusan dalam bentuk seperti peta panas adalah CAM atau Grad-CAM, yang mengukur pentingnya fitur dari penurunan akurasi setelah nilai fitur sengaja ditukar adalah Permutation Importance, dan yang menerapkan model sederhana di sekitar tiap prediksi lalu menjelaskan dengan koefisiennya adalah LIME. Semua ini tercantum pada bagian ke-33, interpretabilitas model, pada silabus, dan upaya menunjukkan dasar pengambilan keputusan dalam bentuk yang dapat dipahami manusia secara keseluruhan disebut explainable AI (XAI).
Soal 40 | Lottery ticket hypothesis
Apa isi dari lottery ticket hypothesis terkait pengecilan (kompresi) model?
Gagasan bahwa performa dapat dipertahankan dengan membuat model kecil belajar dari output model guru yang besar
Gagasan bahwa di dalam jaringan besar terdapat bagian yang bisa mencapai performa setara meski dilatih sendirian
Gagasan bahwa semakin besar model, kebutuhan data pelatihan meningkat secara eksponensial
Gagasan bahwa penurunan presisi angka yang merepresentasikan bobot hanya menyebabkan penurunan akurasi yang sangat kecil
JawabanB. Gagasan bahwa di dalam jaringan besar terdapat bagian yang bisa mencapai performa setara meski dilatih sendirian
Lottery ticket hypothesis adalah hipotesis bahwa di dalam jaringan besar terdapat sub-jaringan tertentu, yang jika diambil dan dilatih sendirian pun bisa mencapai performa setara dengan keseluruhan jaringan; sub-jaringan semacam ini disebut bagian 'pemenang undian'. Hipotesis ini diceritakan sebagai latar belakang yang menjelaskan mengapa pruning, yaitu memangkas koneksi atau layer dengan kontribusi kecil, dapat berhasil. Yang membuat model kecil belajar dari output model guru yang besar adalah distilasi, dan yang menurunkan presisi angka yang merepresentasikan bobot adalah kuantisasi; ketiganya bersama pruning inilah yang menjadi metode pengecilan pada silabus, dan secara keseluruhan disebut kompresi model. Kebutuhan data pelatihan yang melonjak drastis adalah topik kutukan dimensi. Contoh khas yang membutuhkan pengecilan model adalah edge AI, yang menjalankan inferensi di sisi perangkat.
Latihan: kerjakan soal di halaman ini
Ini adalah alat latihan dengan soal acak (berfungsi jika JavaScript aktif). Semua soal dan penjelasan di atas tetap dapat dibaca tanpa alat ini.
* Pembahasan ini merupakan informasi untuk keperluan belajar. Cakupan dan sistem ujian dapat berubah setiap tahun, jadi selalu periksa pengumuman resmi dari lembaga penyelenggara ujian.
Halaman ini adalah terjemahan dari teks asli berbahasa Jepang. Jika terdapat perbedaan antara terjemahan dan teks asli, versi bahasa Jepang yang berlaku. Lihat teks asli bahasa Jepang