Ruang Belajar Karinoya

Kualifikasi · Lab Lulus Cloud / AI / Python

Penerapan Sosial AI serta Hukum dan Etika

Soal dan pembahasan dapat dibaca dalam Bahasa Indonesia. Materi kuliah (artikel penjelasan) hanya tersedia dalam bahasa Jepang.

Lihat versi bahasa Jepang (dengan materi kuliah) →

Soal 1 | CRISP-DM

Pada CRISP-DM, yaitu alur kerja standar proyek analisis data, apa isi tahap yang ditempatkan paling awal?

  1. Memeriksa kualitas dan distribusi data yang ada di tangan, lalu memahami kecenderungannya
  2. Melakukan penanganan missing value dan pembuatan fitur, lalu menyiapkannya untuk pelatihan
  3. Memperjelas masalah bisnis yang harus dipecahkan dan kriteria yang bisa disebut berhasil
  4. Mengimplementasikan model yang telah dibuat ke sistem bisnis dan mengoperasikannya
JawabanC. Memperjelas masalah bisnis yang harus dipecahkan dan kriteria yang bisa disebut berhasil

CRISP-DM terdiri dari 6 tahap: business understanding, data understanding, data preparation, modeling, evaluation, dan deployment. Tahap paling awal adalah business understanding, yaitu menentukan masalah bisnis yang harus dipecahkan dan kriteria yang bisa disebut berhasil. Memeriksa kualitas dan distribusi data adalah data understanding, penanganan missing value dan pembuatan fitur adalah data preparation, dan implementasi ke sistem bisnis adalah deployment. Perlu diingat pula bahwa keenam tahap ini tidak hanya mengalir satu arah, tetapi digambarkan sebagai siklus yang berulang dengan kembali ke tahap sebelumnya.

Soal 2 | PoC

Apa posisi PoC yang paling tepat dalam proyek AI?

  1. Tahap mencoba dalam skala kecil sebelum masuk pengembangan penuh, untuk memastikan kelayakan dan efek
  2. Tahap memberi label jawaban pada data pelatihan sesuai standar yang telah ditetapkan
  3. Tahap menempatkan model yang sudah selesai ke lingkungan produksi, lalu terus memantau dan melatih ulang
  4. Tahap merancang ulang alur kerja bisnis itu sendiri dari sisi tujuannya untuk meningkatkan produktivitas
JawabanA. Tahap mencoba dalam skala kecil sebelum masuk pengembangan penuh, untuk memastikan kelayakan dan efek

PoC adalah proof of concept, yaitu tahap membuat versi kecil dan mencobanya sebelum berinvestasi pada pengembangan penuh, untuk memastikan apakah akurasi yang dibutuhkan bisa dicapai dengan data tersebut, dan jika tercapai, apakah bisnisnya bisa berjalan. Karena tujuannya bukan membuat produk jadi, jika tidak ditentukan lebih dulu syarat untuk melanjutkan dan syarat untuk berhenti sebelum memulai, percobaan yang tidak membuahkan hasil bisa terus berulang. Memantau dan melatih ulang setelah dipasang di produksi adalah MLOps, memberi label jawaban adalah anotasi, dan merancang ulang alur kerja bisnis itu sendiri adalah BPR; semuanya menunjuk tahap yang berbeda dari PoC.

Soal 3 | Anotasi

Manakah penjelasan yang tepat mengenai anotasi yang dilakukan dalam persiapan data untuk machine learning?

  1. Menghilangkan missing value atau outlier dari data yang dikumpulkan lalu menata distribusinya
  2. Mengumpulkan dan menata banyak teks yang dikumpulkan menjadi kumpulan data untuk pemrosesan bahasa
  3. Membagi data yang dikumpulkan menjadi data pelatihan dan data validasi agar performa bisa diukur
  4. Memberikan label jawaban atau informasi wilayah secara manual pada data yang dikumpulkan
JawabanD. Memberikan label jawaban atau informasi wilayah secara manual pada data yang dikumpulkan

Anotasi adalah pekerjaan memberikan label jawaban atau informasi wilayah secara manual pada data mentah, dan tidak terpisahkan dari supervised learning. Jika standar pemberian label bervariasi antar pekerja, batas atas performa model akan ditentukan di sana, sehingga penyusunan pedoman kerja dan pemeriksaan kualitas menjadi kunci. Kumpulan teks yang dikumpulkan dan ditata disebut korpus, sedangkan pembagian data ke pelatihan dan validasi, serta penanganan missing value dan outlier, adalah pekerjaan lain dalam persiapan data; keduanya bukan tindakan pemberian label itu sendiri.

Soal 4 | Leakage

Manakah penjelasan yang paling tepat mengenai data leakage yang disebabkan oleh cara penanganan data pelatihan?

  1. Fenomena akurasi yang diukur sendiri menjadi tidak stabil karena data validasi terlalu sedikit
  2. Fenomena informasi yang sebenarnya tidak tersedia pada saat prediksi tercampur ke pelatihan sehingga performa tampak tidak wajar tinggi
  3. Fenomena performa terhadap data yang belum diketahui menurun karena terlalu menyesuaikan diri dengan data pelatihan
  4. Fenomena kebutuhan data melonjak drastis karena dimensi fitur bertambah terlalu banyak
JawabanB. Fenomena informasi yang sebenarnya tidak tersedia pada saat prediksi tercampur ke pelatihan sehingga performa tampak tidak wajar tinggi

Data leakage adalah fenomena ketika informasi yang seharusnya tidak tersedia pada saat prediksi tercampur ke dalam data pelatihan, sehingga akurasi saat validasi tampak jauh lebih tinggi daripada kemampuan sebenarnya. Contohnya adalah memasukkan tanggal penerimaan prosedur pembatalan ke dalam prediksi churn, menghitung rata-rata atau standar deviasi untuk pra-pemrosesan dari keseluruhan data termasuk data validasi, atau membagi data time series secara acak tanpa memperhatikan waktu. Terlalu menyesuaikan diri dengan data pelatihan adalah overfitting, yang penyebabnya bukan 'menggunakan informasi yang seharusnya tidak boleh dipakai', melainkan 'terlalu menyesuaikan diri'. Kebutuhan data yang melonjak karena dimensi bertambah adalah kutukan dimensi, dan keduanya memiliki penyebab yang berbeda dari leakage.

Soal 5 | MLOps

Apa gagasan MLOps yang paling tepat dalam pengoperasian sistem AI?

  1. Terus memantau data dan akurasi bahkan setelah dipasang, dan menjalankan pelatihan ulang serta pemasangan ulang secara berkelanjutan
  2. Menyewa sumber daya komputasi untuk pelatihan dari cloud dan menekan biaya sesuai pemakaian
  3. Mengumpulkan lingkungan pengembangan ke dalam container agar lingkungan yang sama bisa direproduksi di produksi
  4. Memastikan sekali sebelum dipasang di produksi bahwa akurasi model memenuhi syarat
JawabanA. Terus memantau data dan akurasi bahkan setelah dipasang, dan menjalankan pelatihan ulang serta pemasangan ulang secara berkelanjutan

MLOps adalah gagasan yang tidak berhenti setelah model dipasang, melainkan terus memantau distribusi data input, kecenderungan prediksi, hingga metrik bisnis, lalu jika terjadi penyimpangan, memperbarui data pelatihan untuk membuat ulang model dan memasangnya kembali, dan menjalankan siklus ini sebagai mekanisme yang berkelanjutan. Karena kecenderungan input pun berubah seiring perubahan dunia dan akurasi perlahan menurun, satu kali pemeriksaan saja tidak cukup. Menyewa sumber daya komputasi adalah pemanfaatan cloud, dan mengumpulkan serta mereproduksi lingkungan eksekusi adalah peran Docker; keduanya adalah alat yang mendukung MLOps, tetapi bukan definisi MLOps itu sendiri.

Soal 6 | BPR

Apa isi BPR yang sering dibahas bersamaan dengan penerapan AI?

  1. Mengumpulkan penanggung jawab bisnis untuk mendengarkan kebutuhan mereka terhadap AI
  2. Mengumpulkan data bisnis dan menatanya menjadi bentuk yang bisa dipelajari AI
  3. Merancang ulang alur kerja bisnis itu sendiri dengan kembali ke tujuannya
  4. Menggantikan sebagian pekerjaan dengan AI tanpa mengubah prosedur bisnis yang sudah ada
JawabanC. Merancang ulang alur kerja bisnis itu sendiri dengan kembali ke tujuannya

BPR adalah business process reengineering, yaitu upaya merancang ulang alur kerja itu sendiri dengan kembali ke tujuan bisnis, bukan sekadar memperbaiki sebagian prosedur yang sudah ada. Jika AI hanya dipasang di atas prosedur yang tetap dipertahankan, yang terjadi hanyalah bertambahnya proses manusia menyalin ulang output AI tanpa memberi efek, dan keberhasilan penerapan AI seringkali ditentukan bukan oleh akurasi, melainkan oleh hal ini. Mendengarkan kebutuhan adalah pemahaman kebutuhan pemangku kepentingan, dan menata data agar bisa dipelajari adalah persiapan data; keduanya bukan perancangan ulang proses bisnis itu sendiri.

Soal 7 | Cara pengembangan

Apa alasan paling tepat mengapa waterfall dianggap sulit diterapkan langsung pada pengembangan AI?

  1. Karena pilihan bahasa dan library yang dipakai untuk pengembangan banyak, sehingga standardisasi belum berkembang
  2. Karena jenis pekerjaan yang terlibat dalam pengembangan sangat beragam, sehingga pembagian tahapan sulit ditentukan
  3. Karena akurasi yang bisa dicapai baru diketahui setelah dicoba dilatih, sehingga persyaratan tidak bisa ditetapkan lebih dulu
  4. Karena pengadaan sumber daya komputasi yang dibutuhkan untuk pelatihan memakan waktu, sehingga tahapan tidak berjalan sesuai jadwal
JawabanC. Karena akurasi yang bisa dicapai baru diketahui setelah dicoba dilatih, sehingga persyaratan tidak bisa ditetapkan lebih dulu

Waterfall adalah cara pengembangan yang memastikan tahapan secara berurutan mulai dari definisi kebutuhan dan diasumsikan tidak akan kembali ke tahap sebelumnya. Namun pengembangan AI memiliki sifat bahwa akurasi yang bisa dicapai baru diketahui setelah benar-benar dilatih, sehingga hasil akhir dan persyaratan tidak bisa ditetapkan terlebih dahulu. Oleh karena itu, tahap eksplorasi dan PoC dijalankan dengan pengulangan singkat mengikuti bentuk agile, lalu setelah akurasi bisa diperkirakan, tahap pengembangan utama baru ditetapkan; kombinasi keduanya inilah yang biasa diambil. Sifat ini juga langsung memengaruhi rancangan kontrak, yaitu apakah pengembangan yang dititipkan menggunakan kontrak pemborongan (ukeoi) atau kontrak kuasi-delegasi (junishitaku).

Soal 8 | Docker

Apa tujuan utama pemakaian Docker dalam pengembangan AI?

  1. Mengumpulkan lingkungan eksekusi termasuk library-nya, agar bisa dijalankan dengan kondisi yang sama di lingkungan lain
  2. Mempublikasikan model yang sudah dilatih dalam bentuk yang bisa dipanggil dari sistem lain lewat HTTP
  3. Menyimpan proses pelatihan dan hasil eksekusi beserta teks penjelasannya sebagai satu dokumen
  4. Menyewa sumber daya komputasi dalam jumlah besar hanya selama waktu yang dibutuhkan, lalu mengembalikannya setelah selesai
JawabanA. Mengumpulkan lingkungan eksekusi termasuk library-nya, agar bisa dijalankan dengan kondisi yang sama di lingkungan lain

Docker adalah teknologi yang mengumpulkan lingkungan eksekusi, termasuk aplikasi dan library-nya, sebagai sebuah container. Karena container yang sama bisa dijalankan baik di mesin pengembangan maupun di produksi, masalah 'kok di lingkungan saya jalan' akibat perbedaan versi dapat berkurang. Menyimpan proses dan hasil eksekusi beserta penjelasannya sebagai satu dokumen adalah Jupyter Notebook, membuat model bisa dipanggil lewat HTTP adalah Web API, dan menyewa sumber daya komputasi hanya selama dibutuhkan adalah pemanfaatan cloud; semuanya menunjuk alat lain yang dipakai dalam pengembangan AI.

Soal 9 | Korpus

Manakah penjelasan yang tepat mengenai korpus dalam bidang natural language processing?

  1. Kumpulan data gambar atau audio yang dipublikasikan secara luas untuk riset dan pengembangan
  2. Kumpulan proses analisis morfologi yang memisahkan kalimat menjadi kata dan menentukan jenis katanya
  3. Kumpulan teks dalam jumlah besar yang dikumpulkan dan ditata untuk pemrosesan bahasa
  4. Kumpulan parameter bobot yang dipelajari untuk merepresentasikan kata sebagai vektor
JawabanC. Kumpulan teks dalam jumlah besar yang dikumpulkan dan ditata untuk pemrosesan bahasa

Korpus menunjuk pada data teks dalam jumlah besar yang dikumpulkan dan ditata untuk keperluan pemrosesan bahasa alami. Tergantung penggunaannya, informasi jenis kata atau struktur sintaksis terkadang juga disertakan. Kumpulan data yang dipublikasikan secara umum untuk riset dan pengembangan disebut open dataset, yang mencakup gambar dan audio, tidak terbatas pada teks. Representasi vektor kata adalah hasil dari pembelajaran, bukan kumpulan data, dan analisis morfologi adalah metode pemrosesan kalimat; keduanya berbeda dari definisi korpus. Perlu diingat pula bahwa korpus memiliki lisensi dan ketentuan penggunaan, sehingga boleh tidaknya penggunaan komersial atau distribusi ulang perlu diperiksa satu per satu.

Soal 10 | Kerja sama dengan pihak luar

Apa penjelasan yang paling tepat mengenai open innovation dalam konteks pengembangan AI?

  1. Memanfaatkan dataset yang sudah dipublikasikan untuk mengurangi upaya pengumpulan data
  2. Mempublikasikan model dan source code yang dikembangkan secara gratis agar bisa dipakai siapa saja
  3. Mengumpulkan orang dari berbagai divisi internal perusahaan untuk membentuk struktur pengembangan lintas divisi
  4. Secara aktif menyerap teknologi, pengetahuan, dan talenta dari luar untuk menciptakan nilai baru
JawabanD. Secara aktif menyerap teknologi, pengetahuan, dan talenta dari luar untuk menciptakan nilai baru

Open innovation adalah gagasan yang tidak menutup diri pada riset dan pengembangan internal perusahaan saja, melainkan secara aktif menyerap teknologi, pengetahuan, dan talenta dari luar untuk menciptakan nilai. Silabus menjajarkan kerja sama akademik-industri (sangaku renkei) dan kerja sama dengan perusahaan atau industri lain pada bagian materi yang sama, dan sarananya bisa berupa riset bersama dengan lembaga riset seperti universitas, atau kolaborasi dengan pihak yang memiliki data atau jalur distribusi yang tidak dimiliki perusahaan sendiri. Mempublikasikan hasil karya secara gratis adalah gagasan open source, yang arahnya justru berlawanan dengan menyerap sumber daya dari luar. Struktur lintas divisi internal maupun pemanfaatan dataset publik sama-sama tidak menunjuk pada kerja sama dengan pihak luar perusahaan itu sendiri.

Soal 11 | Perbedaan jenis informasi olahan

Manakah pernyataan yang benar mengenai perbedaan antara informasi anonim (tokumei kako joho) dan informasi semu-nama (kamei kako joho) dalam undang-undang perlindungan informasi pribadi Jepang?

  1. Keduanya boleh diberikan ke pihak ketiga jika ada persetujuan orang yang bersangkutan, dan tidak boleh jika tidak ada persetujuan
  2. Informasi anonim tidak boleh diberikan ke pihak ketiga tanpa persetujuan orang yang bersangkutan, sedangkan informasi semu-nama boleh diberikan
  3. Keduanya sama-sama dilarang secara seragam untuk diberikan ke pihak ketiga, terlepas dari tingkat pengolahannya
  4. Informasi anonim boleh diberikan ke pihak ketiga tanpa persetujuan orang yang bersangkutan, sedangkan informasi semu-nama pada prinsipnya tidak boleh
JawabanD. Informasi anonim boleh diberikan ke pihak ketiga tanpa persetujuan orang yang bersangkutan, sedangkan informasi semu-nama pada prinsipnya tidak boleh

Informasi anonim (tokumei kako joho) adalah informasi yang diolah sedemikian rupa sehingga individu tertentu tidak dapat diidentifikasi, dan informasi pribadi aslinya tidak dapat dipulihkan kembali. Karena telah diolah sejauh ini, informasi ini dapat diberikan ke pihak ketiga tanpa persetujuan orang yang bersangkutan asalkan mengikuti prosedur yang ditentukan. Sebaliknya, informasi semu-nama (kamei kako joho) adalah informasi yang diolah hanya sampai tingkat individu tertentu tidak dapat diidentifikasi selama tidak dicocokkan dengan informasi lain; upaya pengolahannya lebih ringan, seperti menghapus nama, sehingga nilai analisisnya tetap terjaga, tetapi sebagai gantinya pada prinsipnya tidak boleh diberikan ke pihak ketiga, dan diasumsikan digunakan untuk analisis internal perusahaan. Semakin ringan pengolahannya, semakin tidak bisa dikeluarkan ke luar; memahami hal ini memudahkan untuk tidak tertukar.

Soal 12 | Kode identifikasi individu

Manakah pernyataan yang benar mengenai kode identifikasi individu (kojin shikibetsu fugo) dalam undang-undang perlindungan informasi pribadi Jepang?

  1. Nomor paspor atau data pengenalan wajah, misalnya, diperlakukan sebagai informasi pribadi hanya dengan data itu sendiri
  2. Baru diperlakukan sebagai sesuatu yang bisa mengidentifikasi individu tertentu jika dikombinasikan dengan nama
  3. Hanya diperlakukan sebagai informasi pribadi jika diperoleh dengan persetujuan orang yang bersangkutan
  4. Tidak termasuk objek pada saat pengambilan data, dan baru menjadi informasi pribadi setelah dibuat menjadi basis data
JawabanA. Nomor paspor atau data pengenalan wajah, misalnya, diperlakukan sebagai informasi pribadi hanya dengan data itu sendiri

Kode identifikasi individu mencakup data karakteristik fisik seperti data sidik jari, data pengenalan wajah, dan kode hasil konversi urutan basa DNA, serta nomor yang diberikan kepada individu seperti nomor My Number, nomor paspor, dan nomor SIM. Semua ini diperlakukan sebagai informasi pribadi hanya dengan data itu sendiri, sehingga pemahaman bahwa 'jika tidak ada nama maka bukan informasi pribadi' adalah keliru. Apakah suatu data termasuk informasi pribadi juga bukan ditentukan oleh ada tidaknya persetujuan pada saat pengambilan, dan bukan pula baru menjadi informasi pribadi setelah dibuat menjadi basis data. Perlu dicatat, data yang telah disusun secara sistematis dan bisa dicari disebut data pribadi (kojin data), yang dikenai kewajiban tambahan.

Soal 13 | GDPR

Manakah pernyataan yang benar mengenai posisi GDPR?

  1. Pedoman yang dikeluarkan oleh organisasi internasional dan tidak memiliki daya ikat hukum terhadap negara mana pun
  2. Peraturan yang ditetapkan untuk memperluas undang-undang perlindungan informasi pribadi Jepang secara internasional
  3. Peraturan Uni Eropa (EU) yang hanya berlaku bagi pelaku usaha yang memiliki basis di dalam wilayah EU
  4. Peraturan Uni Eropa (EU) yang dalam kondisi tertentu juga berlaku bagi pelaku usaha di luar EU
JawabanD. Peraturan Uni Eropa (EU) yang dalam kondisi tertentu juga berlaku bagi pelaku usaha di luar EU

GDPR adalah General Data Protection Regulation milik Uni Eropa (EU), yaitu peraturan EU yang berbeda dari undang-undang perlindungan informasi pribadi Jepang. Ciri khasnya adalah adanya penerapan ekstrateritorial: jika suatu pelaku usaha menawarkan barang atau jasa kepada orang yang berada di dalam wilayah EU, atau memantau perilaku orang di dalam wilayah EU, GDPR bisa berlaku meskipun pelaku usaha tersebut mengembangkan di dalam negeri Jepang. Oleh karena itu, objek penerapannya tidak bisa ditentukan hanya dari ada tidaknya basis di EU. Perlu diingat pula bahwa GDPR bukan perluasan dari hukum Jepang, dan bukan pedoman yang tidak memiliki daya ikat.

Soal 14 | Pasal 30-4

Dalam kondisi apa Pasal 30-4 Undang-Undang Hak Cipta Jepang menyatakan bahwa karya cipta dapat digunakan tanpa izin dari pemegang hak cipta?

  1. Jika bukan bertujuan untuk menikmati sendiri atau membuat orang lain menikmati pikiran atau perasaan yang terkandung dalam karya cipta
  2. Jika jumlah karya cipta yang digunakan hanya sebagian sangat kecil dari keseluruhan
  3. Jika karya cipta yang digunakan dipublikasikan gratis di internet
  4. Jika tujuan penggunaannya bukan komersial dan terbatas pada penelitian akademis
JawabanA. Jika bukan bertujuan untuk menikmati sendiri atau membuat orang lain menikmati pikiran atau perasaan yang terkandung dalam karya cipta

Pasal 30-4 Undang-Undang Hak Cipta Jepang menetapkan bahwa karya cipta dapat digunakan sejauh yang dianggap perlu, apabila bukan bertujuan untuk menikmati sendiri atau membuat orang lain menikmati pikiran atau perasaan yang dinyatakan dalam karya cipta tersebut. 'Menikmati' di sini berarti memperoleh kepuasan intelektual atau emosional dengan mengapresiasi pikiran atau perasaan yang dinyatakan dalam karya cipta, dan tindakan membaca data untuk keperluan machine learning dianggap tidak termasuk hal ini. Ayat kedua pasal ini secara eksplisit menyebutkan analisis informasi (johokaiseki), dan pembuatan data pelatihan serta proses pelatihan itu sendiri diposisikan di sini. Dipublikasikan gratis, bukan bertujuan komersial, dan jumlah yang digunakan sedikit, semuanya bukan syarat yang ditetapkan dalam pasal ini.

Soal 15 | Klausa pengecualian (proviso)

Manakah pemahaman yang benar mengenai Pasal 30-4 Undang-Undang Hak Cipta Jepang terkait penggunaan karya cipta untuk pelatihan AI?

  1. Penggunaan untuk pelatihan hanya diperbolehkan apabila karya cipta tersebut dibeli dengan berbayar
  2. Jika penggunaannya untuk pelatihan, kepentingan pemegang hak cipta tidak menjadi masalah dalam kondisi apa pun
  3. Ketentuan ini tidak berlaku jika penggunaannya dianggap secara tidak wajar merugikan kepentingan pemegang hak cipta
  4. Jika pelatihannya sah, meskipun hasil generasinya mirip dengan karya cipta yang sudah ada, tidak dianggap sebagai pelanggaran
JawabanC. Ketentuan ini tidak berlaku jika penggunaannya dianggap secara tidak wajar merugikan kepentingan pemegang hak cipta

Pasal 30-4 memiliki klausa pengecualian (proviso) yang menyatakan bahwa ketentuan ini tidak berlaku apabila, dengan mempertimbangkan jenis dan kegunaan karya cipta tersebut serta cara penggunaannya, hal itu dianggap secara tidak wajar merugikan kepentingan pemegang hak cipta. Oleh karena itu, tidak bisa dikatakan bahwa 'penggunaan apa pun bebas asalkan untuk pelatihan AI'. Misalnya, jika basis data yang dijual khusus untuk analisis informasi digandakan tanpa dibeli lalu dipakai untuk pelatihan, hal ini dianggap merugikan pasar basis data tersebut dan bisa terkena klausa pengecualian. Selain itu, meskipun tahap input berupa pelatihan itu sah, jika hasil generasinya mirip dengan karya cipta yang sudah ada, pelanggaran hak cipta bisa muncul secara terpisah pada tahap output berupa generasi atau penggunaannya. Input dan output dinilai secara terpisah. Ada tidaknya pembelian berbayar bukan kriteria yang menentukan berlakunya pasal ini.

Soal 16 | Hak cipta atas karya hasil generasi

Mengenai keberadaan hak cipta pada karya hasil generasi AI, manakah pemahaman yang paling mendekati pandangan yang sudah mapan saat ini?

  1. Hak cipta secara otomatis menjadi milik penyedia layanan yang digunakan
  2. Karena merupakan output dari AI, tidak akan pernah diakui sebagai karya cipta
  3. Ditentukan secara kasus per kasus, tergantung ada tidaknya kontribusi kreatif dari manusia
  4. Orang yang memberikan instruksi generasi selalu diakui memiliki hak cipta
JawabanC. Ditentukan secara kasus per kasus, tergantung ada tidaknya kontribusi kreatif dari manusia

Hak cipta adalah sistem yang melindungi ekspresi kreatif manusia, sehingga sesuatu yang hanya dihasilkan secara otomatis oleh AI tidak menjadi karya cipta. Di sisi lain, jika manusia terlibat sejauh dapat dikatakan telah memberikan ciri khas esensial pada ekspresi tersebut, ada peluang diakui sebagai karya cipta. Kuncinya adalah kontribusi kreatif (soosakuteki kiyo), yang dinilai secara kasus per kasus berdasarkan hal-hal seperti kekonkretan instruksi dan percobaan berulang, serta tingkat pemilihan dan penyuntingan hasil generasi. Oleh karena itu, pemahaman bahwa 'selalu tidak menjadi karya cipta' maupun 'orang yang memberi instruksi selalu memperoleh hak' sama-sama keliru. Perlu dicatat pula, terpisah dari Undang-Undang Hak Cipta, terkadang syarat penggunaan layanan yang dipakai menentukan perlakuan atas hasil generasi, sehingga kedua hal ini perlu diperiksa.

Soal 17 | Invensi karyawan

Manakah pernyataan yang benar mengenai perlakuan invensi karyawan (shokumu hatsumei) dalam Undang-Undang Paten Jepang?

  1. Jika ditetapkan dalam peraturan kerja dan sejenisnya, hak dapat menjadi milik pemberi kerja, dan karyawan memperoleh keuntungan yang wajar
  2. Meski invensi tersebut dibuat sebagai tugas pekerjaan, tidak ada ruang untuk menjadikan hak milik pemberi kerja
  3. Hak selalu menjadi milik pemberi kerja, dan tidak dapat ditetapkan aturan lain dalam peraturan kerja
  4. Meski hak menjadi milik pemberi kerja, pembayaran keuntungan kepada karyawan tidak diperlukan
JawabanA. Jika ditetapkan dalam peraturan kerja dan sejenisnya, hak dapat menjadi milik pemberi kerja, dan karyawan memperoleh keuntungan yang wajar

Invensi karyawan (shokumu hatsumei) adalah invensi yang dibuat oleh karyawan sebagai tugas pekerjaannya. Hak untuk memperoleh paten pada prinsipnya timbul pada karyawan sebagai penemu, tetapi jika ditetapkan lebih dulu dalam peraturan kerja dan sejenisnya, hak tersebut dapat dijadikan milik pemberi kerja sejak saat timbulnya. Dalam hal itu, karyawan memiliki hak untuk memperoleh uang atau keuntungan ekonomi wajar lainnya, sehingga ini bukan sistem yang mengambil hak tanpa kompensasi. Selain itu, hak juga tidak selalu menjadi milik pemberi kerja, dan tidak benar pula bahwa tidak ada ruang untuk menjadikannya milik pemberi kerja; perlakuannya berubah tergantung ada tidaknya ketetapan tersebut, dan inilah poin pentingnya.

Soal 18 | Rahasia dagang

Manakah kombinasi syarat yang tepat agar dilindungi sebagai rahasia dagang (eigyo himitsu) dalam Undang-Undang Pencegahan Persaingan Tidak Sehat Jepang?

  1. Manajemen kerahasiaan, kegunaan, langkah inventif
  2. Manajemen kerahasiaan, kegunaan (yuyosei), tidak diketahui publik (hikochisei)
  3. Kegunaan, kebaruan, langkah inventif (shinposei)
  4. Manajemen kerahasiaan, kebaruan (shinkisei), tidak diketahui publik (hikochisei)
JawabanB. Manajemen kerahasiaan, kegunaan (yuyosei), tidak diketahui publik (hikochisei)

Tiga syarat rahasia dagang adalah dikelola sebagai rahasia (manajemen kerahasiaan), merupakan informasi teknis atau bisnis yang berguna untuk kegiatan usaha (kegunaan), dan tidak diketahui secara umum (tidak diketahui publik); perlindungan baru berlaku jika ketiganya terpenuhi sekaligus. Kebaruan dan langkah inventif adalah syarat untuk memperoleh paten, bukan syarat rahasia dagang. Berbeda dengan paten yang memperoleh hak eksklusif dengan cara mempublikasikan isinya, rahasia dagang adalah sistem yang melindungi dengan cara tidak mempublikasikan, sehingga informasi yang tidak ingin dipublikasikan seperti bobot model yang sudah dilatih atau teknik pra-pemrosesan dilindungi lewat jalur ini.

Soal 19 | Data dengan penyediaan terbatas

Manakah pernyataan yang benar mengenai data dengan penyediaan terbatas (gentei teikyo data) dalam Undang-Undang Pencegahan Persaingan Tidak Sehat Jepang?

  1. Kategori yang objeknya adalah informasi teknis yang diajukan paten tetapi tidak mencapai pendaftaran
  2. Objeknya adalah informasi yang memenuhi ketiga syarat rahasia dagang sekaligus, dan telah didaftarkan lebih lanjut
  3. Kategori yang objeknya adalah informasi yang disimpan hanya di dalam perusahaan sendiri tanpa disediakan kepada siapa pun
  4. Objeknya adalah rekaman elektromagnetik yang disediakan kepada pihak tertentu secara usaha, terkumpul dalam jumlah cukup besar, dan dikelola
JawabanD. Objeknya adalah rekaman elektromagnetik yang disediakan kepada pihak tertentu secara usaha, terkumpul dalam jumlah cukup besar, dan dikelola

Data dengan penyediaan terbatas adalah informasi yang disediakan kepada pihak tertentu secara usaha, terkumpul dalam jumlah cukup besar melalui metode elektromagnetik, dan dikelola. Kategori ini dibuat untuk melindungi transaksi jual-beli atau berbagi data, dan memiliki arti karena dapat dilindungi meskipun tidak memenuhi ketiga syarat rahasia dagang sekaligus. Hal ini karena, jika disediakan kepada beberapa pihak, syarat tidak diketahui publik belum tentu terpenuhi secara ketat. Informasi yang disimpan sendiri di dalam perusahaan tanpa disediakan ke luar dilindungi lewat jalur rahasia dagang, dan kategori ini juga tidak terkait dengan ada tidaknya pengajuan atau pendaftaran paten.

Soal 20 | Kontrak pengembangan

Manakah pernyataan yang benar mengenai perbedaan kontrak pemborongan (ukeoi keiyaku) dan kontrak kuasi-delegasi (junishitaku keiyaku) dalam pendelegasian pengembangan AI?

  1. Kontrak pemborongan menjanjikan penyelesaian pekerjaan, kontrak kuasi-delegasi melaksanakan tugas dengan kewajiban perhatian pengelola yang baik
  2. Kontrak pemborongan adalah kontrak yang menanggung kewajiban perhatian pengelola yang baik, kontrak kuasi-delegasi adalah kontrak yang menjanjikan penyelesaian
  3. Keduanya sama-sama kontrak yang menjanjikan penyelesaian hasil kerja, dan hanya berbeda pada tingkat akurasi yang dijamin
  4. Keduanya sama-sama kontrak yang tidak menjanjikan penyelesaian, dan hanya berbeda pada waktu pembayaran imbalan
JawabanA. Kontrak pemborongan menjanjikan penyelesaian pekerjaan, kontrak kuasi-delegasi melaksanakan tugas dengan kewajiban perhatian pengelola yang baik

Kontrak pemborongan (ukeoi keiyaku) adalah kontrak yang menjanjikan penyelesaian pekerjaan; jika tidak selesai, imbalan tidak dapat diminta, dan pihak yang mengerjakan bertanggung jawab atas hasil kerja yang tidak sesuai kontrak. Kontrak kuasi-delegasi (junishitaku keiyaku) adalah kontrak yang mendelegasikan pengurusan suatu urusan, dan yang dijanjikan bukan penyelesaian, melainkan melaksanakan tugas dengan kewajiban perhatian pengelola yang baik (kewajiban zorgvuldig/duty of care). Karena akurasi yang bisa dicapai pada pengembangan AI baru diketahui setelah dicoba dilatih, pembagian yang umum diambil adalah menggunakan kontrak kuasi-delegasi untuk tahap eksplorasi dan PoC, lalu kontrak pemborongan untuk tahap implementasi setelah spesifikasi ditetapkan. Pedoman Kontrak Pemanfaatan AI dan Data dari Kementerian Ekonomi, Perdagangan dan Industri Jepang (METI) juga menunjukkan pola kontrak yang dibagi per tahap seperti ini.

Soal 21 | Hard law

Manakah pembedaan yang benar antara hard law dan soft law?

  1. Hard law menunjuk pada peraturan yang memiliki daya paksa, soft law menunjuk pada aturan yang tidak mengikat
  2. Hard law menunjuk pada peraturan yang memiliki sanksi, soft law menunjuk pada peraturan tanpa sanksi
  3. Hard law menunjuk pada perjanjian internasional, soft law menunjuk pada undang-undang domestik
  4. Hard law menunjuk pada peraturan yang baru dibuat, soft law menunjuk pada kebiasaan lama
JawabanA. Hard law menunjuk pada peraturan yang memiliki daya paksa, soft law menunjuk pada aturan yang tidak mengikat

Hard law adalah peraturan yang ditetapkan negara dan pelanggarannya dikenai daya paksa, seperti undang-undang perlindungan informasi pribadi dan undang-undang hak cipta. Soft law adalah aturan yang tidak memiliki daya ikat hukum, seperti pedoman, norma mandiri industri, atau kode etik perusahaan. Karena soft law bukan undang-undang, pembedaan antara peraturan bersanksi dan tanpa sanksi tidak berlaku di sini. Ini juga bukan pembedaan domestik-internasional maupun baru-lama. Pada bidang yang perubahan teknologinya cepat, pendekatan yang diambil adalah menunjukkan arah lewat soft law terlebih dahulu, lalu hanya bagian yang perlu dijadikan undang-undang; kebijakan AI Jepang pada dasarnya berpusat pada soft law.

Soal 22 | Penanganan risiko

Manakah gagasan risk-based approach yang dibicarakan dalam regulasi AI atau penanganan internal perusahaan?

  1. Menghentikan penyediaan layanan untuk penggunaan tersebut secara seragam begitu risiko teridentifikasi
  2. Mendaftar risiko yang mungkin terjadi, lalu mewajibkan tindakan dengan tingkat yang sama untuk semua penggunaan
  3. Menyerahkan penilaian risiko kepada pengguna, dan pelaku usaha hanya menyediakan informasi
  4. Mengubah kekuatan penanganan atau regulasi sesuai besarnya risiko yang ditimbulkan oleh penggunaannya
JawabanD. Mengubah kekuatan penanganan atau regulasi sesuai besarnya risiko yang ditimbulkan oleh penggunaannya

Risk-based approach adalah gagasan yang mengubah kekuatan regulasi atau penanganan sesuai besarnya risiko yang ditimbulkan oleh penggunaan AI. Teknologi pengenalan wajah yang sama pun dampaknya terhadap manusia sangat berbeda antara membuka kunci layar perangkat dan pemantauan terus-menerus di ruang publik. Jika regulasi ketat diterapkan seragam tanpa memandang penggunaan, penggunaan dengan bahaya kecil pun ikut terhenti; jika dilonggarkan seragam, penggunaan dengan bahaya besar dibiarkan. Oleh karena itu, kewajiban ketat dialokasikan untuk penggunaan berdampak besar, dan perlakuan ringan untuk yang berdampak kecil. Dari sisi pelaku usaha pun, gagasan yang sama dipakai dengan mengelompokkan proyek AI internal berdasarkan tingkat risiko, dan hanya yang berisiko tinggi yang dikirim ke pemeriksaan ketat.

Soal 23 | Pertimbangan saat desain

Manakah gagasan yang paling tepat mengenai privacy by design?

  1. Membatasi petugas yang menangani informasi pribadi, sehingga hanya yang berwenang yang bisa melihatnya
  2. Memasukkan mekanisme perlindungan privasi sejak tahap perencanaan dan desain
  3. Mengungkapkan tujuan penggunaan data yang dikumpulkan sesuai permintaan pengguna
  4. Menyelidiki penyebab setelah masalah terjadi, lalu menambahkan tindakan yang diperlukan kemudian
JawabanB. Memasukkan mekanisme perlindungan privasi sejak tahap perencanaan dan desain

Privacy by design adalah gagasan yang tidak menambahkan tindakan setelah masalah terjadi, melainkan memasukkan perlindungan privasi sejak tahap perencanaan dan desain. Keputusan seperti mendesain agar tidak mengumpulkan data, menghapusnya dalam periode yang diperlukan, atau memprosesnya dalam bentuk yang tidak dapat diidentifikasi, semakin mahal biayanya jika dimasukkan belakangan. Pengungkapan tujuan penggunaan dan pembatasan hak akses adalah upaya yang benar dengan sendirinya, tetapi tidak menyentuh sudut pandang 'kapan dimasukkan', sehingga bukan penjelasan yang tepat untuk gagasan ini. Konsep pasangannya adalah security by design, yang memasukkan tindakan keamanan sejak tahap desain.

Soal 24 | Variabel pengganti

Meskipun atribut sensitif dihapus dari data pelatihan, output yang tidak adil kadang tetap tersisa. Apa alasan utamanya?

  1. Karena fitur lain seperti kode pos bekerja sebagai pengganti atribut yang dihapus
  2. Karena meski atribut dihapus, model dilatih ulang dengan data lain yang mengandung atribut tersebut
  3. Karena menghapus atribut mengurangi jumlah data sehingga akurasi model itu sendiri menurun
  4. Karena proses penghapusan atribut itu sendiri mendistorsi distribusi data
JawabanA. Karena fitur lain seperti kode pos bekerja sebagai pengganti atribut yang dihapus

Fitur yang bekerja sebagai pengganti atribut sensitif disebut variabel pengganti (proxy variable). Kode pos berkorelasi kuat dengan ras atau pendapatan lewat wilayah tempat tinggal, dan riwayat sekolah atau kegiatan ekstrakurikuler kadang berkorelasi dengan jenis kelamin. Selama fitur semacam ini masih tersisa, meski kolom jenis kelamin atau ras dihapus dari input, model tetap bisa mempelajari diskriminasi yang sama secara tidak langsung. Oleh karena itu, pemeriksaan keadilan dilakukan bukan dengan menghapus item input, melainkan dengan mengukur perbedaan output per kelompok atribut. Selain itu, definisi keadilan sendiri ada beberapa, seperti menyamakan tingkat kelulusan antar atribut atau menyamakan tingkat kesalahan, dan umumnya tidak mungkin memenuhi semuanya sekaligus, sehingga perlu dipilih dan dijelaskan definisi mana yang diambil sesuai penggunaannya.

Soal 25 | Input adversarial

Manakah penjelasan yang tepat mengenai Adversarial Attack (Adversarial Examples)?

  1. Menambahkan perubahan kecil yang tidak disadari manusia pada input, sehingga menimbulkan keputusan yang salah
  2. Mengumpulkan output dengan melakukan banyak permintaan lalu membuat model yang bekerja setara di tangan sendiri
  3. Mengubah parameter model yang didistribusikan untuk menyisipkan perilaku tertentu
  4. Mencampurkan data yang telah direkayasa ke dalam data pelatihan sehingga mendistorsi hasil pelatihan
JawabanA. Menambahkan perubahan kecil yang tidak disadari manusia pada input, sehingga menimbulkan keputusan yang salah

Adversarial Attack adalah serangan yang menambahkan perubahan kecil yang hampir tidak terlihat oleh mata manusia pada input, sehingga membuat model yang sedang beroperasi mengeluarkan keputusan yang salah. Yang disasar adalah tahap inferensi, dan model itu sendiri tidak diubah. Mencampurkan rekayasa ke data pelatihan sehingga mendistorsi hasil pelatihan adalah data poisoning, yang menyasar tahap pelatihan. Mengumpulkan output lewat banyak permintaan untuk mereproduksi model setara adalah pencurian model (model extraction), dan mengubah parameter atau berkas distribusi model adalah model poisoning; masing-masing berbeda dalam waktu dan sasaran yang dituju. Pertahanan terhadap semua ini dilakukan dengan gagasan security by design yang memasukkan keamanan sejak tahap desain.

Soal 26 | Pembedaan jenis pencurian

Di antara serangan terhadap AI, manakah yang termasuk pencurian model (model extraction)?

  1. Mencampurkan data yang telah direkayasa ke dalam data pelatihan sehingga mendistorsi hasil pelatihan
  2. Memperkirakan dan mengambil informasi yang terkandung dalam data pelatihan dari petunjuk pada output
  3. Mengubah parameter model yang didistribusikan sehingga perilakunya berubah pada input tertentu
  4. Mengumpulkan output dengan melakukan permintaan dalam jumlah besar lalu membangun model yang bekerja setara di tangan sendiri
JawabanD. Mengumpulkan output dengan melakukan permintaan dalam jumlah besar lalu membangun model yang bekerja setara di tangan sendiri

Pencurian model (model extraction) adalah serangan yang memberikan input dalam jumlah besar ke model target, mengumpulkan outputnya, lalu mereproduksi model yang bekerja setara di tangan penyerang. Yang dicuri adalah model itu sendiri, dan serangan ini bisa terjadi hanya dengan menyediakan API publik. Sebaliknya, pencurian data (data extraction) adalah serangan yang mengambil informasi yang terkandung dalam data pelatihan dari pengamatan output, dan yang dicuri adalah data. Mencampurkan rekayasa ke data pelatihan adalah data poisoning, dan mengubah parameter atau berkas distribusi model adalah model poisoning; yang pertama menyasar tahap pelatihan, yang kedua menyasar tahap pelatihan atau distribusi. Memahami apa yang dicuri dan kapan waktunya disasar memudahkan untuk tidak tertukar.

Soal 27 | Gelembung informasi

Fenomena apa yang dianggap muncul akibat optimasi oleh algoritma rekomendasi?

  1. Dasar pengambilan keputusan tersembunyi di dalam, sehingga manusia tidak bisa menelusuri alasannya
  2. Hanya informasi yang sesuai preferensi yang dipilih dan ditampilkan, informasi lain tidak sampai
  3. Orang dengan opini sama saling mengirim dan menyetujui berulang-ulang, memperkuat opini tersebut
  4. Video atau audio palsu hasil generasi diterima luas sebagai sesuatu yang asli
JawabanB. Hanya informasi yang sesuai preferensi yang dipilih dan ditampilkan, informasi lain tidak sampai

Filter bubble adalah fenomena ketika algoritma rekomendasi menyeleksi informasi sesuai preferensi pengguna, sehingga orang tersebut seolah terbungkus gelembung dan hanya melihat informasi yang sesuai seleranya sendiri; penyebabnya ada pada optimasi algoritma. Pengguna sendiri tidak menyadari bahwa dirinya sedang diseleksi. Fenomena orang dengan opini sama saling mengirim dan menyetujui berulang-ulang dalam ruang tertutup, sehingga meyakini opini tersebut sebagai satu-satunya yang benar, disebut echo chamber, dan penyebabnya adalah sifat manusia yang cenderung berkumpul dengan yang serupa. Video atau audio palsu yang diterima sebagai asli adalah deepfake dan fake news, dan dasar keputusan yang tidak bisa ditelusuri adalah masalah black box; keduanya adalah topik bagian materi yang berbeda.

Soal 28 | Video palsu

Manakah penjelasan yang paling tepat mengenai deepfake?

  1. Menggunakan deep learning untuk membuat kalimat pendek yang merangkum poin utama dari teks dalam jumlah besar
  2. Menggunakan deep learning untuk memvisualisasikan wilayah pada gambar yang menjadi dasar keputusan
  3. Menggunakan deep learning untuk membuat video atau audio seolah-olah orang yang benar-benar ada sedang berbicara
  4. Menggunakan deep learning untuk menghasilkan foto wajah orang yang tidak benar-benar ada lalu menampilkannya
JawabanC. Menggunakan deep learning untuk membuat video atau audio seolah-olah orang yang benar-benar ada sedang berbicara

Deepfake menunjuk pada teknologi dan hasil generasinya yang menggunakan deep learning untuk membuat video atau audio seolah-olah orang yang benar-benar ada mengucapkan hal yang tidak pernah diucapkan, atau melakukan hal yang tidak pernah dilakukan. Intinya terletak pada menyamar sebagai orang yang benar-benar ada, sehingga tujuannya berbeda dari menghasilkan wajah orang yang tidak ada. Deepfake digunakan untuk pencemaran nama baik, penipuan, dan campur tangan pemilu, serta sangat meningkatkan daya persuasi fake news. Sebagai penanggulangan, selain penelitian teknologi deteksi, sedang dikembangkan pendekatan menyisipkan informasi asal-usul (provenance) sejak tahap pengambilan gambar atau generasi, agar perubahan bisa diverifikasi kemudian. Peringkasan teks dan visualisasi dasar keputusan sama-sama bukan tentang penyalahgunaan.

Soal 29 | Pencatatan asal-usul

Terkait pemastian transparansi AI, apa tujuan yang paling tepat dari menyimpan asal-usul (provenance) data?

  1. Untuk menekan konsumsi sumber daya komputasi yang dipakai pelatihan dan mengecilkan biaya
  2. Agar sumber perolehan dan proses pengolahan bisa ditelusuri, sehingga penyebab masalah bisa ditemukan
  3. Untuk mempercepat inferensi model dan memperpendek waktu hingga respons kembali
  4. Untuk menambah jumlah data yang bisa dipakai pelatihan dan meningkatkan akurasi model
JawabanB. Agar sumber perolehan dan proses pengolahan bisa ditelusuri, sehingga penyebab masalah bisa ditemukan

Asal-usul data (provenance) adalah catatan mengenai data mana yang diperoleh dari mana, dan diolah bagaimana untuk dipakai dalam pelatihan. Jika catatan ini tidak ada, ketika terjadi masalah pada output, tidak bisa ditelusuri sampai ke data penyebabnya, sehingga perbaikan maupun penjelasan tidak dapat dilakukan. Transparansi tidak hanya berarti membuka bagian dalam model, tetapi juga mencakup menunjukkan untuk apa AI digunakan, dibuat dengan data seperti apa, dan di mana batasannya, sesuai dengan pihak yang dituju. Pengurangan sumber daya komputasi, percepatan inferensi, dan penambahan jumlah data, semuanya bukan tujuan dari pencatatan asal-usul. Perlu diingat pula traceability, yaitu kemampuan menelusuri data mana melalui model mana menghasilkan keputusan mana.

Soal 30 | Pemeriksaan etika

Manakah penjelasan yang tepat mengenai ethics assessment dalam AI governance?

  1. Dokumen yang merangkum kebijakan perusahaan sendiri tentang bagaimana AI ditangani, untuk ditunjukkan ke luar
  2. Prosedur yang terus mengawasi kecenderungan output dan keluhan setelah operasional dimulai
  3. Prosedur yang mengidentifikasi dan menilai dampak atau risiko yang mungkin terjadi pada tahap perencanaan
  4. Mekanisme yang memastikan operasional berjalan sesuai kebijakan, dari posisi independen dari divisi terkait
JawabanC. Prosedur yang mengidentifikasi dan menilai dampak atau risiko yang mungkin terjadi pada tahap perencanaan

Ethics assessment adalah prosedur yang mengidentifikasi dan menilai dampak atau risiko yang mungkin terjadi pada tahap perencanaan AI, dan tingkat ketatnya pemeriksaan diubah sesuai hasil penilaian tersebut. Mengawasi kecenderungan output dan keluhan setelah operasional dimulai adalah monitoring, memastikan kesesuaian dengan kebijakan dari posisi independen adalah audit terhadap AI, dan merangkum kebijakan perusahaan sendiri dalam dokumen untuk ditunjukkan ke luar adalah AI policy; semuanya adalah elemen berbeda yang menyusun AI governance. Selain ini, ada pula mempertahankan keterlibatan manusia pada titik-titik penting keputusan, reproduktibilitas yang memungkinkan model dibuat ulang kemudian, dan traceability yang memungkinkan jalur keputusan ditelusuri.

Latihan: kerjakan soal di halaman ini

Ini adalah alat latihan dengan soal acak (berfungsi jika JavaScript aktif). Semua soal dan penjelasan di atas tetap dapat dibaca tanpa alat ini.

* Pembahasan ini merupakan informasi untuk keperluan belajar. Cakupan dan sistem ujian dapat berubah setiap tahun, jadi selalu periksa pengumuman resmi dari lembaga penyelenggara ujian.

Halaman ini adalah terjemahan dari teks asli berbahasa Jepang. Jika terdapat perbedaan antara terjemahan dan teks asli, versi bahasa Jepang yang berlaku. Lihat teks asli bahasa Jepang