În CRISP-DM, modul standard de a desfășura un proiect de analiză a datelor, care este conținutul etapei plasate prima?
Examinarea calității și distribuției datelor disponibile, pentru a înțelege tendințele
Tratarea valorilor lipsă și crearea caracteristicilor, pentru a pregăti datele de antrenare
Clarificarea problemei de business care trebuie rezolvată și a criteriilor care definesc succesul
Integrarea modelului creat în sistemul de business și operarea acestuia
Răspuns corectC. Clarificarea problemei de business care trebuie rezolvată și a criteriilor care definesc succesul
CRISP-DM cuprinde șase etape: înțelegerea business-ului, înțelegerea datelor, pregătirea datelor, modelarea, evaluarea și implementarea. Prima etapă este înțelegerea business-ului, în care se stabilesc problema de business care trebuie rezolvată și criteriile care ar defini succesul. Examinarea calității și distribuției datelor este înțelegerea datelor, tratarea valorilor lipsă și crearea caracteristicilor este pregătirea datelor, iar integrarea în sistemul de business este etapa de implementare. Merită reținut și faptul că cele șase etape nu curg doar într-o singură direcție, ci sunt descrise ca un ciclu, cu revenire la etapele anterioare.
Î2 | PoC
Care este poziția cea mai potrivită a PoC-ului într-un proiect de AI?
Etapa în care, înainte de a intra în dezvoltarea propriu-zisă, se testează la scară mică fezabilitatea și efectul
Etapa în care se atribuie etichete corecte datelor de antrenare, după criterii stabilite dinainte
Etapa în care modelul finalizat este pus în producție și este monitorizat și reantrenat continuu
Etapa în care fluxul de business în sine este regândit de la obiectiv, pentru a crește productivitatea
Răspuns corectA. Etapa în care, înainte de a intra în dezvoltarea propriu-zisă, se testează la scară mică fezabilitatea și efectul
PoC (proof of concept, demonstrarea conceptului) este etapa în care, înainte de a investi în dezvoltarea propriu-zisă, se construiește ceva mic pentru a testa dacă acele date produc acuratețea necesară și, dacă da, dacă business-ul poate funcționa astfel. Cum scopul nu este să se producă un produs finit, dacă nu se stabilesc dinainte condițiile pentru a continua sau pentru a renunța, se ajunge să se repete încercări fără rezultat. Monitorizarea și reantrenarea continuă după punerea în producție este MLOps, atribuirea etichetelor corecte este adnotarea (annotation), iar regândirea fluxului de business în sine este BPR — toate sunt etape diferite de PoC.
Î3 | Adnotarea
Care este descrierea potrivită pentru adnotarea (annotation) realizată la pregătirea datelor pentru învățarea automată?
Eliminarea valorilor lipsă și a valorilor aberante din datele colectate, pentru a regla distribuția
Colectarea și organizarea unui volum mare de texte, pentru a forma un corpus pentru procesarea limbajului
Separarea datelor colectate în set de antrenare și set de validare, într-o formă în care performanța poate fi măsurată
Atribuirea manuală, pe datele colectate, a etichetelor corecte sau a informațiilor despre regiuni, pentru antrenare
Răspuns corectD. Atribuirea manuală, pe datele colectate, a etichetelor corecte sau a informațiilor despre regiuni, pentru antrenare
Adnotarea este operația de a atribui manual, pe date brute, etichete corecte sau informații despre regiuni, fiind indispensabilă pentru învățarea supravegheată. Dacă criteriile de atribuire diferă de la un operator la altul, acest lucru limitează chiar plafonul de performanță al modelului, așa că instrucțiunile de lucru și controlul calității devin esențiale. Colectarea și organizarea unui volum mare de texte formează un corpus, iar separarea în set de antrenare/validare și tratarea valorilor lipsă/aberante sunt alte operații din pregătirea datelor — niciuna dintre ele nu este atribuirea propriu-zisă de etichete.
Î4 | Data leakage
Care este descrierea cea mai potrivită pentru data leakage (scurgerea de date), legată de modul de folosire a datelor de antrenare?
Fenomenul în care datele de validare sunt prea puține, iar acuratețea măsurată devine instabilă
Fenomenul în care informații care nu ar fi disponibile în momentul predicției se strecoară în antrenare, iar performanța pare nejustificat de mare
Fenomenul în care, potrivindu-se prea mult la datele de antrenare, performanța pe date necunoscute scade
Fenomenul în care numărul de dimensiuni ale caracteristicilor crește excesiv, iar necesarul de date crește brusc
Răspuns corectB. Fenomenul în care informații care nu ar fi disponibile în momentul predicției se strecoară în antrenare, iar performanța pare nejustificat de mare
Data leakage (scurgerea de date) este fenomenul în care informații care, în mod normal, nu ar fi disponibile în momentul predicției se amestecă în datele de antrenare, făcând ca acuratețea măsurată la validare să pară mult mai mare decât capacitatea reală a modelului. Se produce, de exemplu, dacă se include data cererii de reziliere într-o predicție a rezilierii, dacă media sau abaterea standard folosite la preprocesare se calculează din întregul set, incluzând datele de validare, sau dacă o serie temporală este împărțită aleatoriu, ignorând ordinea timpului. Supra-antrenarea este fenomenul în care modelul se potrivește prea mult datelor de antrenare — cauza ei nu este folosirea unei informații interzise, ci potrivirea excesivă. Creșterea bruscă a necesarului de date odată cu numărul de dimensiuni este blestemul dimensionalității — ambele au cauze diferite de data leakage.
Î5 | MLOps
Care este ideea cea mai potrivită pentru MLOps, în operarea sistemelor de AI?
A monitoriza continuu datele și acuratețea și după punerea în producție, reluând reantrenarea și redistribuirea
A închiria resursele de calcul pentru antrenare din cloud, plătind doar cât s-a folosit
A pune mediul de dezvoltare într-un container, pentru a reproduce același mediu și în producție
A verifica o singură dată, înainte de punerea în producție, că acuratețea modelului îndeplinește cerințele
Răspuns corectA. A monitoriza continuu datele și acuratețea și după punerea în producție, reluând reantrenarea și redistribuirea
MLOps este ideea de a nu considera treaba încheiată odată ce modelul este pus în producție, ci de a monitoriza distribuția datelor de intrare, tendințele predicțiilor și chiar indicatorii de business, iar dacă apare o abatere, de a actualiza datele de antrenare, a reconstrui modelul și a-l redistribui, rulând acest ciclu ca mecanism continuu. Pe măsură ce lumea se schimbă, se schimbă și tendința datelor de intrare, iar acuratețea scade tăcut, deci o singură verificare nu este suficientă. Închirierea resurselor de calcul ține de folosirea cloud-ului, iar reproducerea mediului de execuție ține de rolul Docker — ambele sunt instrumente care susțin MLOps, dar nu constituie prin ele însele definiția MLOps.
Î6 | BPR
Care este conținutul potrivit al BPR, discutat adesea împreună cu introducerea AI-ului?
Adunarea responsabililor din operațiuni pentru a le afla cerințele față de AI
Colectarea datelor din operațiuni și transformarea lor într-o formă care poate fi învățată de AI
Regândirea fluxului de business în sine, revenind la obiectivul acestuia
Înlocuirea unei părți din operațiuni cu AI, păstrând procedura de business existentă
Răspuns corectC. Regândirea fluxului de business în sine, revenind la obiectivul acestuia
BPR (reinginerie a proceselor de business) desemnează efortul de a nu îmbunătăți parțial procedura existentă, ci de a regândi fluxul de business în sine, revenind la scopul pentru care există acea activitate. Dacă AI-ul este doar suprapus peste procedura existentă, se poate ajunge doar la un pas suplimentar în care oamenii transcriu ieșirea AI-ului, fără efect real — de multe ori succesul introducerii AI-ului depinde mai mult de acest aspect decât de acuratețe. Culegerea cerințelor este identificarea nevoilor părților interesate, iar transformarea datelor într-o formă utilizabilă este pregătirea datelor — niciuna dintre ele nu este regândirea propriu-zisă a proceselor de business.
Î7 | Modul de desfășurare a dezvoltării
Care este motivul cel mai potrivit pentru care metoda waterfall este greu de aplicat ca atare la dezvoltarea de AI?
Pentru că există multe opțiuni de limbaje și biblioteci de dezvoltare, iar standardizarea nu a avansat
Pentru că specialiștii implicați în dezvoltare provin din multe domenii diferite, fiind greu de împărțit etapele
Pentru că nu se știe dinainte, până nu se antrenează efectiv, ce acuratețe se poate atinge, deci cerințele nu pot fi fixate în avans
Pentru că achiziția resurselor de calcul necesare antrenării durează, iar etapele nu avansează conform planului
Răspuns corectC. Pentru că nu se știe dinainte, până nu se antrenează efectiv, ce acuratețe se poate atinge, deci cerințele nu pot fi fixate în avans
Metoda waterfall este o abordare în care etapele se fixează, în ordine, pornind de la definirea cerințelor, presupunând că nu se mai revine înapoi. Însă dezvoltarea de AI are proprietatea că nu se știe ce acuratețe se va atinge decât după ce se antrenează efectiv, deci nu se pot fixa dinainte livrabilul și cerințele. De aceea, etapele de explorare și PoC se desfășoară în formă agile, prin iterații scurte, iar etapele de dezvoltare propriu-zisă se fixează abia după ce acuratețea devine previzibilă. Această proprietate influențează direct și modul de a proiecta contractul, adică alegerea între contract de tip antrepriză (ukeoi) și contract de tip cvasi-mandat (junin) pentru externalizarea dezvoltării.
Î8 | Docker
Care este scopul principal al folosirii Docker în dezvoltarea de AI?
A pune într-un pachet mediul de execuție, inclusiv bibliotecile, astfel încât să ruleze identic în alt mediu
A publica modelul antrenat astfel încât să poată fi apelat prin HTTP din alte sisteme
A păstra, într-un singur document, evoluția antrenării și rezultatele execuției, împreună cu explicații
A închiria resurse de calcul mari doar pentru timpul necesar și a le returna după utilizare
Răspuns corectA. A pune într-un pachet mediul de execuție, inclusiv bibliotecile, astfel încât să ruleze identic în alt mediu
Docker este o tehnologie care pune într-un container aplicația împreună cu bibliotecile mediului de execuție. Deoarece același container poate rula atât pe mașina de dezvoltare, cât și în producție, se reduc discrepanțele de tipul „la mine a mers” cauzate de diferențe de versiune. Păstrarea evoluției și a rezultatelor într-un singur document, împreună cu explicații, este specifică Jupyter Notebook; publicarea sub formă apelabilă prin HTTP este un Web API; iar închirierea resurselor de calcul doar pentru timpul necesar este folosirea cloud-ului — toate sunt instrumente diferite folosite în dezvoltarea de AI.
Î9 | Corpus
Care este descrierea potrivită pentru corpus, în domeniul procesării limbajului natural?
O colecție de date de imagine sau audio, publicate pe scară largă pentru cercetare și dezvoltare
O colecție de operații de analiză morfologică, care împarte textul în cuvinte și le determină partea de vorbire
O colecție mare de date de text, culese și organizate pentru procesarea limbajului
O colecție de parametri de ponderi, antrenați pentru a reprezenta cuvintele prin vectori
Răspuns corectC. O colecție mare de date de text, culese și organizate pentru procesarea limbajului
Corpusul desemnează un volum mare de date de text, culese și organizate pentru procesarea limbajului natural; în funcție de scop, poate avea atașate informații despre partea de vorbire sau despre structura sintactică. Colecția de date publicate pe scară largă pentru cercetare și dezvoltare, în general, este un set de date deschis (open dataset), care include și imagini sau audio, nu doar text. Reprezentarea vectorială a cuvintelor este rezultatul unei antrenări, nu o colecție de date, iar analiza morfologică este o metodă de procesare a textului — niciuna dintre ele nu corespunde definiției corpusului. De notat că și corpusurile au licențe și condiții de utilizare, deci utilizarea comercială sau redistribuirea trebuie verificate separat.
Î10 | Colaborarea cu exteriorul
Care este descrierea cea mai potrivită pentru inovația deschisă (open innovation), în contextul dezvoltării de AI?
A folosi seturi de date publice existente, pentru a reduce efortul de colectare
A publica gratuit, într-o formă utilizabilă de oricine, modelul dezvoltat și codul sursă
A aduna oameni din diferite departamente interne, pentru a crea o structură de dezvoltare transversală
A încorpora activ tehnologii, cunoștințe și resurse umane din exterior, pentru a genera valoare nouă
Răspuns corectD. A încorpora activ tehnologii, cunoștințe și resurse umane din exterior, pentru a genera valoare nouă
Inovația deschisă este ideea de a nu se limita la cercetarea și dezvoltarea internă, ci de a încorpora activ tehnologii, cunoștințe și resurse umane din exterior, pentru a genera valoare. Programa plasează la același subiect colaborarea universitate-industrie și colaborarea cu alte companii sau alte sectoare — mijloacele pot fi cercetarea comună cu instituții precum universitățile, sau parteneriatul cu entități care dețin date sau canale de distribuție pe care compania nu le are. Publicarea gratuită a rezultatelor este ideea open source, care merge în direcție opusă încorporării resurselor externe. Structura transversală internă și folosirea seturilor de date publice nu se referă, prin ele însele, la colaborarea cu entități din exterior.
Î11 | Tipuri de informații prelucrate
Care este diferența corectă dintre informația anonimizată și informația pseudonimizată, în cadrul legii japoneze privind protecția informațiilor personale?
Ambele pot fi furnizate unui terț dacă persoana și-a dat acordul, și nu pot fi furnizate dacă nu l-a dat
Informația anonimizată nu poate fi furnizată unui terț fără acordul persoanei, dar informația pseudonimizată poate
Ambele sunt supuse, indiferent de gradul de prelucrare, unei interdicții uniforme de furnizare către terți
Informația anonimizată poate fi furnizată unui terț fără acordul persoanei, dar informația pseudonimizată, în principiu, nu
Răspuns corectD. Informația anonimizată poate fi furnizată unui terț fără acordul persoanei, dar informația pseudonimizată, în principiu, nu
Informația anonimizată este prelucrată astfel încât persoana să nu mai poată fi identificată și astfel încât informația personală originală să nu mai poată fi reconstituită. Fiind prelucrată la acest nivel, poate fi furnizată unui terț fără acordul persoanei, urmând procedurile stabilite. În schimb, informația pseudonimizată este prelucrată doar până la nivelul la care persoana nu mai poate fi identificată dacă nu este combinată cu alte informații — prelucrarea este mai ușoară (de exemplu, eliminarea numelui) și păstrează valoare analitică, dar, în schimb, în principiu nu poate fi furnizată unui terț, fiind gândită pentru uz analitic intern al operatorului. Regula de reținut este că, cu cât prelucrarea este mai ușoară, cu atât informația poate fi mai puțin scoasă în exterior.
Î12 | Codul de identificare personală
Care este descrierea corectă privind codul de identificare personală, din legea japoneză privind protecția informațiilor personale?
Numărul de pașaport sau datele de recunoaștere facială sunt tratate ca informație personală chiar și singure
Devin identificatoare ale unei persoane doar atunci când sunt combinate cu numele
Sunt tratate ca informație personală doar dacă au fost obținute cu acordul persoanei
Nu sunt vizate la momentul colectării, ci devin informație personală abia când sunt introduse într-o bază de date
Răspuns corectA. Numărul de pașaport sau datele de recunoaștere facială sunt tratate ca informație personală chiar și singure
Codul de identificare personală include date corporale precum amprentele digitale, datele de recunoaștere facială sau codurile obținute din conversia secvenței de baze ADN, precum și numere alocate individual, precum numărul de identificare (My Number), numărul de pașaport sau numărul carnetului de conducere. Acestea constituie informație personală chiar și singure, deci este greșită ideea că, fără nume, nu ar fi informație personală. Faptul că un element este informație personală nu depinde de existența acordului la colectare și nici de introducerea într-o bază de date. De notat că informația organizată sistematic și căutabilă se numește date personale și atrage obligații suplimentare.
Î13 | GDPR
Care este poziționarea corectă a GDPR?
Este un ghid emis de o organizație internațională, fără forță juridică obligatorie asupra statelor
Este un regulament menit să extindă la nivel internațional legea japoneză privind protecția informațiilor personale
Este un regulament al UE și se aplică doar operatorilor cu sediu în interiorul UE
Este un regulament al UE care se poate aplica și operatorilor din afara UE
Răspuns corectD. Este un regulament al UE care se poate aplica și operatorilor din afara UE
GDPR este Regulamentul General privind Protecția Datelor al UE, o lege distinctă de legea japoneză privind protecția informațiilor personale. Caracteristica sa este aplicabilitatea extrateritorială: dacă un operator oferă produse sau servicii persoanelor aflate în UE, sau monitorizează comportamentul persoanelor din UE, GDPR se poate aplica și unui operator care dezvoltă în Japonia. Prin urmare, nu se poate stabili aplicabilitatea doar în funcție de locul sediului. GDPR nu este nici o extindere a legii japoneze, nici un ghid fără forță obligatorie.
Î14 | Articolul 30-4
În ce caz Articolul 30-4 al Legii dreptului de autor permite folosirea unei opere fără acordul titularului dreptului de autor?
Când scopul nu este ca gândurile sau sentimentele exprimate în operă să fie percepute de utilizator sau de alții
Când proporția operei folosite reprezintă doar o mică parte din întreg
Când opera folosită este publicată gratuit pe internet
Când scopul folosirii nu este comercial, ci limitat la cercetarea academică
Răspuns corectA. Când scopul nu este ca gândurile sau sentimentele exprimate în operă să fie percepute de utilizator sau de alții
Articolul 30-4 al Legii dreptului de autor prevede că o operă poate fi folosită, în limita necesară, atunci când scopul nu este ca gândurile sau sentimentele exprimate în operă să fie percepute de utilizator însuși sau să fie făcute perceptibile altora. A percepe înseamnă a obține o satisfacție intelectuală sau emoțională contemplând gândurile sau sentimentele exprimate în operă, iar citirea operei ca date pentru învățarea automată se consideră că nu se încadrează aici. La punctul 2 al aceluiași articol este menționată explicit analiza informațională, iar crearea și folosirea datelor de antrenare se plasează aici. Publicarea gratuită, scopul non-comercial și proporția redusă a folosirii nu sunt condiții stabilite de acest articol.
Î15 | Clauza de exceptare
Referitor la folosirea operelor pentru antrenarea AI, care este înțelegerea corectă a Articolului 30-4 al Legii dreptului de autor?
Folosirea pentru antrenare este permisă doar dacă opera a fost achiziționată contra cost
Dacă folosirea este pentru antrenare, interesul titularului dreptului de autor nu este niciodată o problemă
Această prevedere nu se aplică atunci când folosirea aduce o atingere nejustificată intereselor titularului dreptului de autor
Dacă antrenarea este legală, chiar dacă rezultatul generat seamănă cu o operă existentă, nu constituie încălcare
Răspuns corectC. Această prevedere nu se aplică atunci când folosirea aduce o atingere nejustificată intereselor titularului dreptului de autor
Articolul 30-4 conține o clauză de exceptare: dispoziția nu se aplică atunci când, ținând cont de tipul și scopul operei, precum și de modul folosirii, aceasta ar aduce o atingere nejustificată intereselor titularului dreptului de autor. Prin urmare, nu se poate spune că „orice folosire este liberă atâta timp cât e pentru antrenarea AI-ului”. De exemplu, dacă se copiază fără a cumpăra o bază de date vândută special pentru analiza informațională și se folosește pentru antrenare, se consideră că se aduce atingere pieței acelei baze de date, intrând sub incidența clauzei de exceptare. De asemenea, chiar dacă etapa de intrare — antrenarea — este legală, dacă rezultatul generat seamănă cu o operă existentă, poate apărea separat o problemă de încălcare a dreptului de autor la etapa de ieșire — generarea sau folosirea rezultatului. Intrarea și ieșirea se evaluează separat. Faptul că opera a fost achiziționată contra cost nu este criteriul care determină aplicarea acestui articol.
Î16 | Dreptul de autor asupra rezultatelor generate
Referitor la posibilitatea protejării prin drept de autor a unei opere generate de AI, care variantă se apropie cel mai mult de înțelegerea actuală, general acceptată?
Dreptul de autor revine automat furnizorului serviciului folosit
Atâta timp cât rezultatul este produs de AI, nu poate fi niciodată recunoscut ca operă
Se decide de la caz la caz, în funcție de existența unei contribuții creative din partea omului
Dreptul de autor revine întotdeauna persoanei care a dat instrucțiunea de generare
Răspuns corectC. Se decide de la caz la caz, în funcție de existența unei contribuții creative din partea omului
Dreptul de autor este un sistem care protejează exprimarea creativă umană, așa că un rezultat produs în mod automat doar de AI nu este operă. Pe de altă parte, dacă omul a contribuit suficient de mult încât să i se poată atribui trăsăturile esențiale ale exprimării, există loc pentru recunoașterea calității de operă. Elementul-cheie al judecății este contribuția creativă, evaluată de la caz la caz în funcție de concretitudinea instrucțiunilor și a încercărilor, precum și de gradul de selecție și modificare a rezultatului generat. Prin urmare, sunt greșite atât ideea că rezultatul nu ar putea fi niciodată operă, cât și ideea că dreptul ar reveni întotdeauna celui care a dat instrucțiunea. De notat că, separat de Legea dreptului de autor, condițiile de utilizare ale serviciului folosit pot stabili tratamentul rezultatului generat, deci trebuie verificate ambele.
Î17 | Invenția de serviciu
Care este tratamentul corect al invenției de serviciu, în Legea brevetelor?
Dacă se prevede prin regulamentul de muncă, dreptul poate reveni angajatorului, iar angajatul primește un beneficiu corespunzător
Chiar dacă invenția a fost făcută în cadrul serviciului, nu există posibilitatea ca dreptul să revină angajatorului
Dreptul revine întotdeauna angajatorului, fără posibilitatea unei prevederi diferite în regulamentul de muncă
Chiar dacă dreptul revine angajatorului, nu este necesară nicio plată de beneficiu către angajat
Răspuns corectA. Dacă se prevede prin regulamentul de muncă, dreptul poate reveni angajatorului, iar angajatul primește un beneficiu corespunzător
Invenția de serviciu este o invenție făcută de un angajat în cadrul serviciului său. Dreptul de a obține brevet apare, în principiu, în persoana angajatului-inventator, dar, dacă se stabilește dinainte prin regulamentul de muncă, dreptul poate reveni angajatorului chiar din momentul apariției sale. În acest caz, angajatul are dreptul să primească un beneficiu economic corespunzător, în bani sau altfel, deci nu este un sistem în care dreptul este preluat fără nicio contraprestație. De asemenea, dreptul nu revine întotdeauna angajatorului și nici nu este exclus să-i revină — tratamentul depinde de existența unei prevederi în acest sens.
Î18 | Secretul comercial
Care este combinația de condiții necesare pentru ca ceva să fie protejat ca secret comercial, conform Legii privind prevenirea concurenței neloiale?
Gestiune ca secret, utilitate, activitate inventivă
Gestiune ca secret, utilitate, necunoaștere publică
Utilitate, noutate, activitate inventivă
Gestiune ca secret, noutate, necunoaștere publică
Răspuns corectB. Gestiune ca secret, utilitate, necunoaștere publică
Cele trei condiții ale secretului comercial sunt: să fie gestionat ca secret (gestiune ca secret), să fie o informație tehnică sau comercială utilă activității economice (utilitate) și să nu fie cunoscut public (necunoaștere publică) — protecția se acordă doar dacă toate trei sunt îndeplinite simultan. Noutatea și activitatea inventivă sunt condiții pentru obținerea unui brevet, nu condiții ale secretului comercial. Spre deosebire de brevet, care oferă exclusivitate în schimbul divulgării conținutului, secretul comercial protejează prin nedivulgare, deci informații pe care nu se dorește să fie făcute publice, precum ponderile unui model antrenat sau soluțiile de preprocesare, se protejează pe această cale.
Î19 | Date furnizate limitat
Referitor la datele furnizate limitat, din Legea privind prevenirea concurenței neloiale, care afirmație este corectă?
Este o categorie care vizează informații tehnice pentru care s-a depus cerere de brevet, dar care nu a fost admisă
Vizează informații care îndeplinesc toate cele trei condiții ale secretului comercial și, în plus, sunt înregistrate
Este o categorie care vizează informații nefurnizate nimănui, păstrate doar în interiorul companiei
Vizează înregistrări electromagnetice acumulate în cantitate semnificativă și gestionate, furnizate cu titlu de afacere unor persoane determinate
Răspuns corectD. Vizează înregistrări electromagnetice acumulate în cantitate semnificativă și gestionate, furnizate cu titlu de afacere unor persoane determinate
Datele furnizate limitat desemnează informații furnizate cu titlu de afacere unor persoane determinate, acumulate în cantitate semnificativă prin mijloace electromagnetice și gestionate ca atare. Este o categorie creată pentru a proteja tranzacțiile de vânzare sau partajare a datelor, iar sensul ei este că poate fi protejată chiar și fără a îndeplini toate cele trei condiții ale secretului comercial. Aceasta pentru că, fiind furnizată mai multor părți, nu se poate garanta strict necunoașterea publică. Informațiile păstrate secret doar intern se protejează prin secretul comercial, iar această categorie nu are legătură cu depunerea sau admiterea unei cereri de brevet.
Î20 | Contractul de dezvoltare
Care este diferența corectă dintre contractul de antrepriză (ukeoi) și contractul de cvasi-mandat (junin), în externalizarea dezvoltării de AI?
Contractul de antrepriză promite finalizarea unei lucrări, iar cel de cvasi-mandat execută cu diligența unui bun administrator
Contractul de antrepriză impune obligația de diligență a unui bun administrator, iar cel de cvasi-mandat promite finalizarea
Ambele promit finalizarea unui rezultat, diferența fiind doar nivelul de acuratețe garantat
Niciunul dintre ele nu promite finalizarea, diferența fiind doar momentul plății remunerației
Răspuns corectA. Contractul de antrepriză promite finalizarea unei lucrări, iar cel de cvasi-mandat execută cu diligența unui bun administrator
Contractul de antrepriză (ukeoi) promite finalizarea unei lucrări: dacă lucrarea nu este finalizată, remunerația nu poate fi cerută, iar pentru un rezultat neconform se poartă răspundere. Contractul de cvasi-mandat (junin) încredințează gestionarea unei afaceri, iar ceea ce se promite nu este finalizarea, ci executarea sarcinii cu diligența unui bun administrator. Deoarece în dezvoltarea de AI nu se știe ce acuratețe se va atinge decât după ce se antrenează efectiv, este obișnuit ca etapele de explorare și PoC să fie contractate ca cvasi-mandat, iar etapele de implementare, odată specificațiile fixate, ca antrepriză. Ghidul privind contractele de utilizare a AI și a datelor, emis de Ministerul Economiei, Comerțului și Industriei, prezintă și el acest model de contractare pe etape.
Î21 | Hard law
Care este distincția corectă dintre hard law și soft law?
Hard law desemnează legile cu forță obligatorie, iar soft law reguli fără forță obligatorie
Hard law desemnează legile care au sancțiuni, iar soft law legile fără sancțiuni
Hard law desemnează acordurile internaționale, iar soft law legile interne
Hard law desemnează legile nou create, iar soft law practicile vechi
Răspuns corectA. Hard law desemnează legile cu forță obligatorie, iar soft law reguli fără forță obligatorie
Hard law este legea stabilită de stat, a cărei încălcare atrage forță coercitivă — aici se încadrează legea privind protecția informațiilor personale sau legea dreptului de autor. Soft law este o regulă fără forță juridică obligatorie, precum ghidurile, normele de autoreglementare ale unei industrii sau codurile de conduită ale companiilor. Fiind soft law, nu are sens distincția lege cu sancțiuni versus fără sancțiuni, deoarece nu este lege. Nu este nici o distincție internă versus internațională, nici veche versus nouă. În domeniile unde tehnologia evoluează rapid, se obișnuiește să se indice mai întâi direcția prin soft law și abia acolo unde e necesar să se transforme în lege — politica japoneză privind AI este, în esență, centrată pe soft law.
Î22 | Abordarea riscului
Care este ideea abordării bazate pe risc (risk-based approach), în reglementarea AI sau în practica internă a companiilor?
A opri uniform furnizarea serviciului pentru acea utilizare, de îndată ce se confirmă un risc
A enumera riscurile posibile și a impune același nivel de măsuri pentru toate utilizările
A lăsa evaluarea riscului în seama utilizatorului, operatorul limitându-se doar la furnizarea de informații
A varia intensitatea măsurilor sau a reglementării în funcție de mărimea riscului pe care îl aduce utilizarea
Răspuns corectD. A varia intensitatea măsurilor sau a reglementării în funcție de mărimea riscului pe care îl aduce utilizarea
Abordarea bazată pe risc este ideea de a varia intensitatea reglementării sau a măsurilor în funcție de mărimea riscului pe care îl aduce utilizarea AI-ului. Chiar și aceeași tehnologie de recunoaștere facială are un impact complet diferit asupra oamenilor dacă e folosită pentru deblocarea ecranului unui dispozitiv sau pentru supraveghere continuă în spații publice. Dacă s-ar impune o reglementare uniform strictă indiferent de utilizare, s-ar opri și utilizările cu daune mici; dacă s-ar relaxa uniform, s-ar lăsa nesupravegheate utilizările cu daune mari. De aceea, obligațiile stricte se alocă utilizărilor cu impact mare, iar tratamentul mai ușor celor cu impact mic. Aceeași idee este folosită și în interiorul companiilor, clasificând proiectele de AI după nivelul de risc și trimițând spre o examinare riguroasă doar pe cele cu risc ridicat.
Î23 | Considerații la etapa de proiectare
Care este descrierea cea mai potrivită pentru ideea privacy by design?
A limita numărul persoanelor care manipulează informațiile personale, astfel încât să le poată vedea doar cei autorizați
A încorpora mecanismele de protecție a vieții private încă din etapa de planificare și proiectare
A dezvălui, la cererea utilizatorului, scopul pentru care sunt folosite datele colectate
A investiga cauza după ce apare o problemă și a adăuga ulterior măsurile necesare
Răspuns corectB. A încorpora mecanismele de protecție a vieții private încă din etapa de planificare și proiectare
Privacy by design este ideea de a nu adăuga măsuri după ce a apărut o problemă, ci de a încorpora protecția vieții private încă din etapa de planificare și proiectare. Deciziile precum a proiecta astfel încât să nu se colecteze date, a le șterge după perioada necesară sau a le prelucra într-o formă neidentificabilă devin cu atât mai costisitoare cu cât sunt introduse mai târziu. Dezvăluirea scopului de utilizare sau limitarea drepturilor de acces sunt, în sine, măsuri corecte, dar nu privesc momentul la care sunt introduse, deci nu descriu această idee. Este un concept pereche cu security by design, care încorporează măsurile de securitate încă din etapa de proiectare.
Î24 | Variabila proxy
Chiar dacă atributele sensibile sunt eliminate din datele de antrenare, poate rămâne un rezultat inechitabil. Care este motivul principal al acestui fapt?
Pentru că alte caracteristici, precum codul poștal, funcționează ca substitut al atributului eliminat
Pentru că, deși atributul e eliminat, modelul e reantrenat ulterior cu alte date care îl conțin
Pentru că eliminarea atributului reduce volumul de date, iar acuratețea modelului scade
Pentru că procesul de eliminare a atributului în sine deformează distribuția datelor
Răspuns corectA. Pentru că alte caracteristici, precum codul poștal, funcționează ca substitut al atributului eliminat
O caracteristică ce ajunge să funcționeze ca substitut al unui atribut sensibil se numește variabilă proxy. Codul poștal se corelează puternic, prin zona de reședință, cu rasa sau venitul, iar istoricul liceului absolvit sau al activităților extrașcolare se poate corela cu genul. Atâta timp cât astfel de caracteristici rămân, chiar dacă se elimină din intrare câmpul de gen sau de rasă, modelul poate învăța indirect aceeași discriminare. De aceea, verificarea echității nu se face prin eliminarea unor coloane din intrare, ci prin agregarea rezultatelor pe fiecare atribut și măsurarea diferențelor. Mai mult, definiția echității are mai multe variante — egalizarea ratei de acceptare pe atribute, egalizarea ratei de eroare etc. — și, în general, nu pot fi îndeplinite simultan toate, deci trebuie aleasă și explicată definiția potrivită scopului.
Î25 | Intrare adversarială
Care este descrierea potrivită pentru Adversarial Attack (Adversarial Examples)?
Adăugarea la intrare a unor modificări minuscule, imperceptibile pentru om, care provoacă o clasificare greșită
Trimiterea unui volum mare de interogări pentru a culege ieșirile și a reconstitui un model echivalent
Modificarea parametrilor unui model distribuit, pentru a insera un comportament specific
Amestecarea unor date manipulate în datele de antrenare, deformând rezultatul antrenării
Răspuns corectA. Adăugarea la intrare a unor modificări minuscule, imperceptibile pentru om, care provoacă o clasificare greșită
Adversarial Attack adaugă la intrare modificări minuscule, aproape imperceptibile pentru ochiul uman, pentru a face modelul aflat în operare să dea o clasificare greșită. Vizează etapa de inferență, iar modelul însuși nu este modificat. Amestecarea unor date manipulate în datele de antrenare pentru a deforma rezultatul este otrăvirea datelor (data poisoning), care vizează etapa de antrenare. Reconstituirea unui model echivalent prin interogări masive este furtul de model, iar modificarea parametrilor sau a fișierelor distribuite ale modelului este otrăvirea modelului — fiecare atac vizează un moment și o țintă diferite. Apărarea împotriva oricăruia dintre ele se realizează pornind de la ideea security by design, care încorporează securitatea încă din etapa de proiectare.
Î26 | Distincția furtului
Dintre atacurile asupra AI, care corespunde furtului de model (model extraction)?
Amestecarea unor date manipulate în datele de antrenare, deformând rezultatul antrenării
Estimarea și extragerea, pe baza ieșirilor, a informațiilor conținute în datele de antrenare
Modificarea parametrilor unui model distribuit, schimbând comportamentul pentru anumite intrări
Trimiterea unui volum mare de interogări pentru a culege ieșirile și a reconstitui un model echivalent
Răspuns corectD. Trimiterea unui volum mare de interogări pentru a culege ieșirile și a reconstitui un model echivalent
Furtul de model trimite un volum mare de intrări către modelul țintă, culege ieșirile și reconstituie un model echivalent ca funcționare. Ceea ce se fură este modelul însuși, iar atacul poate reuși chiar dacă modelul e oferit doar ca API public. În schimb, furtul de date este atacul care extrage, din observarea ieșirilor etc., informații conținute în datele de antrenare — aici ceea ce se fură sunt datele. Amestecarea de date manipulate în datele de antrenare este otrăvirea datelor, iar modificarea parametrilor sau a fișierelor distribuite ale modelului este otrăvirea modelului — prima vizează etapa de antrenare, a doua etapa de antrenare sau de distribuire. Se disting clar dacă se privește ce anume e furat și ce moment e vizat.
Î27 | Bula informațională
Care este fenomenul considerat a apărea din cauza optimizării făcute de algoritmii de recomandare?
Motivele deciziei rămân ascunse în interior, iar oamenii nu mai pot urmări rațiunea
Sunt selectate și arătate mai ales informații pe placul utilizatorului, iar celelalte informații nu mai ajung la el
Persoane cu opinii similare repetă emiterea și aprobarea reciprocă, întărindu-și opinia
Imagini sau sunete false generate ajung să fie percepute pe scară largă ca fiind reale
Răspuns corectB. Sunt selectate și arătate mai ales informații pe placul utilizatorului, iar celelalte informații nu mai ajung la el
Filter bubble (bula de filtrare) este fenomenul în care algoritmul de recomandare selectează informația în funcție de preferințele utilizatorului, iar rezultatul este că acea persoană ajunge, ca într-o bulă, să vadă doar informații pe placul ei — cauza stă în optimizarea algoritmică. Utilizatorul nici măcar nu conștientizează că informația e filtrată. Fenomenul în care persoane cu opinii similare, într-un spațiu închis, repetă emiterea și aprobarea reciprocă, ajungând să creadă că opinia lor e singura corectă, este camera de ecou (echo chamber), a cărei cauză stă în tendința oamenilor de a se aduna cu cei asemănători. Faptul că imaginile sau sunetele false sunt luate drept reale ține de deepfake și de știrile false, iar imposibilitatea de a urmări motivele deciziei este problema cutiei negre — toate aparțin altor subiecte.
Î28 | Imagini false
Care este descrierea cea mai potrivită pentru deepfake?
Prin învățare profundă, se creează un text scurt care rezumă esențialul dintr-un volum mare de text
Prin învățare profundă, se vizualizează, arătând regiunea din imagine, motivul unei decizii
Prin învățare profundă, se creează imagini sau sunete în care o persoană reală pare că vorbește
Prin învățare profundă, se generează și se afișează chipuri noi ale unor persoane inexistente
Răspuns corectC. Prin învățare profundă, se creează imagini sau sunete în care o persoană reală pare că vorbește
Deepfake desemnează tehnologia și produsele obținute prin învățare profundă, prin care se creează imagini sau sunete în care o persoană reală pare că spune ceva ce nu a spus sau face ceva ce nu a făcut. Elementul central este impersonarea unei persoane reale, ceea ce diferă de scopul generării unor chipuri ale unor persoane inexistente. Este folosit pentru defăimare, fraudă sau ingerință electorală, sporind considerabil forța de convingere a știrilor false. Ca măsură, pe lângă cercetarea tehnicilor de detecție, se lucrează la înregistrarea provenienței chiar din momentul filmării sau al generării, pentru a putea verifica ulterior orice modificare. Rezumarea textului sau vizualizarea motivelor deciziei nu au legătură cu utilizarea abuzivă.
Î29 | Înregistrarea provenienței
În ce privește asigurarea transparenței AI, care este scopul cel mai potrivit al păstrării provenienței datelor?
Pentru a reduce consumul de resurse de calcul folosite la antrenare și a micșora costurile
Pentru a putea urmări sursa și procesul de prelucrare, ajungând la cauza unei probleme
Pentru a face inferența modelului mai rapidă și a scurta timpul de răspuns
Pentru a mări volumul de date disponibile pentru antrenare și a crește acuratețea modelului
Răspuns corectB. Pentru a putea urmări sursa și procesul de prelucrare, ajungând la cauza unei probleme
Provenența datelor este înregistrarea a ce date au fost obținute de unde și cum au fost prelucrate pentru a fi folosite la antrenare. Fără această înregistrare, dacă apare o problemă la ieșire, nu se poate ajunge la datele care au cauzat-o și nici nu se poate corecta sau explica. Transparența nu înseamnă doar a publica interiorul modelului, ci include și a arăta, în funcție de destinatar, în ce scop este folosit, din ce date a fost construit și unde îi sunt limitele. Reducerea resurselor de calcul, accelerarea inferenței și creșterea volumului de date nu sunt scopuri ale înregistrării provenienței. Merită reținută și trasabilitatea, capacitatea de a urmări din ce date, prin ce model, s-a ajuns la ce decizie.
Î30 | Verificarea etică
Care este descrierea potrivită pentru evaluarea etică (ethics assessment), în guvernanța AI?
Documentul care consemnează politica proprie a companiei privind tratarea AI-ului și o prezintă în exterior
Procedura de a supraveghea continuu, după începerea operării, tendințele ieșirilor și reclamațiile
Procedura de a identifica și evalua, în etapa de planificare, impactul și riscurile anticipate
Mecanismul prin care, dintr-o poziție independentă față de departamentul responsabil, se verifică dacă operarea urmează politica
Răspuns corectC. Procedura de a identifica și evalua, în etapa de planificare, impactul și riscurile anticipate
Evaluarea etică este procedura prin care, în etapa de planificare a unui proiect de AI, se identifică și se evaluează impactul și riscurile anticipate, iar în funcție de rezultat se ajustează rigoarea examinării. Supravegherea continuă a tendințelor ieșirilor și a reclamațiilor după începerea operării este monitorizarea, verificarea independentă a conformității cu politica este auditul AI, iar consemnarea politicii proprii într-un document este politica privind AI — toate sunt elemente diferite ale guvernanței AI. Pe lângă acestea, se adaugă păstrarea implicării umane la punctele-cheie ale deciziei, reproductibilitatea, care permite reconstruirea ulterioară a modelului, și trasabilitatea, care permite urmărirea traseului deciziei.
Exersare: rezolvați întrebările de pe această pagină
Acesta este un instrument de exersare cu întrebări în ordine aleatorie (funcționează când JavaScript este activat). Puteți citi oricum toate întrebările și explicațiile de mai sus.
* Explicațiile sunt informații în scop de studiu. Tematica și sistemul examenelor se schimbă de la an la an, așa că verificați întotdeauna anunțurile oficiale ale organizatorului examenului.
Această pagină este o traducere a textului original în japoneză. Dacă traducerea diferă de original, prevalează versiunea în japoneză. Vedeți originalul în japoneză