Care dintre următoarele afirmații despre perceptronul simplu este corectă?
Este format doar din stratul de intrare și cel de ieșire și poate rezolva doar probleme liniar separabile
Este priceput să extragă caracteristici locale glisând un filtru peste imagine
Are conexiuni care întorc starea în timp și poate procesa date secvențiale păstrând ordinea lor
Are mai multe straturi ascunse și poate face separare neliniară, deci poate reprezenta și SAU-exclusiv (XOR)
Răspuns corectA. Este format doar din stratul de intrare și cel de ieșire și poate rezolva doar probleme liniar separabile
Perceptronul simplu este cea mai simplă rețea neuronală, formată doar din stratul de intrare și cel de ieșire, și poate rezolva numai probleme liniar separabile, adică separabile printr-o singură dreaptă. SAU-exclusiv (XOR) are punctele cu ieșire 1 și cele cu ieșire 0 alternând pe diagonală, așa că nicio dreaptă nu le poate separa, deci perceptronul simplu nu îl poate reprezenta. Perceptronul multistrat, care adaugă straturi ascunse pentru a curba granița de decizie, poate reprezenta și XOR — prima variantă de răspuns descrie acest perceptron multistrat. Reîntoarcerea stării din momentul anterior pentru a trata secvențe este specifică rețelelor neuronale recurente, iar glisarea unui filtru pentru a extrage caracteristici locale este specifică straturilor convoluționale.
Î2 | Potrivirea GPU-ului
Care este motivul cel mai potrivit pentru care GPU-urile sunt considerate potrivite pentru antrenarea învățării profunde?
Pentru că au o capacitate de stocare a datelor de antrenare mult mai mare decât CPU-ul
Pentru că au integrat de la bun început, ca circuit dedicat, regula lanțului folosită în retropropagare
Pentru că pot efectua rapid, în secvență, procese complexe cu multe ramificații, folosind puține nuclee puternice
Pentru că au un număr mare de nuclee de calcul mici și pot procesa în paralel același calcul simultan
Răspuns corectD. Pentru că au un număr mare de nuclee de calcul mici și pot procesa în paralel același calcul simultan
Antrenarea învățării profunde este un calcul care repetă de un număr enorm de ori înmulțiri și adunări de matrice și vectori. GPU-ul are un număr mare de nuclee mici care fac operații simple și este potrivit să ruleze același calcul în paralel simultan, așa că se potrivește bine cu această formă de calcul. Executarea rapidă și secvențială a proceselor cu multe ramificații, folosind puține nuclee puternice, este punctul forte al CPU-ului, care nu are multe nuclee. Avantajul GPU-ului nu este capacitatea de stocare, ci gradul de paralelism. Nu există un circuit dedicat pentru regula lanțului, iar TPU este cel proiectat special pentru calculul cu tensori din învățarea profundă.
Î3 | Cauza dispariției gradientului
De ce folosirea funcției sigmoide în straturile ascunse tinde să provoace problema dispariției gradientului?
Pentru că ieșirea se încadrează între 0 și 1, iar la suprapunerea straturilor ieșirea în sine tinde spre 0
Pentru că suma ieșirilor este normalizată la 1, deci valorile devin tot mai mici cu fiecare strat
Pentru că valoarea maximă a derivatei este 0,25, iar aceasta se înmulțește repetat pe măsură ce se urcă prin straturi
Pentru că ieșirea este mereu 0 pentru intrări negative, iar acea unitate încetează să mai învețe
Răspuns corectC. Pentru că valoarea maximă a derivatei este 0,25, iar aceasta se înmulțește repetat pe măsură ce se urcă prin straturi
Problema dispariției gradientului este fenomenul în care, în timpul retropropagării, gradientul se apropie de 0, iar straturile dinspre intrare nu mai învață. Funcția sigmoidă are o derivată al cărei maxim este doar 0,25, așa că, urcând prin fiecare strat, se înmulțesc numere sub 0,25, iar într-o rețea profundă gradientul aproape că dispare. Problema nu este valoarea ieșirii în sine, ci mărimea derivatei acesteia. Faptul că gradientul devine 0 pentru intrări negative și învățarea se oprește este punctul slab al funcției ReLU, iar Leaky ReLU este soluția pentru aceasta. Normalizarea sumei ieșirilor la 1 este specifică funcției softmax.
Î4 | Funcția ReLU
Care este descrierea potrivită pentru funcția ReLU?
Este o funcție cu formă de curbă în S care comprimă intrarea între 0 și 1
Este o funcție care normalizează toate ieșirile împreună, astfel încât suma lor să fie 1
Este o funcție care încadrează intrarea între -1 și 1, cu formă simetrică față de origine
Este o funcție care returnează valoarea intrării nemodificată dacă este pozitivă și 0 dacă este negativă
Răspuns corectD. Este o funcție care returnează valoarea intrării nemodificată dacă este pozitivă și 0 dacă este negativă
Funcția ReLU este o funcție simplă care returnează valoarea intrării nemodificată dacă este pozitivă și 0 dacă este negativă. În zona pozitivă derivata este mereu 1, deci gradientul nu se micșorează pe măsură ce se urcă prin straturi, ceea ce atenuează mult problema dispariției gradientului. Totuși, în zona negativă derivata este 0, așa că o unitate care ajunge o dată în zona negativă poate înceta să mai învețe, motiv pentru care există funcția Leaky ReLU, care păstrează o pantă mică pe partea negativă. Forma în S care comprimă între 0 și 1 este funcția sigmoidă, forma simetrică față de origine între -1 și 1 este funcția tanh, iar normalizarea sumei ieșirilor la 1 este funcția softmax.
Î5 | Leaky ReLU
Ce problemă a funcției ReLU este menită să rezolve funcția Leaky ReLU?
Faptul că suma ieșirilor nu este 1, deci nu poate fi interpretată ca o probabilitate
Faptul că pentru intrări negative gradientul devine 0, iar acea unitate încetează să mai învețe
Faptul că, deoarece calculul include o funcție exponențială, procesarea unei singure treceri devine mai grea
Faptul că pentru intrări pozitive gradientul rămâne 1, iar mărimea actualizării devine prea mare
Răspuns corectB. Faptul că pentru intrări negative gradientul devine 0, iar acea unitate încetează să mai învețe
Funcția ReLU are atât ieșirea, cât și derivata egale cu 0 pe zona negativă, așa că, dacă intrarea unei unități rămâne mereu negativă, gradientul nu mai curge, iar acea unitate nu mai învață niciodată. Funcția Leaky ReLU evită acest impas păstrând o pantă mică și pe partea negativă. Faptul că derivata este 1 pe zona pozitivă este un avantaj al funcției ReLU, nu un defect — tocmai această proprietate previne dispariția gradientului. Faptul că suma ieșirilor nu este 1 este firesc pentru o funcție de activare; pentru straturi de ieșire care trebuie citite ca probabilitate se folosește funcția softmax. Calculul cu funcție exponențială apare la sigmoidă și la tanh, în timp ce ReLU este mai degrabă ușor de calculat.
Î6 | Softmax
Care este utilizarea tipică a funcției softmax?
Este plasată în stratul de ieșire al unei probleme de regresie, unde produce direct valori continue
Este folosită ca funcție de activare într-un strat ascuns, dând neliniaritate stratului
Este plasată în stratul de ieșire pentru clasificare binară, dând probabilitatea uneia dintre clase
Este plasată în stratul de ieșire pentru clasificare multi-clasă, dând probabilitatea fiecărei clase
Răspuns corectD. Este plasată în stratul de ieșire pentru clasificare multi-clasă, dând probabilitatea fiecărei clase
Funcția softmax normalizează întregul set de ieșiri astfel încât suma lor să fie exact 1, deci se plasează în stratul de ieșire al unei clasificări cu trei sau mai multe clase, pentru a fi citită ca probabilitatea de apartenență la fiecare clasă. Ca funcție de eroare se combină de obicei cu entropia încrucișată. Funcția care dă probabilitatea în clasificarea binară este sigmoida, iar funcțiile folosite pe scară largă ca activare în straturile ascunse sunt ReLU și tanh. La regresie, stratul de ieșire produce direct valoarea, iar ca funcție de eroare se folosește eroarea medie pătratică.
Î7 | Funcția de eroare pentru regresie
La o problemă de regresie precum estimarea prețului unei locuințe, care este funcția de eroare aleasă în mod standard?
Entropia încrucișată, care măsoară abaterea dintre distribuția de probabilitate prezisă și cea corectă
Triplet Loss, care învață relația de distanță dintre un triplet de elemente
Contrastive Loss, care învață prin distanță dacă două elemente sunt identice sau nu
Eroarea medie pătratică, care ridică la pătrat diferența dintre predicție și valoarea corectă și o mediază
Răspuns corectD. Eroarea medie pătratică, care ridică la pătrat diferența dintre predicție și valoarea corectă și o mediază
Regresia este o problemă în care se estimează o valoare continuă, așa că alegerea firească este eroarea medie pătratică, care ridică la pătrat diferența dintre predicție și valoarea corectă și o mediază. Entropia încrucișată măsoară abaterea dintre distribuții de probabilitate și se folosește la clasificare, de obicei combinată cu softmax în stratul de ieșire pentru clasificarea multi-clasă. Triplet Loss învață relația de distanță dintre un ancoră, un exemplu pozitiv și unul negativ, iar Contrastive Loss învață prin distanță dacă două elemente sunt identice sau nu — ambele sunt funcții de eroare menite să obțină o reprezentare a similarității. Alegerea funcției de eroare în funcție de sarcină este exact obiectivul acestui subiect.
Î8 | Eroarea pe triplete
Care este descrierea potrivită pentru funcția de eroare Triplet Loss?
Ridică la pătrat diferența dintre predicție și valoarea corectă și o mediază, măsurând direct abaterea de mărime
Măsoară abaterea dintre distribuția de probabilitate prezisă și cea corectă și este folosită pe scară largă la clasificare
Folosește un triplet format din ancoră, exemplu pozitiv și exemplu negativ, astfel încât exemplul pozitiv să fie mai apropiat decât cel negativ
Măsoară distanța dintre două distribuții de probabilitate și acționează pentru a le apropia
Răspuns corectC. Folosește un triplet format din ancoră, exemplu pozitiv și exemplu negativ, astfel încât exemplul pozitiv să fie mai apropiat decât cel negativ
Triplet Loss folosește un triplet format dintr-o dată de referință, o dată de același tip (exemplu pozitiv) și una de alt tip (exemplu negativ), și antrenează astfel încât distanța dintre referință și exemplul pozitiv să fie mai mică decât cea dintre referință și exemplul negativ. Se folosește pentru a construi un spațiu în care similaritatea este exprimată prin distanță. Divergența Kullback-Leibler (KL) măsoară abaterea dintre două distribuții de probabilitate, eroarea medie pătratică ridică la pătrat și mediază diferența dintre predicție și valoarea corectă, iar entropia încrucișată măsoară abaterea distribuțiilor de probabilitate și este folosită pe scară largă la clasificare. Contrastive Loss, care învață dacă o pereche de elemente este identică sau nu, aparține aceluiași subiect.
Î9 | Retropropagarea erorii
Care este descrierea cea mai potrivită pentru retropropagarea erorii?
Este procedura care rescrie direct ponderile, în ordine, începând din stratul de ieșire — actualizarea propriu-zisă
Este procedura care deplasează ponderile aleatoriu, puțin câte puțin, și adoptă direcția în care eroarea a scăzut
Este procedura care avansează calculul în ordine de la intrare spre ieșire, pentru a obține ieșirea
Este procedura care, folosind regula lanțului, urcă de la ieșire spre intrare pentru a calcula gradientul
Răspuns corectD. Este procedura care, folosind regula lanțului, urcă de la ieșire spre intrare pentru a calcula gradientul
Retropropagarea erorii este metoda care, folosind regula lanțului — care descompune derivata unei funcții compuse în produsul derivatelor componentelor — urcă de la ieșire spre intrare pentru a calcula eficient gradientul fiecărei ponderi. Ceea ce se obține este strict gradientul; deplasarea efectivă a ponderilor pe baza acelui gradient este rolul metodei gradientului descendent. Trebuie avut grijă să nu se afirme că retropropagarea actualizează ponderile, căci ar fi imprecis. Deplasarea aleatorie și adoptarea direcției bune este ideea unei căutări fără gradient, iar avansul calculului de la intrare spre ieșire este propagarea directă, adică procedura de inferență.
Î10 | Problema alocării creditului
Cum se numește problema de a atribui, pentru eroarea finală, cât de responsabilă este fiecare unitate din fiecare strat?
Problema alocării creditului
Problema exploziei gradientului
Problema dispariției gradientului
Blestemul dimensionalității
Răspuns corectA. Problema alocării creditului
Problema alocării creditului este problema de a stabili cât de responsabilă trebuie considerată fiecare unitate din fiecare strat intermediar pentru eroarea apărută la ieșire. Retropropagarea erorii este considerată metoda care, prin regula lanțului, a făcut posibil de calculat această alocare. Problema dispariției gradientului este fenomenul în care gradientul se apropie de 0 pe măsură ce se urcă prin straturi, astfel încât straturile dinspre intrare nu mai învață, iar problema exploziei gradientului este fenomenul opus, în care gradientul devine prea mare și diverge — ambele apar la aplicarea retropropagării erorii. Blestemul dimensionalității este fenomenul în care necesarul de date crește brusc odată cu numărul de dimensiuni ale caracteristicilor, și este plasat în programă la subiectul învățării automate.
Î11 | Regularizarea L1
Care este caracteristica potrivită pentru regularizarea L1?
Folosește suma pătratelor ponderilor ca penalizare, aliniind valorile spre mici, dar rar aducându-le la 0
Folosește suma valorilor absolute ale ponderilor ca penalizare, iar valorile tind să devină exact 0
Dezactivează aleatoriu unități la fiecare pas de antrenare, prevenind dependența excesivă de anumite unități
Oprește antrenarea în momentul în care eroarea pe datele de validare începe să se înrăutățească
Răspuns corectB. Folosește suma valorilor absolute ale ponderilor ca penalizare, iar valorile tind să devină exact 0
Regularizarea L1 adaugă la funcția de eroare, ca penalizare, suma valorilor absolute ale ponderilor, și tinde să împingă ponderile exact la 0. În consecință, coeficienții caracteristicilor neutilizate devin 0 și dispar automat, producând un efect de selecție a caracteristicilor. Această stare se numește sparsitate. Regularizarea L2 folosește ca penalizare suma pătratelor ponderilor și aliniază valorile spre mici, dar rareori le aduce la 0. Dezactivarea aleatorie a unităților la antrenare este dropout, iar oprirea antrenării la înrăutățirea erorii de validare este oprirea timpurie — ambele sunt răspunsuri la supra-antrenare, dar cu mecanisme diferite.
Î12 | Regresia ridge
Ce tip de regularizare este folosit în regresia ridge?
Regularizarea L0, care penalizează numărul de ponderi nenule
Regularizarea L2, care adaugă ca penalizare suma pătratelor ponderilor
Regularizarea L1, care penalizează suma valorilor absolute ale ponderilor
Dropout, care dezactivează aleatoriu unități în timpul antrenării
Răspuns corectB. Regularizarea L2, care adaugă ca penalizare suma pătratelor ponderilor
Regresia ridge este regresia liniară combinată cu regularizarea L2. Deoarece adaugă ca penalizare suma pătratelor ponderilor, coeficienții în ansamblu sunt ținuți mici, prevenind supra-antrenarea. Regresia liniară combinată cu regularizarea L1 este regresia lasso, care tinde să aducă coeficienții exact la 0, obținând soluții sparse. Corespondența L1–lasso și L2–ridge se confundă ușor, așa că trebuie reținută împreună. Regularizarea L0 penalizează direct numărul de ponderi nenule, dar acest număr nu este derivabil, deci e greu de integrat în antrenarea bazată pe gradient. Dropout este o metodă de regularizare specifică rețelelor neuronale.
Î13 | Dropout
Care este descrierea potrivită pentru dropout?
Sporește datele de antrenare prin oglindirea sau decuparea imaginilor
Dezactivează aleatoriu o proporție fixă de unități la antrenare, pentru a reduce supra-antrenarea
Oprește antrenarea în momentul în care eroarea pe datele de validare începe să crească
Aliniază ieșirile straturilor intermediare, în cadrul unui mini-lot, la medie 0 și dispersie 1, pentru a stabiliza antrenarea
Răspuns corectB. Dezactivează aleatoriu o proporție fixă de unități la antrenare, pentru a reduce supra-antrenarea
Dropout dezactivează aleatoriu, la fiecare pas de antrenare, o proporție fixă de unități din straturile ascunse. Deoarece la fiecare pas se antrenează o rețea puțin diferită ca formă, se previne o memorare bazată exclusiv pe anumite combinații de unități, obținându-se un efect similar cu medierea mai multor modele. Dezactivarea are loc doar la antrenare; la inferență se folosesc toate unitățile. Deși numele seamănă, în programă dropout este clasificat la subiectul 14 (regularizare), nu la subiectul 19 (straturi de normalizare). Alinierea distribuției în cadrul unui mini-lot este normalizarea pe loturi (batch normalization), sporirea datelor este augmentarea datelor, iar oprirea la înrăutățirea erorii este oprirea timpurie.
Î14 | Antrenarea pe mini-loturi
Care este descrierea potrivită pentru antrenarea pe mini-loturi (mini-batch)?
Este metoda în care ponderile nu se actualizează, ci se folosesc mereu valori fixate dinainte
Este metoda în care gradientul se calculează pe întregul set de date de antrenare și ponderile se actualizează o singură dată
Este metoda în care ponderile se actualizează pentru fiecare bloc de câteva zeci până la câteva sute de exemple
Este metoda în care ponderile se actualizează de fiecare dată când se folosește o singură dată de antrenare
Răspuns corectC. Este metoda în care ponderile se actualizează pentru fiecare bloc de câteva zeci până la câteva sute de exemple
Antrenarea pe mini-loturi împarte datele de antrenare în blocuri de câteva zeci până la câteva sute de exemple și actualizează ponderile calculând gradientul pentru fiecare bloc. Are o poziție intermediară: gradientul nu variază atât de mult ca la învățarea online, care actualizează după fiecare exemplu, dar calculul nu este atât de greu ca la învățarea pe lot întreg, care actualizează o singură dată pentru toate datele — de aceea, în practică, mini-loturile sunt folosite aproape peste tot. Coborârea în gradient stocastic (SGD) calculează gradientul doar pe o parte din date, iar fluctuațiile rezultate au avantajul că ajută la ieșirea din puncte șa sau din minime locale superficiale. Neactualizarea ponderilor nu este antrenare, ci simplă inferență.
Î15 | Epoca
Care este relația potrivită dintre epocă și iterație?
Epoca se referă la mărimea mini-lotului, iar iterația la mărimea ratei de învățare
Epoca înseamnă o singură parcurgere a datelor, iar iterația înseamnă o singură actualizare a ponderilor
Epoca înseamnă o singură actualizare a ponderilor, iar iterația înseamnă o singură parcurgere a datelor
Atât epoca, cât și iterația, se referă la o singură parcurgere a datelor
Răspuns corectB. Epoca înseamnă o singură parcurgere a datelor, iar iterația înseamnă o singură actualizare a ponderilor
Epoca înseamnă o singură parcurgere a întregului set de date de antrenare, iar iterația înseamnă o singură actualizare a ponderilor. Cele două sunt legate prin mărimea mini-lotului: numărul de iterații pe epocă este numărul de exemple împărțit la mărimea mini-lotului. De exemplu, pentru 3000 de exemple procesate cu mini-loturi de 50, o epocă are 60 de iterații. Mărind mini-lotul, gradientul unei actualizări devine mai stabil, dar numărul de actualizări pe epocă scade; micșorându-l, actualizările cresc, dar fluctuațiile devin mai mari. Atât mărimea mini-lotului, cât și rata de învățare sunt hiperparametri stabiliți dinainte de om și sunt concepte diferite de epocă și iterație.
Î16 | Punctul șa
Care este descrierea potrivită pentru punctul șa (saddle point)?
Este un punct care, privit dintr-o direcție, e minim, iar privit din altă direcție, e maxim
Este un punct în care eroarea este cea mai mică pe o vecinătate, dar există puncte mai bune în ansamblu
Este o regiune în care eroarea este constantă pe tot domeniul, fără pantă în nicio direcție
Este punctul în care eroarea este cea mai mică din întregul domeniu posibil
Răspuns corectA. Este un punct care, privit dintr-o direcție, e minim, iar privit din altă direcție, e maxim
Punctul șa este un punct care, privit dintr-o direcție, pare o vale, iar privit din alta, pare un vârf — numele vine de la forma șeii unui cal. În învățarea profundă, unde numărul de parametri este foarte mare, se consideră că e mai probabil ca antrenarea să rămână blocată într-un punct șa decât să ajungă la un minim local, care ar fi o vale simultan în toate direcțiile. Punctul cu cea mai mică eroare din întregul domeniu este minimul global, iar cel mai mic doar pe o vecinătate este minimul local. Coborârea în gradient stocastic (SGD), datorită fluctuațiilor gradientului, are mai multe șanse să iasă dintr-o astfel de stagnare.
Î17 | Adam
Ce idei combină metoda de optimizare Adam?
Combină două tipuri de penalizări: suma valorilor absolute și suma pătratelor ponderilor
Combină un mecanism de tip inerție cu un mecanism care adaptează rata de învățare
Alternează între antrenarea pe lot întreg și antrenarea online
Combină două tipuri de căutare: grid search și random search
Răspuns corectB. Combină un mecanism de tip inerție cu un mecanism care adaptează rata de învățare
Adam este o metodă de optimizare care combină ideea momentum, care adaugă cantitatea actualizării anterioare ca inerție, cu ideea RMSprop, care ajustează automat rata de învățare pentru fiecare parametru — este folosită frecvent ca valoare implicită în practică. Familia care adaptează rata de învățare pornește de la AdaGrad, care scade rata de învățare cu atât mai mult cu cât actualizările unui parametru au fost mai mari, dar continuă să o scadă fără oprire; RMSprop a atenuat acest lucru folosind o medie mobilă exponențială. În aceeași familie se află și AdaDelta, AdaBound și AMSBound. Penalizarea ponderilor ține de regularizare, iar grid search și random search țin de căutarea hiperparametrilor — niciuna dintre ele nu este regula de actualizare propriu-zisă.
Î18 | No Free Lunch
Ce afirmă teorema No Free Lunch?
Că nu există un algoritm universal superior tuturor celorlalți pentru orice problemă
Că necesarul de date de antrenare crește brusc pe măsură ce crește numărul de dimensiuni al caracteristicilor
Că, dacă rata de învățare scade continuu, se ajunge întotdeauna la minimul global
Că, mărind modelul, eroarea se înrăutățește mai întâi și apoi scade din nou
Răspuns corectA. Că nu există un algoritm universal superior tuturor celorlalți pentru orice problemă
Teorema No Free Lunch susține că, mediind peste toate problemele posibile, nu există un algoritm universal superior tuturor celorlalte. Prin urmare, alegerea metodei trebuie gândită pentru fiecare problemă în parte; nu există un răspuns care să fie mereu cel mai bun. Faptul că, mărind modelul, eroarea se înrăutățește mai întâi și apoi scade din nou este fenomenul dublei coborâri (double descent), aflat la același subiect. Creșterea bruscă a necesarului de date odată cu numărul de dimensiuni este blestemul dimensionalității. Nu există garanția că scăderea continuă a ratei de învățare duce mereu la minimul global — se poate rămâne blocat într-un minim local sau într-un punct șa.
Î19 | Random search
Care este descrierea potrivită pentru random search, o metodă de căutare a hiperparametrilor?
Aranjează valorile candidate într-o grilă și încearcă, în ordine, toate combinațiile
Dezactivează aleatoriu unități la fiecare pas de antrenare, pentru a obține un comportament mediat
Oprește antrenarea în momentul în care eroarea pe datele de validare începe să se înrăutățească
Alege aleatoriu puncte din intervalul de căutare și încearcă acele combinații
Răspuns corectD. Alege aleatoriu puncte din intervalul de căutare și încearcă acele combinații
Random search alege aleatoriu puncte din intervalul de căutare al hiperparametrilor și le încearcă. Spre deosebire de grid search, care aranjează candidații într-o grilă și încearcă toate combinațiile, random search nu irosește încercări pe hiperparametri care nu au efect, așa că, la același număr de încercări, poate explora mai fin axele care contează. Rata de învățare, mărimea mini-lotului sau numărul de straturi sunt exemple de valori pe care omul le stabilește dinainte, adică hiperparametri. Oprirea la înrăutățirea erorii de validare este oprirea timpurie, iar dezactivarea aleatorie a unităților la antrenare este dropout — niciuna dintre ele nu este o metodă de căutare.
Î20 | Fenomenul dublei coborâri
Cum se numește fenomenul în care, mărind dimensiunea modelului sau volumul antrenării, eroarea de validare se înrăutățește mai întâi și apoi scade din nou?
Problema exploziei gradientului
Dobândirea invarianței
Fenomenul dublei coborâri
Problema alocării creditului
Răspuns corectC. Fenomenul dublei coborâri
Fenomenul dublei coborâri (double descent) este fenomenul în care, mărind dimensiunea modelului sau volumul antrenării, eroarea de validare se înrăutățește mai întâi, iar la o creștere suplimentară începe din nou să scadă. Numele vine de la faptul că curba erorii coboară de două ori. Contrazice intuiția simplă potrivit căreia un model mai mare tinde tot mai mult spre supra-antrenare și devine mai slab, dar este menționat în programă la metodele de optimizare ca unul dintre cadrele care explică observația recentă că modelele mai mari pot da rezultate mai bune. Problema alocării creditului este cine dintre unități poartă răspunderea pentru eroare, problema exploziei gradientului este divergența gradientului în retropropagare, iar dobândirea invarianței este rolul straturilor de pooling.
Î21 | Stratul convoluțional
În comparație cu un strat complet conectat, care este caracteristica potrivită a stratului convoluțional?
Se leagă de toate unitățile stratului precedent, deci numărul de ponderi crește odată cu mărimea intrării
Refolosește același filtru în poziții diferite, deci extrage caracteristici cu puține ponderi
Reintroduce ca intrare starea din momentul anterior, tratând date secvențiale cu ordine
Nu are deloc ponderi de antrenat și micșorează ieșirea luând o valoare reprezentativă pentru fiecare regiune
Răspuns corectB. Refolosește același filtru în poziții diferite, deci extrage caracteristici cu puține ponderi
Stratul convoluțional extrage caracteristici locale glisând un filtru mic peste intrare și refolosind aceleași ponderi în fiecare poziție. Datorită faptului că fiecare unitate se leagă doar de elementele din vecinătate și că aceleași ponderi sunt refolosite la orice poziție, se poate procesa o imagine cu mult mai puțini parametri decât un strat complet conectat. Ca efect secundar al refolosirii, un obiect poate fi recunoscut ca aceeași caracteristică indiferent de locul unde apare în imagine. Legarea de toate unitățile stratului precedent este specifică stratului complet conectat, lipsa ponderilor de antrenat combinată cu luarea unei valori reprezentative este specifică stratului de pooling, iar reintroducerea stării din momentul anterior este specifică stratului recurent. Rezultatul trecerii unui singur filtru este harta de caracteristici, distanța de deplasare este pasul (stride), iar completarea marginilor este padding-ul.
Î22 | Normalizarea pe loturi
Care este descrierea potrivită pentru normalizarea pe loturi (batch normalization)?
Adaugă la funcția de eroare, ca penalizare, suma pătratelor ponderilor, aliniind ponderile spre valori mici
Dezactivează o proporție fixă de unități la fiecare pas de antrenare, pentru a elimina dependența excesivă
Aliniază, în cadrul unui singur exemplu, valorile întregului strat, fără să depindă de mărimea mini-lotului
Aliniază, în cadrul unui mini-lot, valorile aceluiași canal, la medie 0 și dispersie 1
Răspuns corectD. Aliniază, în cadrul unui mini-lot, valorile aceluiași canal, la medie 0 și dispersie 1
Normalizarea pe loturi este un strat de normalizare care aliniază, în cadrul unui mini-lot, valorile aceluiași canal la medie 0 și dispersie 1, stabilizând și accelerând antrenarea. Punctul ei slab este că, dacă mini-lotul este mic, statisticile devin nesigure. Alinierea valorilor întregului strat în cadrul unui singur exemplu este normalizarea pe straturi (layer normalization), care nu depinde de mărimea mini-lotului și este des folosită la modele pentru secvențe. Mai există normalizarea pe instanță și normalizarea pe grup, iar aceste patru tipuri apar împreună în programă la straturile de normalizare. De notat că, în versiunea 1.1, acest subiect și-a schimbat numele din straturi de regularizare în straturi de normalizare. Regularizarea L2, care penalizează suma pătratelor ponderilor, și dropout, care dezactivează unități, sunt clasificate ca regularizare, nu ca straturi de normalizare.
Î23 | Stratul de pooling
Care este rolul cel mai potrivit al stratului de pooling?
Sare peste straturi și adaugă intrarea la un strat mai îndepărtat, creând o cale prin care poate trece gradientul
Aliniază distribuția ieșirilor straturilor intermediare, pentru a stabiliza și accelera antrenarea
Reduce o regiune la o valoare reprezentativă, făcând modelul robust la mici deplasări de poziție
Comprimă intrarea la o dimensiune mai mică, apoi permite reconstrucția intrării originale
Răspuns corectC. Reduce o regiune la o valoare reprezentativă, făcând modelul robust la mici deplasări de poziție
Stratul de pooling reduce o regiune de dimensiune fixă la o singură valoare reprezentativă; există max pooling, care ia valoarea maximă a regiunii, și average pooling, care ia media. Pe lângă faptul că scade rezoluția și ușurează calculul, valoarea reprezentativă rămâne aproape neschimbată chiar dacă obiectul se deplasează cu câțiva pixeli, deci modelul devine robust la deplasări de poziție. Acest fenomen se numește dobândirea invarianței. Global average pooling (GAP), care reduce o întreagă hartă de caracteristici la o singură valoare prin mediere, poate reduce mult numărul de parametri dacă e folosit în locul unui strat complet conectat final. O altă diferență față de stratul convoluțional este că stratul de pooling nu are ponderi de antrenat. Adăugarea la un strat mai îndepărtat, sărind peste straturi, este conexiunea de tip skip, alinierea distribuției este stratul de normalizare, iar comprimarea urmată de reconstrucție este autoencoder-ul.
Î24 | Conexiunea skip
De ce introducerea conexiunilor de tip skip permite antrenarea unor rețele foarte adânci?
Pentru că se creează o cale care sare peste straturi, iar gradientul ajunge la intrare urmând un drum scurt
Pentru că unitățile se dezactivează aleatoriu, așa că nu se mai depinde de o anumită cale
Pentru că distribuția ieșirii fiecărui strat se aliniază, iar variația valorilor e ținută sub control pe fiecare strat
Pentru că numărul de ponderi scade, deci supra-antrenarea devine mai puțin probabilă chiar cu date limitate
Răspuns corectA. Pentru că se creează o cale care sare peste straturi, iar gradientul ajunge la intrare urmând un drum scurt
Conexiunea skip este o legătură care sare peste câteva straturi și adaugă intrarea, nemodificată, la ieșirea unui strat mai îndepărtat. La retropropagare, gradientul ajunge la intrare nu doar pe drumul lung prin multe straturi, ci și pe drumul scurt al conexiunii skip, așa că, chiar și la o adâncime mare, gradientul nu dispare la fel de ușor. Exemplul clasic care a aplicat această idee și a făcut posibilă o adâncime de peste 100 de straturi este ResNet — în programă, singurul cuvânt-cheie plasat la subiectul conexiunilor skip este ResNet. Dezactivarea aleatorie a unităților este dropout, iar alinierea distribuției fiecărui strat este stratul de normalizare — ambele sunt mecanisme diferite de conexiunea skip. Conexiunea skip nu este nici o metodă de a reduce numărul de ponderi.
Î25 | LSTM și GRU
Care este combinația corectă privind porțile (gates) din LSTM și GRU?
Atât LSTM, cât și GRU, au în comun cele două porți: reset și update
Atât LSTM, cât și GRU, au în comun cele trei porți: input, output și forget
LSTM are trei: input, output și forget, iar GRU are două: reset și update
LSTM are două: reset și update, iar GRU are trei: input, output și forget
Răspuns corectC. LSTM are trei: input, output și forget, iar GRU are două: reset și update
LSTM are o cale de memorie numită CEC, unde se păstrează informația, iar intrarea și ieșirea din aceasta sunt controlate prin trei porți: poarta de intrare (input gate), care decide ce se scrie, poarta de uitare (forget gate), care decide ce se aruncă, și poarta de ieșire (output gate), care decide ce iese în afară. Acest mecanism permite păstrarea unor dependențe pe termen lung și atenuează mult problema dispariției gradientului la rețelele neuronale recurente. GRU este o simplificare a LSTM și are doar două porți: poarta de reset și poarta de update. Are mai puțini parametri și un calcul mai ușor, dar nu este mereu superior lui LSTM ca performanță. Diferența dintre trei porți și două porți, precum și faptul că CEC este un termen specific LSTM, sunt distincții testate frecvent.
Î26 | Rețeaua Jordan
Care este structura potrivită pentru rețeaua Jordan?
Reintroduce ieșirea stratului de ieșire ca intrare a stratului ascuns din momentul următor
Reintroduce ieșirea stratului ascuns ca intrare a stratului ascuns din momentul următor
Reintroduce ieșirea stratului de ieșire ca intrare a stratului de intrare din același moment
Trece direct valoarea stratului de intrare până la stratul de ieșire și o adaugă acolo
Răspuns corectA. Reintroduce ieșirea stratului de ieșire ca intrare a stratului ascuns din momentul următor
Rețeaua Jordan este o rețea neuronală recurentă în care ieșirea stratului de ieșire este reintrodusă ca intrare a stratului ascuns din momentul următor. Prin comparație, rețeaua Elman reintroduce ieșirea stratului ascuns ca intrare a stratului ascuns din momentul următor — diferența dintre ele constă tocmai în ce anume se reintroduce. Ambele sunt structuri pentru a trata date de tip serie temporală păstrând ordinea, iar pentru antrenare se folosește BPTT, care desfășoară rețeaua pe direcția timpului și aplică apoi retropropagarea erorii. Pe secvențe lungi apar puternic atât problema dispariției gradientului, cât și cea a exploziei gradientului, motiv pentru care se folosesc LSTM sau GRU, care au mecanisme de porți. Adăugarea prin sărirea peste straturi este conexiunea skip, care nu privește direcția temporală.
Î27 | Attention
Care este descrierea potrivită pentru Source-Target Attention?
Este un mecanism care calculează gradul de asociere între elementele din aceeași secvență
Este un mecanism care calculează gradul de asociere între două secvențe distincte
Este un mecanism care rulează în paralel mai multe moduri de atenție și combină rezultatele
Este un mecanism care adaugă un semnal specific fiecărei poziții, oferind informația despre ordinea cuvintelor
Răspuns corectB. Este un mecanism care calculează gradul de asociere între două secvențe distincte
Attention este un mecanism care calculează, sub formă de ponderi, unde anume din intrare trebuie acordată atenție, fiind exprimat prin trei componente: query, key și value. Dintre acestea, Source-Target Attention calculează gradul de asociere între două secvențe distincte, în situații precum traducerea, unde secvența de intrare și cea de ieșire sunt separate. Calcularea relației dintre elementele din aceeași secvență este Self-Attention, componenta centrală a Transformer-ului. Adăugarea unui semnal specific fiecărei poziții pentru a oferi ordinea cuvintelor este positional encoding (codificarea poziției), iar rularea în paralel a mai multor moduri de atenție și combinarea rezultatelor este Multi-Head Attention — sunt componente diferite ale Transformer-ului.
Î28 | Codificarea poziției
Care este descrierea potrivită pentru Transformer?
Un model care comprimă intrarea la o dimensiune mai mică și învață să reconstruiască din aceasta intrarea originală
Un model care suprapune alternativ convoluție și pooling, adunând treptat caracteristici locale
Un model construit din Attention, fără conexiuni recurente, care oferă ordinea cuvintelor prin codificarea poziției
Un model cu structură formată din conexiuni recurente suprapuse, care transmite în ordine starea din momentul anterior
Răspuns corectC. Un model construit din Attention, fără conexiuni recurente, care oferă ordinea cuvintelor prin codificarea poziției
Transformer este un model pentru secvențe construit în jurul lui Attention, fără conexiuni recurente. Deoarece nu trebuie să aștepte calculul din momentul anterior, poate procesa întreaga secvență în paralel și poate surprinde direct, într-un singur calcul, relația dintre cuvinte îndepărtate. Totuși, procesarea în paralel pierde informația despre ordinea cuvintelor, așa că se folosește codificarea poziției (positional encoding), care adaugă un semnal specific fiecărei poziții, pentru a oferi ordinea. Un punct-capcană este că Transformer nu este un tip de rețea neuronală recurentă. Suprapunerea conexiunilor recurente care transmit starea din momentul anterior este RNN, suprapunerea convoluției și a pooling-ului este CNN, iar comprimarea urmată de reconstrucție este autoencoder-ul.
Î29 | VAE
În ce anume diferă autoencoder-ul variațional (VAE) de un autoencoder obișnuit?
Comprimă intrarea la o dimensiune mai mică, apoi reconstruiește intrarea originală
Învață reprezentarea comprimată ca o distribuție de probabilitate, nu ca un singur punct, putând genera date noi
Permite antrenarea fără a fi nevoie de etichete corecte
Antrenează straturile pe rând, unul câte unul, pentru a construi valorile inițiale ale unei rețele adânci
Răspuns corectB. Învață reprezentarea comprimată ca o distribuție de probabilitate, nu ca un singur punct, putând genera date noi
Autoencoder-ul variațional (VAE) învață reprezentarea comprimată nu ca un singur punct, ci ca o distribuție de probabilitate. Extrăgând valori din acea distribuție și reconstruind, se pot genera date noi, absente din setul de antrenare, motiv pentru care este tratat ca model generativ. Comprimarea la o dimensiune mai mică urmată de reconstrucție, precum și posibilitatea de a antrena fără etichete corecte, sunt proprietăți comune și autoencoder-ului obișnuit, nu ceva specific doar VAE-ului. Antrenarea straturilor pe rând pentru a construi valorile inițiale ale unei rețele adânci este pre-antrenarea prin autoencoder stivuit (stacked autoencoder). Programa mai menționează, la același subiect, VQ-VAE, info VAE și β-VAE.
Î30 | Mixup
Dintre metodele de augmentare a datelor pentru imagini, ce operație face Mixup?
Decupează o parte din imagine și o mărește, creând un nou exemplu
Suprapune două imagini, creând un singur exemplu nou
Oglindește imaginea pe orizontală, creând un exemplu cu orientare diferită
Colorează în negru o porțiune pătrată din imagine, ascunzând informația din acea zonă
Răspuns corectB. Suprapune două imagini, creând un singur exemplu nou
Mixup suprapune două imagini într-o anumită proporție și amestecă în aceeași proporție și etichetele corecte, creând astfel date noi de antrenare. CutMix, care are un nume asemănător, nu suprapune imaginile, ci decupează și lipește porțiuni din cele două imagini pentru a forma una singură. Colorarea în negru a unei porțiuni pătrate este Cutout sau Random Erasing, oglindirea pe orizontală este Random Flip, iar decuparea unei porțiuni este Crop. Mai există și rotirea (Rotate), schimbarea luminozității (Brightness), schimbarea contrastului (Contrast) și RandAugment, care stabilește automat ce transformări și în ce măsură se aplică; pentru text sunt menționate paraphrasing și noising. În toate cazurile este important să nu se aleagă transformări care distrug sensul.
Î31 | GoogLeNet
Care este caracteristica potrivită a rețelei GoogLeNet?
A folosit modulul Inception, care aplică în paralel filtre de dimensiuni diferite
A câștigat ILSVRC 2012, folosind funcția ReLU și antrenare pe GPU
A introdus conexiuni skip peste straturi, obținând o adâncime de peste 100 de straturi
A suprapus doar convoluții mici de 3 pe 3, obținând o structură adâncă
Răspuns corectA. A folosit modulul Inception, care aplică în paralel filtre de dimensiuni diferite
GoogLeNet a folosit modulul Inception, care aplică în paralel filtre de dimensiuni diferite și combină rezultatele, obținând o structură adâncă cu un număr relativ redus de parametri. Suprapunerea doar a unor convoluții mici de 3 pe 3, într-o structură simplă și adâncă, este specifică VGG, care s-a clasat printre primele la ILSVRC 2014, alături de GoogLeNet. Introducerea conexiunilor skip peste straturi, care a făcut posibilă o adâncime de peste 100 de straturi, este specifică ResNet, iar rețeaua care a câștigat ILSVRC 2012 combinând ReLU, dropout și antrenare pe GPU este AlexNet. Ulterior, evoluția a continuat spre Wide ResNet, DenseNet, SENet, EfficientNet, MobileNet și altele, iar programa include și Vision Transformer, care aplică ideea Transformer fără convoluții.
Î32 | Detecție într-un stagiu
Care este caracteristica comună pentru YOLO și SSD?
Detectează obiectele într-un proces în două etape: mai întâi propune regiuni, apoi clasifică
Atribuie o clasă fiecărui pixel, colorând regiunile imaginii pe categorii
Extrage regiunile candidate și le clasifică într-o singură trecere de inferență, punând accent pe viteză
Are ca obiectiv estimarea poziției articulațiilor corpului uman, pentru a determina postura
Răspuns corectC. Extrage regiunile candidate și le clasifică într-o singură trecere de inferență, punând accent pe viteză
YOLO și SSD sunt modele de detecție a obiectelor într-un singur stagiu, care extrag regiunile candidate și le clasifică într-o singură trecere de inferență, avantajul lor fiind viteza. În schimb, familia care începe cu R-CNN și evoluează spre Fast R-CNN și Faster R-CNN folosește o metodă în două etape — mai întâi propune regiuni, apoi clasifică — mai lentă, dar de obicei mai precisă. Atribuirea unei clase fiecărui pixel este segmentarea semantică, cu exemple reprezentative precum FCN, SegNet, U-Net, PSPNet și DeepLab. Segmentarea de instanțe, care distinge și obiectele individuale din aceeași clasă, este realizată de Mask R-CNN, iar estimarea posturii, prin poziția articulațiilor corpului uman, este reprezentată de OpenPose.
Î33 | BERT
Care este descrierea potrivită pentru BERT?
Corelează imaginea și textul descriptiv în același spațiu vectorial, legându-le între ele
Parcurge invers procesul de adăugare a zgomotului, generând treptat datele
Folosește encoderul Transformer-ului și privește contextul din ambele direcții, înainte și înapoi
Suprapune straturi recurente și citește cuvintele unul câte unul, în ordine, pentru a construi contextul
Răspuns corectC. Folosește encoderul Transformer-ului și privește contextul din ambele direcții, înainte și înapoi
BERT este un model de limbaj bazat pe encoderul Transformer-ului, caracteristica sa fiind pre-antrenarea care privește contextul din ambele direcții ale propoziției, înainte și înapoi. A popularizat abordarea de pre-antrenare pe cantități mari de text, urmată de adaptarea la sarcini specifice. Suprapunerea straturilor recurente pentru a citi cuvintele în ordine este specifică modelelor bazate pe rețele neuronale recurente; Transformer nu are conexiuni recurente. Corelarea imaginii și textului în același spațiu vectorial este specifică CLIP, plasat în programă la subiectul multimodal. Parcurgerea inversă a procesului de adăugare a zgomotului pentru generare este specifică Diffusion Model, aflat la subiectul generării de date.
Î34 | CBOW
În ce direcție învață CBOW-ul din word2vec?
Învață să prezică, pornind de la cuvintele din jur, cuvântul central
Învață să prezică, pornind de la cuvântul central, cuvintele care apar în jurul lui
Învață să prezică, pornind de la întreaga propoziție, dacă aceasta este pozitivă sau negativă
Învață să prezică, pornind de la prima jumătate a textului, dacă urmează a doua jumătate
Răspuns corectA. Învață să prezică, pornind de la cuvintele din jur, cuvântul central
CBOW învață să prezică cuvântul central pornind de la cuvintele care apar în jurul lui. Invers, metoda care învață să prezică cuvintele din jur pornind de la cuvântul central este skip-gram — direcțiile fiind opuse, se confundă ușor. Ambele sunt metode word2vec, iar scopul lor este obținerea unei reprezentări distribuite, care exprimă cuvintele prin vectori denși. Spre deosebire de vectorul one-hot, care alocă o dimensiune fiecărui cuvânt — dimensiune egală cu mărimea vocabularului și incapabilă să exprime apropierea dintre cuvinte — reprezentarea distribuită plasează cuvintele apropiate ca sens aproape unele de altele în spațiul vectorial. Prezicerea dacă o propoziție este pozitivă sau negativă este o sarcină aplicată numită analiza sentimentului, nu o metodă de învățare a reprezentării cuvintelor.
Î35 | RLHF
Ce metodă construiește un model de recompensă pe baza feedback-ului uman și ajustează modelul prin învățare prin întărire?
DQN
A3C
PPO
RLHF
Răspuns corectD. RLHF
RLHF construiește un model de recompensă din evaluările de preferință date de oameni, iar apoi ajustează modelul prin învățare prin întărire, folosind acel model ca recompensă. Este cunoscută pentru ajustarea modelelor de limbaj, dar, surprinzător, în programă este plasată nu la procesarea limbajului natural, ci la subiectul învățării prin întărire profundă — merită reținut, deoarece poate fi util. DQN este metoda reprezentativă de învățare prin întărire profundă, care aproximează funcția valoare-acțiune cu o rețea neuronală; PPO este o metodă de învățare a politicii care limitează pasul de actualizare pentru stabilitate; A3C este o metodă care rulează mai multe medii în paralel pentru a accelera antrenarea. La același subiect apar și Double DQN, Dueling Network, Rainbow, APE-X și Agent57.
Î36 | Diffusion
Care este descrierea potrivită pentru Diffusion Model?
Învață aspectul tridimensional din fotografii făcute din mai multe unghiuri și creează imagini din unghiuri noi
Învață reprezentarea comprimată ca distribuție de probabilitate și reconstruiește extrăgând din aceasta
Generează date suficient de realiste punând două rețele să concureze
Parcurge invers procesul de adăugare treptată a zgomotului, generând date
Răspuns corectD. Parcurge invers procesul de adăugare treptată a zgomotului, generând date
Diffusion Model este un model generativ care creează date pornind de la zgomot, parcurgând invers procesul prin care se adaugă treptat zgomot datelor. Mecanismul este complet diferit de rețelele adversariale generative (GAN), care antrenează punând două rețele să concureze — Diffusion Model nu este un tip de GAN. Din GAN derivă DCGAN, CycleGAN și Pix2Pix. Învățarea aspectului tridimensional din fotografii făcute din mai multe unghiuri este specifică NeRF, iar învățarea reprezentării comprimate ca distribuție de probabilitate este specifică autoencoder-ului variațional (VAE). GAN, VAE și Diffusion Model trebuie înțelese ca familii distincte, aflate în paralel.
Î37 | Transfer learning
Care este diferența potrivită dintre transfer learning și fine-tuning?
Transfer learning reantrenează toate ponderile, iar fine-tuning antrenează doar stratul de ieșire
Atât transfer learning, cât și fine-tuning învață ponderile de la zero, fără pre-antrenare
Transfer learning antrenează în principal zona din apropierea stratului de ieșire, iar fine-tuning reantrenează o zonă largă
Transfer learning se poate folosi doar pentru imagini, iar fine-tuning doar pentru limbaj
Răspuns corectC. Transfer learning antrenează în principal zona din apropierea stratului de ieșire, iar fine-tuning reantrenează o zonă largă
Transfer learning este metoda care păstrează fixă partea de extragere a caracteristicilor dintr-un model pre-antrenat și antrenează pe o sarcină nouă în principal doar zona din apropierea stratului de ieșire. Fine-tuning reantrenează, pe date noi, toate ponderile sau o zonă largă a acestora — necesită mai multe date și calcul, dar tinde să funcționeze mai bine atunci când domeniul țintă diferă mult de datele de pre-antrenare. La fine-tuning poate apărea uitarea catastrofală, în care se pierde capacitatea pe care o avea modelul original. Ambele metode presupun un model pre-antrenat ca punct de plecare; niciuna nu antrenează de la zero. Alegerea dintre ele nu depinde de tipul de date tratat.
Î38 | Modelul fundamental
La ce subiect din programă este plasat termenul model fundamental (foundation model)?
La transfer learning și fine-tuning, alături de Few-shot
La subiectul multimodal, alături de CLIP și DALL-E
La învățarea prin întărire profundă, alături de DQN și RLHF
La procesarea limbajului natural, alături de modelul de limbaj de mari dimensiuni (LLM)
Răspuns corectB. La subiectul multimodal, alături de CLIP și DALL-E
Modelul fundamental (foundation model) desemnează un model de mari dimensiuni, pre-antrenat pe cantități mari de date, care poate fi reutilizat pentru sarcini derivate diverse; în programă este plasat la subiectul 32, multimodal, alături de CLIP, DALL-E, Flamingo, Unified-IO și Zero-shot. Termenii legați de AI generativ sunt răspândiți în mai multe locuri: modelul de limbaj de mari dimensiuni (LLM) este la subiectul 27, procesarea limbajului natural, iar RLHF la subiectul 29, învățarea prin întărire profundă. La subiectul 31, transfer learning și fine-tuning, apar Few-shot, One-shot, învățarea auto-supravegheată, modelul pre-antrenat și uitarea catastrofală. Reținerea locului fiecărui termen în programă ajută la înțelegerea de ansamblu a materiei.
Î39 | SHAP
Care este ideea metodei SHAP, din domeniul AI explicabil (XAI)?
Schimbă intenționat valorile caracteristicilor și măsoară importanța lor prin cât scade acuratețea
Arată, sub forma unei hărți termice, la ce a privit modelul pentru a lua decizia din imagine
Aplică un model simplu în vecinătatea unei predicții și explică folosind coeficienții acelui model
Folosind ideea teoriei jocurilor cooperative, distribuie și arată contribuția fiecărei caracteristici
Răspuns corectD. Folosind ideea teoriei jocurilor cooperative, distribuie și arată contribuția fiecărei caracteristici
SHAP este o metodă care, împrumutând ideea teoriei jocurilor cooperative, distribuie în mod echitabil și arată contribuția fiecărei caracteristici la o predicție. Arătarea, sub formă de hartă termică, a zonei din imagine la care a privit modelul este specifică CAM și Grad-CAM; schimbarea intenționată a valorilor caracteristicilor pentru a măsura importanța prin scăderea acurateței este Permutation Importance; iar aplicarea unui model simplu în vecinătatea unei predicții individuale și explicarea prin coeficienții acelui model este LIME. Toate acestea sunt incluse în programă la subiectul 33, interpretabilitatea modelului, iar ansamblul eforturilor de a face rațiunea deciziei înțeleasă de om se numește AI explicabil (XAI).
Î40 | Ipoteza biletului câștigător
Ce afirmă ipoteza biletului câștigător (lottery ticket hypothesis), legată de reducerea dimensiunii unui model?
Ideea că, dacă un model-elev mic învață ieșirile unui model-profesor mare, performanța poate fi păstrată
Ideea că, în interiorul unei rețele mari, există o subrețea care, antrenată singură, ajunge la performanță comparabilă
Ideea că necesarul de date de antrenare crește exponențial pe măsură ce modelul devine mai mare
Ideea că, chiar dacă se reduce precizia numerelor care reprezintă ponderile, scăderea acurateței este foarte mică
Răspuns corectB. Ideea că, în interiorul unei rețele mari, există o subrețea care, antrenată singură, ajunge la performanță comparabilă
Ipoteza biletului câștigător afirmă că, în interiorul unei rețele mari, se află o subrețea câștigătoare care, extrasă și antrenată separat, ajunge la o performanță comparabilă cu întregul. Este menționată ca fundal pentru a explica de ce funcționează pruning-ul, care elimină conexiunile sau straturile cu contribuție mică. Faptul ca un model-elev mic să învețe ieșirile unui model-profesor mare este distilarea, iar reducerea preciziei numerelor care reprezintă ponderile este cuantizarea; împreună cu pruning-ul, acestea trei formează metodele de reducere a dimensiunii din programă, numite în ansamblu compresia modelului. Creșterea bruscă a necesarului de date este blestemul dimensionalității. Un exemplu tipic în care reducerea dimensiunii este necesară este AI-ul de tip edge, care rulează inferența pe dispozitiv.
Exersare: rezolvați întrebările de pe această pagină
Acesta este un instrument de exersare cu întrebări în ordine aleatorie (funcționează când JavaScript este activat). Puteți citi oricum toate întrebările și explicațiile de mai sus.
* Explicațiile sunt informații în scop de studiu. Tematica și sistemul examenelor se schimbă de la an la an, așa că verificați întotdeauna anunțurile oficiale ale organizatorului examenului.
Această pagină este o traducere a textului original în japoneză. Dacă traducerea diferă de original, prevalează versiunea în japoneză. Vedeți originalul în japoneză