證照 · Cloud / AI / Python 合格實驗室
深度學習的方法與應用
可以用繁體中文閱讀題目與解說。講義(解說文章)僅有日文版。
查看日文版(含講義) →
第1題 | 簡單感知器
關於簡單感知器,下列敘述何者正確?
- 只由輸入層與輸出層構成,只能解出線性可分的問題
- 擅長讓濾波器在圖像上滑動,藉此取出局部特徵
- 具有把狀態沿時間方向送回的連線,能依原本順序處理序列資料
- 擁有多個隱藏層,能進行非線性分離,因此也能表示互斥或
正確答案
A. 只由輸入層與輸出層構成,只能解出線性可分的問題簡單感知器是只由輸入層與輸出層構成、最單純的神經網路,只能解出能用一條直線分開的線性可分問題。互斥或(XOR)的情況是輸出為1的點與為0的點在對角線上交錯排列,不論直線畫在哪裡都無法分開,因此簡單感知器無法表示它。加入隱藏層、使邊界能彎曲的多層感知器則能表示XOR,第1個選項其實是多層感知器的說明。把前一時刻的狀態送回以處理序列的是循環神經網路,讓濾波器滑動以取出局部特徵的則是卷積層的說明。
第2題 | GPU的適性
關於GPU被認為適合深度學習訓練的理由,下列何者最恰當?
- 用來儲存訓練資料的記憶體容量,遠比CPU大得多
- 把誤差反向傳播法所用的連鎖律,一開始就內建為專用電路
- 以少數強大的核心,依序高速處理分支眾多的複雜處理
- 擁有大量小型運算核心,能同時平行處理相同的計算
正確答案
D. 擁有大量小型運算核心,能同時平行處理相同的計算深度學習的訓練,是把矩陣與向量的乘法及加法重複進行龐大次數的計算。GPU擁有大量進行單純運算的小型核心,適合同時平行執行相同的計算,因此與這種形式的計算相性良好。以少數強大核心依序高速處理分支眾多的處理,是CPU的擅長領域,其核心數量並不多。GPU的優點不在於記憶體容量的大小,而在於平行程度。並沒有把連鎖律內建為專用電路這回事,而專為深度學習的張量運算而設計的,其實是TPU。
第3題 | 梯度消失的原因
在隱藏層使用Sigmoid函數,為何容易招致梯度消失問題?
- 由於輸出侷限在0到1的範圍,層數一多,輸出本身就會趨近於0
- 由於輸出的總和被正規化為1,數值會隨層數增加而變小
- 由於微分的最大值是0.25,每往回追溯一層就會被重複相乘
- 對於負值輸入,輸出恆為0,導致該單元不再學習
正確答案
C. 由於微分的最大值是0.25,每往回追溯一層就會被重複相乘梯度消失問題是指,在反向傳播的過程中梯度趨近於0,導致靠輸入端的層無法學習的現象。Sigmoid函數的微分最大值只有0.25,因此每往回追溯一層,就會被乘上0.25以下的數值,在較深的網路中,梯度幾乎所剩無幾。造成問題的並非輸出值本身,而是其微分的大小。對負值輸入梯度變為0而使學習停止,是ReLU函數的弱點,Leaky ReLU函數就是針對這一點的對策。使輸出總和為1而加以正規化的則是Softmax函數。
第4題 | ReLU函數
關於ReLU函數的說明,下列何者恰當?
- 將輸入壓縮在0到1之間、描繪出S形曲線的函數
- 為使輸出總和為1,將所有輸出一併正規化的函數
- 將輸入收斂在-1到1之間、對原點呈對稱形狀的函數
- 輸入為正時原樣返回該值,輸入為負時返回0的函數
正確答案
D. 輸入為正時原樣返回該值,輸入為負時返回0的函數ReLU函數是輸入為正時原樣返回該值、為負時返回0的簡單函數。在正值區域,微分恆為1,因此即使往回追溯多層,梯度也不會變小,能大幅緩解梯度消失問題。不過在負值區域微分為0,一旦某單元進入負值一側就可能不再學習,因此才準備了在負值一側帶有微小斜率的Leaky ReLU函數。壓縮在0到1之間呈S形的是Sigmoid函數,收斂在-1到1且對原點對稱的是tanh函數,使輸出總和為1而正規化的則是Softmax函數的說明。
第5題 | Leaky ReLU
準備Leaky ReLU函數,是為了因應ReLU函數的哪個問題?
- 輸出總和不會變成1,因此無法解讀為機率
- 對負值輸入時梯度變為0,導致該單元不再學習
- 計算中包含指數函數,導致每次處理的負擔加重
- 對正值輸入時梯度仍維持1,導致更新量過大
正確答案
B. 對負值輸入時梯度變為0,導致該單元不再學習ReLU函數在負值區域的輸出與微分都是0,因此若某單元的輸入一直維持負值,梯度就無法流動,該單元將永遠不再學習。Leaky ReLU函數在負值一側也帶有微小斜率,藉此避免這種死路。正值區域梯度為1,是ReLU函數的優點而非缺點,正是這個性質防止了梯度消失。輸出總和不為1,對啟動函數而言本屬理所當然,若想讓輸出層解讀為機率,會使用Softmax函數。計算中包含指數函數的是Sigmoid函數與tanh函數,ReLU函數的計算反而較輕量。
第6題 | Softmax
Softmax函數的代表性使用場合是哪一項?
- 放在迴歸問題的輸出層,直接輸出連續值
- 作為隱藏層的啟動函數使用,賦予該層非線性
- 放在二元分類的輸出層,輸出其中一個類別的機率
- 放在多類別分類的輸出層,輸出各類別的機率
正確答案
D. 放在多類別分類的輸出層,輸出各類別的機率Softmax函數會將整體正規化,使輸出總和恰好為1,因此適合放在有3個以上類別的多類別分類輸出層,讓輸出被解讀為屬於各類別的機率。基本做法是搭配交叉熵作為誤差函數。放在二元分類輸出層以輸出機率的是Sigmoid函數,廣泛用作隱藏層啟動函數的則是ReLU函數與tanh函數。迴歸問題則在輸出層直接輸出數值,誤差函數使用均方誤差函數。
第7題 | 迴歸的誤差函數
在預測像房價這類連續值的迴歸問題中,基本上應選為誤差函數的是下列何者?
- 測量預測機率分布與正解分布差異的交叉熵
- 讓模型學習3組資料之間距離關係的Triplet Loss
- 以距離讓模型學習是否為同一物的Contrastive Loss
- 把預測與正解的差取平方後再平均的均方誤差函數
正確答案
D. 把預測與正解的差取平方後再平均的均方誤差函數迴歸是預測連續值的問題,因此把預測與正解的差直接取平方後平均的均方誤差函數,是自然的選擇。交叉熵是測量機率分布之間差異的函數,用於分類問題,若是多類別分類,基本上會搭配輸出層的Softmax函數一起使用。Triplet Loss讓模型學習基準、正例、負例3組之間的距離關係,Contrastive Loss則以距離讓模型學習兩筆資料是否為同一物,這兩者都是為了取得能表示相似與否之表徵所使用的誤差函數。依任務選擇誤差函數,正是這個中項目的目標。
第8題 | 3組的誤差
關於誤差函數Triplet Loss的說明,下列何者恰當?
- 把預測與正解的差取平方後平均,直接測量數值大小的差距
- 測量預測機率分布與正解分布的差距,廣泛用於分類的學習
- 使用基準、正例、負例的3組資料,使正例比負例更靠近基準
- 測量2個機率分布之間的差距,使分布彼此靠近
正確答案
C. 使用基準、正例、負例的3組資料,使正例比負例更靠近基準Triplet Loss使用基準資料、與其同類的資料(正例)、以及不同類的資料(負例)這3組,讓模型學習使基準與正例之間的距離小於基準與負例之間的距離的誤差函數。用於建構以距離表示相似與否的空間時。測量2個機率分布差距的是KL散度(Kullback-Leibler divergence),把預測與正解的差取平方後平均的是均方誤差函數,測量機率分布差距並廣泛用於分類的則是交叉熵。順帶一提,讓模型以2筆資料組別學習是否相同的Contrastive Loss,也收錄在同一個中項目中。
第9題 | 誤差反向傳播法
關於誤差反向傳播法的說明,下列何者最恰當?
- 從輸出層開始依序直接改寫權重,是更新本身的步驟
- 以隨機數小幅移動權重,採用誤差減少的方向的步驟
- 從輸入端往輸出端依序推進計算,用來求出輸出的步驟
- 使用連鎖律,從輸出端往輸入端回溯以求出梯度的步驟
正確答案
D. 使用連鎖律,從輸出端往輸入端回溯以求出梯度的步驟誤差反向傳播法是使用連鎖律──把合成函數的微分分解為各部分微分之乘積──從輸出端往輸入端回溯,有效率地求出各權重梯度的手法。這裡求出的終究只是梯度,實際利用該梯度移動權重的,則是梯度下降法的職責。若斷言誤差反向傳播法本身就是更新權重,就不夠準確,這一點要留意。以隨機數移動並採用較佳方向,屬於不使用梯度的搜尋想法;從輸入端往輸出端推進計算,則是正向傳播,也就是推論的步驟。
第10題 | 信用分配問題
把最終的誤差,分配給哪一層的哪個單元該負多少責任,這樣的問題稱為什麼?
- 信用分配問題
- 梯度爆炸問題
- 梯度消失問題
- 維度的詛咒
正確答案
A. 信用分配問題信用分配問題是指,應將輸出所呈現的誤差責任,歸屬於中途哪一層的哪個單元、歸屬多少的問題。誤差反向傳播法被定位為透過連鎖律使這種分配得以計算。梯度消失問題是指在回溯過程中梯度趨近於0、導致靠輸入端的層無法學習的現象,梯度爆炸問題則相反,是梯度變得過大而發散的現象,這兩者都是套用誤差反向傳播法時會產生的問題。維度的詛咒是指特徵量的維度越增加、所需資料量就急遽增加的現象,課綱中將它列在機器學習的中項目裡。
第11題 | L1正則化
L1正則化的特徵,下列何者恰當?
- 以權重的平方和作為懲罰,使數值統一縮小,但不容易變成0
- 以權重絕對值的和作為懲罰,數值容易恰好變成0
- 每次學習時隨機停用單元,防止依賴上的偏差
- 在驗證資料誤差開始惡化的時間點,直接中止學習本身
正確答案
B. 以權重絕對值的和作為懲罰,數值容易恰好變成0L1正則化是把權重絕對值的和作為懲罰加進誤差函數的正則化方式,容易把權重壓到恰好為0的地步。結果使未被使用的特徵係數變為0而自動被剔除,產生特徵選擇的效果。這種狀態稱為稀疏。以權重平方和作為懲罰的是L2正則化,雖能使數值統一縮小,但不容易變成0。學習時隨機停用單元的是Dropout,依驗證誤差惡化來中止學習的是提前停止,兩者都是應對過度擬合的做法,但機制不同。
第12題 | 嶺迴歸
嶺迴歸(Ridge)所採用的正則化是哪一項?
- 以非零權重的個數作為懲罰的L0正則化
- 把權重的平方和加為懲罰的L2正則化
- 以權重絕對值的和作為懲罰的L1正則化
- 學習時隨機停用單元的Dropout
正確答案
B. 把權重的平方和加為懲罰的L2正則化嶺迴歸是把L2正則化與線性迴歸結合的手法。由於把權重平方和作為懲罰加入,係數整體會被壓得較小,能防止過度擬合。把L1正則化與線性迴歸結合的則是LASSO迴歸,這種方式的係數容易恰好變成0,得到稀疏解。L1與LASSO、L2與嶺迴歸的對應容易搞混,務必成組記憶。L0正則化是把非零權重的個數本身當作懲罰的想法,由於個數無法微分,難以納入使用梯度的學習中。Dropout則是針對神經網路的正則化手法。
第13題 | Dropout
關於Dropout的說明,下列何者恰當?
- 把圖像左右翻轉或裁切,藉此增補訓練資料本身
- 學習時以一定比例隨機停用單元,藉此抑制過度擬合
- 在驗證資料誤差開始上升的時間點中止學習,藉此防止過度擬合
- 在小批次中把中間層輸出調整為平均0、變異數1,使學習穩定
正確答案
B. 學習時以一定比例隨機停用單元,藉此抑制過度擬合Dropout是每次學習時以一定比例隨機停用隱藏層單元的手法。由於每次都以稍微不同形狀的網路學習,就無法只依賴特定單元組合來記憶,能得到類似於平均多個模型的效果。停用只發生在學習時,推論時會使用所有單元。雖然名稱相似,但課綱中Dropout被歸類在第14項的正則化,而不是第19項的正規化層。在小批次中調整分布的是批次正規化,增補資料的是資料增強,因誤差惡化而中止學習的則是提前停止。
第14題 | 小批次學習
關於小批次學習的說明,下列何者恰當?
- 不更新權重,持續使用事先決定好之數值的進行方式
- 以整個訓練資料求梯度,只更新一次權重的進行方式
- 以數十到數百筆為一個群組,逐組更新權重的進行方式
- 每使用1筆訓練資料,就更新一次權重的進行方式
正確答案
C. 以數十到數百筆為一個群組,逐組更新權重的進行方式小批次學習是把訓練資料分成數十到數百筆一組,依組求梯度並更新權重的進行方式。它比每筆更新一次的線上學習較不容易造成單次梯度的波動,也比用全部資料只更新一次的批次學習計算負擔輕,因此具有介於兩者之間的性質,在實務上佔絕大多數。隨機梯度下降法(SGD)只用部分資料求梯度,因此那份波動反而有助於跳脫鞍點或較淺的局部最佳解。不更新權重並非學習,只是單純的推論。
第15題 | Epoch
Epoch與迭代(iteration)的關係,下列何者恰當?
- Epoch指小批次的大小,迭代指學習率的大小
- Epoch指跑完一輪資料,迭代指更新一次權重
- Epoch指更新一次權重,迭代指跑完一輪資料
- Epoch與迭代都是指跑完一輪資料
正確答案
B. Epoch指跑完一輪資料,迭代指更新一次權重Epoch是指把整個訓練資料跑過一輪,迭代則是指更新一次權重。兩者透過小批次的大小相連結,每個Epoch的迭代數等於資料件數除以小批次大小。例如以大小50跑3000筆資料,1個Epoch就是60次迭代。加大小批次大小會使單次梯度較穩定,但每個Epoch的更新次數會減少;縮小則更新次數增加,但波動也會變大。小批次大小與學習率都是人事先決定的超參數,與Epoch或迭代是不同的概念。
第16題 | 鞍點
關於鞍點的說明,下列何者恰當?
- 從某個方向看是極小值,從另一個方向看是極大值的點
- 在鄰近範圍內誤差最小,但整體還有更好的點
- 誤差在整個範圍內恆定不變、任何方向都沒有斜率的區域
- 在可取值的整個範圍內,誤差最小的點
正確答案
A. 從某個方向看是極小值,從另一個方向看是極大值的點鞍點是從某個方向看是谷底、從另一個方向看卻是山頂的點,因形狀類似馬鞍而得名。在參數數量非常多的深度學習中,比起在所有方向同時都是谷底的局部最佳解,被困在鞍點動彈不得的情況被認為更容易發生。整個範圍內誤差最小的點是全域最佳解,只在鄰近範圍內最小的點是局部最佳解。隨機梯度下降法(SGD)因梯度帶有波動,較容易脫離這類停滯狀態。
第17題 | Adam
Adam是結合了哪些想法的最佳化方法?
- 結合了權重絕對值的和與平方和這2種懲罰
- 結合了利用慣性的工夫,以及調適學習率的工夫
- 交替切換批次學習與線上學習這2種進行方式
- 結合了網格搜尋與隨機搜尋這2種搜尋方式
正確答案
B. 結合了利用慣性的工夫,以及調適學習率的工夫Adam結合了把上一次更新量作為慣性加入的動量(Momentum)想法,以及依參數自動調整學習率的RMSprop想法,是實務上常作為預設值使用的最佳化方法。調適學習率這一系列從AdaGrad開始,AdaGrad雖然對更新量較大的參數降低學習率,卻會持續降低下去,因此RMSprop以指數移動平均緩和了這一點。同系列還有AdaDelta、AdaBound、AMSBound。權重的懲罰屬於正則化的話題,網格搜尋與隨機搜尋屬於超參數搜尋的話題,都不是更新規則本身。
第18題 | 沒有免費午餐
沒有免費午餐定理所陳述的內容是哪一項?
- 在所有問題上都優於其他方法的萬能演算法並不存在
- 特徵量的維度越增加,所需的訓練資料就急遽增加
- 只要持續降低學習率,就一定能到達全域最佳解
- 模型加大後,誤差會先惡化一次,之後又再度下降
正確答案
A. 在所有問題上都優於其他方法的萬能演算法並不存在沒有免費午餐定理主張,若對所有可設想的問題取平均,並不存在優於其他所有方法的萬能演算法。因此方法的選擇只能依問題個別考量,並不存在「隨時都用這個就好」的答案。模型加大後誤差先惡化一次、之後又再度下降的是雙重下降現象,這也收錄在同一個中項目中。特徵量維度越增加、所需資料越急遽增加的是維度的詛咒。持續降低學習率並不保證一定能到達全域最佳解,仍可能停在局部最佳解或鞍點。
第19題 | 隨機搜尋
關於超參數搜尋方法之一的隨機搜尋,下列說明何者恰當?
- 把候選值排成格狀,依序嘗試所有組合
- 每次學習時隨機停用單元,取得平均性的行為
- 在驗證資料誤差開始惡化的時間點,直接中止學習本身
- 從搜尋範圍中隨機選點,嘗試該組合
正確答案
D. 從搜尋範圍中隨機選點,嘗試該組合隨機搜尋是從超參數的搜尋範圍中隨機選點來嘗試的方法。與把候選排成格狀逐一嘗試的網格搜尋不同,它不容易把嘗試浪費在沒有影響的超參數上,即使嘗試次數相同,也能更細緻地探索有影響的軸向。像學習率、小批次大小、層數這類人事先決定的值,就是超參數。依驗證誤差惡化中止學習的是提前停止,學習時隨機停用單元的是Dropout,兩者都不是搜尋方法。
第20題 | 雙重下降現象
隨著模型大小或學習量增加,驗證誤差先惡化一次、之後又再度下降的現象稱為什麼?
- 梯度爆炸問題
- 不變性的獲得
- 雙重下降現象
- 信用分配問題
正確答案
C. 雙重下降現象雙重下降現象是指,隨著模型大小或學習量增加,驗證誤差先惡化一次,之後若繼續增加,又會再度開始下降的現象。因誤差曲線出現2次下降而得名。這與「模型越大越容易過度擬合而變差」的樸素直覺相反,作為解釋「大模型有時能得到更好結果」這種近年經驗的框架之一,被收錄在課綱的最佳化方法中。信用分配問題是誤差責任該歸於哪個單元的問題,梯度爆炸問題是反向傳播中梯度發散的問題,不變性的獲得則是池化層的作用。
第21題 | 卷積層
與全連接層相比,卷積層的特徵,下列何者恰當?
- 與前一層所有單元相連,輸入越大權重就越多
- 重複使用同一個濾波器並改變位置,以少量權重取出特徵
- 把前一時刻的狀態送回輸入,藉此處理有順序的序列資料
- 完全不具備需要學習的權重,取區域的代表值以縮小輸出
正確答案
B. 重複使用同一個濾波器並改變位置,以少量權重取出特徵卷積層讓小型濾波器在輸入上滑動,重複使用相同的權重來取出局部特徵。由於連接對象僅限於鄰近元素,且改變位置後仍使用相同權重,因此能以遠比全連接層少的參數處理圖像。重複使用權重的附帶效果,是不論被攝物出現在圖像的哪個位置,都能作為相同的特徵被擷取。與前一層所有單元相連的是全連接層,不具備學習權重、取代表值的是池化層,把前一時刻狀態送回的是回歸連接層的說明。讓一片濾波器通過後的結果稱為特徵圖,位移的寬度稱為步幅,填補周圍的則是填充。
第22題 | 批次正規化
關於批次正規化的說明,下列何者恰當?
- 把權重的平方和作為懲罰加進誤差函數,使權重統一縮小
- 每次學習時以一定比例停用單元,消除依賴上的偏差
- 在1個樣本中,把整層的數值統一調整,不受小批次大小影響
- 在小批次中把相同通道的數值彙整,調整為平均0、變異數1
正確答案
D. 在小批次中把相同通道的數值彙整,調整為平均0、變異數1批次正規化是在小批次中把相同通道的數值彙整、調整為平均0、變異數1的正規化層,能使學習穩定並加快速度。它的弱點是小批次大小過小時,統計量會變得不可靠。在1個樣本中調整整層數值的是層正規化,因不受小批次大小影響,常用於處理序列的模型。此外還有實例正規化與群組正規化,這4種並列在課綱的正規化層中。順帶一提,這個中項目在第1.1版中,名稱已從正則化層改為正規化層。把權重平方和作為懲罰的L2正則化,以及停用單元的Dropout,則被歸類在正則化,而非正規化層。
第23題 | 池化層
池化層所發揮的作用,下列何者最恰當?
- 跨越層數把輸入加進更後面的層,建立梯度能通過的路徑
- 調整中間層輸出的分布,使學習穩定並加快
- 把區域縮約為代表值,使模型對些微的位置偏移具備韌性
- 把輸入壓縮到低維度後,讓其能還原成原本的輸入
正確答案
C. 把區域縮約為代表值,使模型對些微的位置偏移具備韌性池化層是把固定大小的區域縮約為一個代表值的層,有取區域最大值的最大池化與取平均的平均池化。這不僅能降低解析度、減輕計算量,也因為即使被攝物偏移幾個像素,代表值也不易改變,因而對位置偏移具備韌性。這稱為不變性的獲得。把整片特徵圖平均壓縮成一個數值的全域平均池化(GAP),若用來取代最後疊上的全連接層,能大幅減少參數。池化層不具備學習用的權重,這一點也是與卷積層的差異。跨越層數加入的是跳躍連接,調整分布的是正規化層,壓縮後還原的則是自編碼器。
第24題 | 跳躍連接
採用跳躍連接後,即使是非常深的網路也能順利學習,原因是什麼?
- 形成跨越層數的路徑,梯度能沿較淺的路徑到達輸入端
- 單元被隨機停用,因而不再依賴特定路徑
- 各層輸出的分布統一,使數值波動在各層都受到抑制
- 權重的數量減少,即使資料有限也不容易過度擬合
正確答案
A. 形成跨越層數的路徑,梯度能沿較淺的路徑到達輸入端跳躍連接是跨越幾層、把輸入直接加到後面某層輸出上的連線方式。在反向傳播時,梯度除了經過許多層的長路徑外,也能經由跳躍的短路徑到達輸入端,因此即使疊得很深,梯度也不易消失。採用這個想法、把超過100層的深度化為現實的代表範例是ResNet,課綱中跳躍連接這個中項目所列出的關鍵字只有ResNet。隨機停用單元的是Dropout,統一各層分布的是正規化層,都是與跳躍連接不同的機制。跳躍連接也不是用來減少權重數量的工夫。
第25題 | LSTM與GRU
關於LSTM與GRU所具備的閘門,下列組合何者正確?
- LSTM與GRU都共通擁有重置閘與更新閘這2個閘門
- LSTM與GRU都共通擁有輸入閘、輸出閘、遺忘閘這3個閘門
- LSTM有輸入閘、輸出閘、遺忘閘3個,GRU有重置閘與更新閘2個
- LSTM有重置閘與更新閘2個,GRU有輸入閘、輸出閘、遺忘閘3個
正確答案
C. LSTM有輸入閘、輸出閘、遺忘閘3個,GRU有重置閘與更新閘2個LSTM擁有一條稱為CEC、用來儲存資訊的記憶路徑,並以決定要寫入什麼的輸入閘、決定要捨棄什麼的遺忘閘、決定要輸出什麼的輸出閘這3者,控制資訊的存取。透過這種機制,得以保持長期的依賴關係,大幅緩解了循環神經網路的梯度消失問題。GRU是LSTM的簡化版,只有重置閘與更新閘這2個閘門。參數較少、計算較輕量,但並非總是比LSTM效能更高。閘門數量是3與2、CEC是LSTM一方的用語,這些都是反覆被考的區別。
第26題 | Jordan
Jordan網路的結構,下列何者恰當?
- 把輸出層的輸出送回下一時刻的隱藏層作為輸入
- 把隱藏層的輸出送回下一時刻的隱藏層作為輸入
- 把輸出層的輸出送回同一時刻的輸入層作為輸入
- 把輸入層的值直接跳過送到輸出層並相加
正確答案
A. 把輸出層的輸出送回下一時刻的隱藏層作為輸入Jordan網路是把輸出層的輸出送回下一時刻的隱藏層作為輸入的一種循環神經網路。相對地,把隱藏層的輸出送回下一時刻隱藏層的則是Elman網路,送回的對象不同,正是兩者的差異。兩者都是依原本順序處理時間序列資料的結構,學習時會先把網路在時間方向展開,再套用誤差反向傳播法的BPTT。在較長的序列中,梯度消失問題與梯度爆炸問題會表現得特別明顯,因此會使用具備閘門機制的LSTM或GRU。跨越層數相加的是跳躍連接,與時間方向無關。
第27題 | Attention
關於Source-Target Attention的說明,下列何者恰當?
- 在同一個序列內,計算各元素彼此關聯強度的機制
- 在2個不同序列之間,計算彼此關聯強度的機制
- 並行執行多種關注方式,再彙整結果的機制
- 在各位置加上固有訊號,賦予詞語順序資訊的機制
正確答案
B. 在2個不同序列之間,計算彼此關聯強度的機制Attention是把輸入中應關注何處計算為權重的機制,以查詢(Query)、鍵(Key)、值(Value)三者來表示。其中Source-Target Attention用於像翻譯這種輸入序列與輸出序列分開的場合,計算2個不同序列之間的關聯強度。在同一序列內計算各元素彼此關係的則是Self-Attention,是Transformer的核心元件。在各位置加上固有訊號以賦予詞序的是位置編碼,並行執行多種關注方式再彙整結果的則是Multi-Head Attention,這些都是構成Transformer的各自不同元件。
第28題 | 位置編碼
關於Transformer的說明,下列何者恰當?
- 把輸入壓縮到低維度,再從中學習還原成原本輸入的模型
- 交替疊加卷積與池化,逐步彙整局部特徵的模型
- 不使用回歸連接、以Attention構成,詞序以位置編碼賦予
- 疊加回歸連接的結構,依序把前一時刻的狀態往下傳遞的模型
正確答案
C. 不使用回歸連接、以Attention構成,詞序以位置編碼賦予Transformer是不使用回歸連接、以Attention為核心構成的序列模型。由於不需要等待前一時刻的計算,因此能平行處理整個序列,也能透過一次計算直接掌握相距很遠的詞語之間的關係。不過平行處理會使詞語的順序資訊消失,因此以在各位置加上固有訊號的位置編碼來賦予詞序。Transformer並不是循環神經網路的一種,這正是容易被誤導之處。疊加回歸連接、傳遞前一時刻狀態的是RNN,疊加卷積與池化的是CNN,壓縮後再還原的則是自編碼器的說明。
第29題 | VAE
變分自編碼器(VAE)與一般自編碼器不同之處是哪一項?
- 把輸入先壓縮到低維度,再還原成原本輸入這一點
- 把壓縮後的目的地學習為機率分布而非單一點,因而能產生新資料這一點
- 即使不準備正解標籤,也能進行學習這一點
- 逐層依序學習,以製作深層網路初始值這一點
正確答案
B. 把壓縮後的目的地學習為機率分布而非單一點,因而能產生新資料這一點變分自編碼器(VAE)把壓縮輸入後的目的地學習為機率分布,而非單一個點。只要從該分布中取值並還原,就能產生訓練資料中沒有的新資料,因此被視為生成模型。先壓縮到低維度再還原,以及不需正解標籤即可學習,是一般自編碼器也共有的性質,並非VAE獨有的特徵。逐層依序學習、以製作深層網路初始值的,是堆疊式自編碼器的預訓練。課綱中同一中項目也列出了VQ-VAE、info VAE、β-VAE。
第30題 | Mixup
在圖像資料增強手法中,Mixup所進行的操作是哪一項?
- 裁切圖像的一部分,把放大後的圖當作新樣本
- 把2張圖像疊合在一起,製作出1張新樣本
- 把圖像左右翻轉,製造方向不同的樣本
- 把圖像的一部分塗成方形,隱藏該部分的資訊
正確答案
B. 把2張圖像疊合在一起,製作出1張新樣本Mixup是以一定比例把2張圖像疊合,正解標籤也以相同比例混合,藉此製作新訓練資料的資料增強手法。名稱相似的CutMix則不是疊合,而是把2張圖的一部分剪貼組合成1張。把圖像一部分塗成方形的是Cutout或Random Erasing,左右翻轉的是Random Flip,裁切一部分的是Crop。此外還有旋轉的Rotate、改變亮度的Brightness、改變對比的Contrast,以及自動決定要套用哪種轉換及套用程度的RandAugument,文字方面則列出了paraphrasing與noising。重要的是都不能選擇會破壞語意的轉換。
第31題 | GoogLeNet
GoogLeNet的特徵,下列何者恰當?
- 使用了並行套用不同大小濾波器的Inception模組
- 在2012年的ILSVRC奪冠,使用了ReLU函數與GPU學習
- 導入跨越層數的跳躍連接,實現超過100層的深度
- 只疊加3乘3的小型卷積,採用深層結構
正確答案
A. 使用了並行套用不同大小濾波器的Inception模組GoogLeNet使用了並行套用不同大小濾波器再彙整結果的Inception模組,在抑制參數量的同時實現了深層結構。只疊加3乘3小型卷積、採用單純深層結構的是VGG,與GoogLeNet同樣在2014年的ILSVRC中名列前茅。以跨越層數的跳躍連接實現超過100層深度的是ResNet,在2012年ILSVRC奪冠、結合ReLU函數與Dropout及GPU學習的則是AlexNet。此後又擴展到Wide ResNet、DenseNet、SENet、EfficientNet、MobileNet等,不使用卷積、引入Transformer想法的Vision Transformer也被收錄在內。
第32題 | 單階段偵測
YOLO與SSD共通的特徵,下列何者恰當?
- 以先提出候選區域、再進行分類的2階段步驟偵測物體
- 為每一個像素分配類別,把圖像區域塗分開來
- 把候選區域的擷取與分類,以一次推論一併完成,重視速度
- 以推估人體關節點的位置為目的,求出姿態
正確答案
C. 把候選區域的擷取與分類,以一次推論一併完成,重視速度YOLO與SSD是把候選區域的擷取與類別判定以一次推論一併完成的單階段物體偵測模型,特色是速度快。相對地,從R-CNN開始,發展到Fast R-CNN、Faster R-CNN的系列,是先提出候選區域、再進行分類的2階段方式,速度較慢但容易取得精確度。為每個像素分配類別的是語意分割,代表例有FCN、SegNet、U-Net、PSPNet、DeepLab。把同一類別的物體再細分到個體層級的實例分割由Mask R-CNN負責,推估人體關節點的姿態估計則以OpenPose為代表。
第33題 | BERT
關於BERT的說明,下列何者恰當?
- 把圖像與說明文對應到同一個向量空間,將兩者連結
- 反向追溯加入雜訊的過程,逐步生成資料
- 使用Transformer的編碼器,從前後雙方向觀察文脈
- 疊加回歸連接層,逐字依序讀入以建構文脈
正確答案
C. 使用Transformer的編碼器,從前後雙方向觀察文脈BERT是使用Transformer編碼器的語言模型,特徵是從句子的前後雙方向觀察文脈以進行預訓練。它推廣了「先用大量文字預訓練、再適應個別任務」的使用方式。疊加回歸連接層、依序讀入單字的是使用循環神經網路的模型,Transformer不具備回歸連接。把圖像與說明文對應到同一向量空間的是CLIP,課綱中將它列在多模態。反向追溯加入雜訊的過程來生成的是Diffusion Model,這屬於資料生成的中項目。
第34題 | CBOW
word2vec的CBOW所學習的方向,下列何者恰當?
- 從周邊出現的詞,學習預測其中心詞
- 從中心詞,學習預測其周邊出現的詞
- 從整個句子,學習判斷該句是肯定還是否定
- 從前半句,學習判斷後半句是否接續而來
正確答案
A. 從周邊出現的詞,學習預測其中心詞CBOW是從周邊出現的詞,學習預測該中心詞的方式。反過來,從中心詞學習預測周邊詞的則是Skip-gram,方向相反,要注意不要混淆。兩者都是word2vec的方式,目的都是取得以密集向量表示單字的分散式表示。為每個詞分配一個維度的One-hot向量,維度會等於詞彙量的大小,且無法表示詞與詞之間的相近程度;相對地,在分散式表示中,意義相近的詞會被安排在向量空間中相近的位置。判斷句子是肯定或否定的是情感分析這種應用任務,並非單字表示的學習方式。
第35題 | RLHF
根據人類回饋建立獎勵模型,再以強化學習調整模型的手法是哪一項?
- DQN
- A3C
- PPO
- RLHF
正確答案
D. RLHFRLHF是根據人類給予的偏好評價建立獎勵模型,再以此作為獎勵、透過強化學習調整模型的手法。它以用於語言模型的調整而聞名,但課綱中並未列在自然語言處理,而是列在深層強化學習的中項目,這一點出乎意料,值得記住。DQN是以神經網路近似行動價值函數的深層強化學習代表手法,PPO是抑制策略更新幅度以求穩定的策略學習手法,A3C則是平行執行多個環境以推進學習的手法。同一中項目也並列了Double DQN、Dueling Network、Rainbow、APE-X、Agent57等。
第36題 | Diffusion
關於Diffusion Model的說明,下列何者恰當?
- 從多個視角的照片學習三維外觀,製作新視角的影像
- 把壓縮後的目的地學習為機率分布,再從中取值還原
- 讓2個網路互相競爭,藉此生成逼真的資料
- 反向追溯逐步加入雜訊的過程,藉此生成資料
正確答案
D. 反向追溯逐步加入雜訊的過程,藉此生成資料Diffusion Model是透過反向追溯對資料逐步加入雜訊的過程,從雜訊中製作出目標資料的生成模型。它與讓2個網路互相競爭來學習的生成對抗網路(GAN)機制完全不同,並不是GAN的一種。從GAN衍生出DCGAN、CycleGAN、Pix2Pix。從多個視角照片學習三維外觀的是NeRF,把壓縮目的地學習為機率分布的則是變分自編碼器(VAE)。最好把GAN、VAE、Diffusion Model整理成並列存在的不同系統來理解。
第37題 | 遷移學習
遷移學習與微調(fine-tuning)的差異,下列何者恰當?
- 遷移學習重新學習全部權重,微調只學習輸出層
- 遷移學習與微調都不進行預訓練,從頭開始學習權重
- 遷移學習主要學習輸出層附近,微調則重新學習較廣的範圍
- 遷移學習只能用於圖像,微調只能用於語言
正確答案
C. 遷移學習主要學習輸出層附近,微調則重新學習較廣的範圍遷移學習是把預訓練模型負責擷取特徵的部分固定不變,主要只以新任務學習輸出層附近的方法。微調則是用新資料重新學習全部或較廣範圍的權重,雖需要更多資料與計算,但當目標領域與預訓練資料差異很大時,效果較容易提升。微調有時會發生原模型所具備能力喪失的災難性遺忘。兩者都是以預訓練模型為前提的手法,並非從頭開始學習,也不是依處理的資料種類來決定用哪一種。
第38題 | 基礎模型
課綱中,基礎模型一詞被放在哪個中項目?
- 放在遷移學習與微調,與Few-shot並列
- 放在多模態,與CLIP、DALL-E並列
- 放在深層強化學習,與DQN、RLHF並列
- 放在自然語言處理,與大型語言模型(LLM)並列
正確答案
B. 放在多模態,與CLIP、DALL-E並列基礎模型是指以大量資料預訓練、可轉用於多種下游任務的大規模模型,課綱中放在第32項的多模態,與CLIP、DALL-E、Flamingo、Unified-IO、Zero-shot等並列。生成式AI周邊的用詞分散在各處,大型語言模型(LLM)收錄在第27項自然語言處理,RLHF則收錄在第29項深層強化學習。與第31項遷移學習、微調並列的則是Few-shot、One-shot、自監督學習、預訓練模型、災難性遺忘等。掌握每個用詞放在哪個中項目,有助於掌握整體範圍的樣貌。
第39題 | SHAP
可解釋AI(XAI)手法之一SHAP的想法,下列何者恰當?
- 刻意把特徵值互換,從精確度下降的程度來衡量重要度
- 以類似熱度圖的形式,呈現判斷時看的是圖像的哪個部位
- 在預測附近套用簡單模型,以其係數來說明
- 借用合作賽局理論的想法,分配並呈現各特徵的貢獻度
正確答案
D. 借用合作賽局理論的想法,分配並呈現各特徵的貢獻度SHAP是借用合作賽局理論中使用的想法,公平地分配並呈現各特徵對預測的貢獻度的手法。以類似熱度圖的形式呈現判斷時看的是圖像哪個部位的是CAM與Grad-CAM,刻意把特徵值互換、從精確度下降程度衡量重要度的是Permutation Importance,在個別預測附近套用簡單模型並以其係數說明的則是LIME。這些都收錄在課綱第33項模型的可解釋性中,把能讓人理解判斷依據的做法統稱為可解釋AI(XAI)。
第40題 | 彩券假說
關於模型輕量化相關的彩券假說,其內容下列何者恰當?
- 讓小模型學習大型教師模型的輸出,就能保持效能的想法
- 大型網路之中,存在單獨學習也能達到同等效能之部分的想法
- 模型越大,所需訓練資料就會呈指數增加的想法
- 即使降低表示權重之數值的精確度,精確度的下降也極輕微的想法
正確答案
B. 大型網路之中,存在單獨學習也能達到同等效能之部分的想法彩券假說是指,大型網路之中,含有即使單獨取出學習、也能達到與整體同等效能之「中獎」部分網路的假說。它被用來說明為何剪去貢獻較小之連接或層的剪枝方法會有效。讓小模型學習大型教師模型輸出的是知識蒸餾,降低表示權重之數值精確度的是量化,加上剪枝共3種是課綱的輕量化手法,合稱為模型壓縮。所需訓練資料急遽增加的是維度的詛咒的話題。需要輕量化的典型情境,就是在終端裝置上執行推論的邊緣AI。
練習:作答本頁的題目
這是隨機出題的練習工具(在啟用 JavaScript 時運作)。即使不使用此工具,也能閱讀上方的所有題目與解說。
※ 解說是供學習用的資訊。考試的出題範圍與制度每年可能變動,請務必確認主辦機構的官方公告。
本頁面譯自日文原文。若譯文與原文內容不一致,以日文版為準。 查看日文原文