Karinoya 學習室

證照 · Cloud / AI / Python 合格實驗室

機器學習的方法與評估

可以用繁體中文閱讀題目與解說。講義(解說文章)僅有日文版。

查看日文版(含講義) →

第1題 | 邏輯迴歸的用途

關於邏輯迴歸的敘述,下列何者恰當?

  1. 以獎勵為線索,用來改善行動選擇的方式
  2. 如其名稱所示用於迴歸問題,輸出連續值本身
  3. 與名稱相反,用於分類問題,輸出屬於某類別的機率
  4. 不使用訓練資料,用來找出資料的群集
正確答案C. 與名稱相反,用於分類問題,輸出屬於某類別的機率

邏輯迴歸雖然名稱中帶有「迴歸」,卻是將線性計算結果轉換為機率形式來判定類別的分類手法。真正預測連續值本身的是線性迴歸等迴歸問題手法,被名稱誤導而選這個是常見的錯誤。不使用訓練資料找出群集的是分群,屬於非監督式學習的話題;以獎勵為線索改善行動的是強化學習的話題,兩者都列在不同的中項目中。

第2題 | 迴歸與分類

監督式學習中迴歸問題與分類問題的差異是哪一項?

  1. 迴歸問題用訓練資料,分類問題只以獎勵為線索學習
  2. 迴歸問題預測離散類別,分類問題預測連續值
  3. 迴歸問題預測連續值,分類問題預測離散類別
  4. 迴歸問題只用特徵量,分類問題用特徵量與訓練資料
正確答案C. 迴歸問題預測連續值,分類問題預測離散類別

迴歸問題預測像銷售額或氣溫這樣的連續值,分類問題則預測像是否為垃圾郵件這樣的離散類別。把這兩者互換的敘述是最常見的錯誤。監督式學習不論哪種問題都需要特徵量與訓練資料成對存在,不會只有一方只需特徵量。只以獎勵為線索學習的是強化學習,不能作為監督式學習的說明。

第3題 | 簡單迴歸與多元迴歸

簡單迴歸分析與多元迴歸分析的差異,下列何者恰當?

  1. 簡單迴歸分析不需要訓練資料,多元迴歸分析需要訓練資料
  2. 簡單迴歸分析的解釋變數有多個,多元迴歸分析只有1個
  3. 簡單迴歸分析的解釋變數只有1個,多元迴歸分析有多個
  4. 簡單迴歸分析用於分類,多元迴歸分析用於連續值的預測
正確答案C. 簡單迴歸分析的解釋變數只有1個,多元迴歸分析有多個

解釋變數只有1個的是簡單迴歸分析,有2個以上的是多元迴歸分析。「簡單」與「多元」這兩個字本身就直接表達了解釋變數的數量,因此可以判斷互換後的敘述是錯誤的。兩者都是預測連續值的迴歸手法,因此其中一個是分類的說法也不成立。此外迴歸分析屬於監督式學習,不論解釋變數的數量多寡,都需要訓練資料。

第4題 | 邊界最大化

支援向量機(SVM)決定邊界時的想法是哪一項?

  1. 一邊增加誤分類資料的權重,一邊重新畫出邊界
  2. 在連接各類別重心的線段中點位置畫出邊界
  3. 在邊界與最近資料點之間的間隔最大的位置畫出邊界
  4. 沿著解釋變數變異數最大的方向來畫出邊界
正確答案C. 在邊界與最近資料點之間的間隔最大的位置畫出邊界

SVM 採用邊界最大化,也就是在邊界與最近資料點之間的間隔達到最大的位置畫出邊界。這個最近的點稱為支援向量。一邊增加誤分類資料的權重、一邊逐步增加學習器的做法是提升法(boosting)的想法,尋找變異數最大方向的是主成分分析(PCA)的想法,兩者都不是SVM的說明。通過重心中點的方法則完全沒有考慮邊界間隔。

第5題 | 核技巧

核技巧(kernel trick)能實現的是哪一項?

  1. 不必實際計算映射到高維度後的座標,就能進行非線性分離
  2. 先逐一實際計算高維度的特徵量,再進行線性分離
  3. 不使用訓練資料,就能將資料自動分割為多個群集
  4. 大幅減少學習所用資料的筆數,藉此加快速度
正確答案A. 不必實際計算映射到高維度後的座標,就能進行非線性分離

核技巧是透過核函數直接求出映射到高維度空間後的內積,藉此不必實際計算映射後的座標,就能實現非線性分離。不需要逐一實際計算座標,正是被稱為「技巧(trick)」的原因,因此「先實際計算再分離」的敘述方向相反。不使用訓練資料進行分割是分群的話題,這也不是減少訓練資料筆數的機制。

第6題 | 平行與循序

集成學習中Bagging與Boosting的差異是哪一項?

  1. Bagging 只能用於決策樹,Boosting 只能用於線性迴歸
  2. Bagging 依序學習弱學習器,Boosting 平行學習
  3. Bagging 平行學習弱學習器,Boosting 依序學習
  4. Bagging 不使用訓練資料,Boosting 使用訓練資料
正確答案C. Bagging 平行學習弱學習器,Boosting 依序學習

Bagging 是用自助抽樣法(bootstrap sampling)製作出的訓練資料,平行地、彼此獨立地建立學習器,再取多數決或平均。Boosting 則是在建立學習器時,重視前一個學習器答錯的樣本,依序逐一增加學習器,因此依賴順序、無法平行建立。把這種平行與循序互換,是最常見的錯誤。兩者都是監督式學習、都使用訓練資料,可用的弱學習器種類也不限於決策樹或線性迴歸。

第7題 | 隨機森林

隨機森林的學習方式,下列何者恰當?

  1. 把一棵決策樹盡量種深,最後再統一調整分支數量
  2. 重視前一棵決策樹答錯的樣本,逐一增加決策樹
  3. 用自助抽樣法製作出的多個訓練資料,平行學習大量決策樹
  4. 不使用決策樹,將多個線性迴歸的預測結果平均後輸出
正確答案C. 用自助抽樣法製作出的多個訓練資料,平行學習大量決策樹

隨機森林是用允許重複抽取的自助抽樣法,製作出稍有差異的多份訓練資料,再從中平行、彼此獨立地培育大量決策樹,取多數決或平均,是Bagging的代表範例。重視前一棵樹的錯誤、逐一增加樹木的是梯度提升等Boosting一方的說明,把這裡互換是常見的錯誤。使用的樹不是一棵而是大量,彙整的對象是決策樹,而不是線性迴歸。

第8題 | 決策樹的弱點

關於決策樹性質的敘述,下列何者恰當?

  1. 分支越深,對訓練資料的擬合程度就一定越差
  2. 由於不需要訓練資料,因此無法用於分類或迴歸
  3. 分支的條件人無法讀懂,但不容易發生過度擬合
  4. 人可以讀懂分支的條件,但單獨使用容易過度擬合
正確答案D. 人可以讀懂分支的條件,但單獨使用容易過度擬合

決策樹是把針對特徵量的條件分支排列成樹狀的手法,優點在於人可以讀懂在什麼條件下走向哪一邊。另一方面,樹種得越深,就越容易連訓練資料的細微特性都記住,單獨使用容易過度擬合。種得越深,對訓練資料的擬合程度反而會變好,問題在於面對新資料時表現卻變差,因此「擬合程度一定變差」的敘述是錯誤的。決策樹屬於監督式學習,可用於分類也可用於迴歸。

第9題 | AR與VAR

自我迴歸模型(AR模型)與向量自我迴歸模型(VAR模型)的關係是哪一項?

  1. AR 擷取圖像的局部特徵,VAR 擷取語音的頻率成分
  2. AR 同時處理多個時間序列,VAR 只用過去的值說明1個時間序列
  3. AR 不需要訓練資料,VAR 需要訓練資料
  4. AR 用自身過去的值來說明1個時間序列,VAR 用彼此過去的值來說明多個時間序列
正確答案D. AR 用自身過去的值來說明1個時間序列,VAR 用彼此過去的值來說明多個時間序列

AR模型是用該序列自身過去的值,來說明1條時間序列現在的值。VAR模型則將此擴展到多條時間序列,形成彼此用過去的值互相說明的形式。差異在於是1條還是多條,因此把兩者互換的敘述是錯誤的。兩者都是處理時間序列的模型,並不是用來擷取圖像局部特徵或語音頻率成分的工具,也不是依訓練資料需求與否來區分的。

第10題 | 多類別分類

下列何者屬於多類別分類?

  1. 將手寫數字圖像分配到0到9其中一個類別
  2. 依盤面狀態,根據獎勵重新選擇下一步棋
  3. 從顧客的購買紀錄找出相似顧客的群集
  4. 從氣溫與濕度預測明天最高氣溫的數值
正確答案A. 將手寫數字圖像分配到0到9其中一個類別

多類別分類是判斷屬於3個以上類別中哪一個的分類問題,將手寫數字分配到0到9其中一個的課題就是典型範例。預測最高氣溫這種連續值的是迴歸問題,並非分類。找出相似顧客群集的是分群,屬於非監督式學習;依獎勵重新選棋的是強化學習,兩者都不是監督式學習的分類問題。

第11題 | 非監督式的輸入

關於非監督式學習的說明,下列何者恰當?

  1. 只給定特徵量,找出資料本身所具有的結構或規律
  2. 給定特徵量與訓練資料成對的資料,逐步縮小與正解的差距
  3. 只使用少數帶有正解的資料,其餘捨棄後再進行學習
  4. 以從環境獲得的獎勵為線索,改善行動的選擇方式
正確答案A. 只給定特徵量,找出資料本身所具有的結構或規律

課綱將「理解非監督式學習只需要特徵量」列為目標。在沒有正解標籤的情況下,透過分群或降維找出資料本身結構的,就是非監督式學習。以特徵量與訓練資料成對為前提的是監督式學習,以獎勵為線索的是強化學習,兩者分別列在不同的中項目中。捨棄其餘資料的做法也不是非監督式學習的說明。

第12題 | k-means法

k-means法的進行方式,下列何者恰當?

  1. 先決定群集數,重複進行重心更新與分配
  2. 給定正解標籤,逐步將邊界間隔最大化
  3. 不決定群集數,依序從相近者開始合併
  4. 從單字出現的方式,推估文件中潛藏的主題比例
正確答案A. 先決定群集數,重複進行重心更新與分配

k-means法會事先決定群集數k,再重複「將各點分配到最近的重心」與「重新計算重心」的操作,是一種非階層式分群。不決定群集數、依序從相近者開始合併的是Ward法等階層式分群,這種方法可以畫出樹狀圖(dendrogram)。將邊界間隔最大化的是SVM,屬於監督式學習;從單字出現方式推估主題的是潛在狄利克雷分配(LDA)等主題模型。

第13題 | Ward法

Ward法與樹狀圖(dendrogram)的關係是哪一項?

  1. 是降維手法,將降維後的2個軸畫成樹狀圖
  2. 是階層式分群的手法,能將合併的過程畫成樹狀圖
  3. 是監督式學習的手法,將分類的邊界畫成樹狀圖
  4. 是非階層式分群的手法,原理上無法畫出樹狀圖
正確答案B. 是階層式分群的手法,能將合併的過程畫成樹狀圖

Ward法是依序從相近者開始合併的階層式分群,可以將合併的過程畫成樹狀圖(dendrogram)。它的優點是可以一邊觀察在哪個高度切開,事後再決定群集數。事先決定群集數的非階層式方法是k-means法,這種方法不會畫出樹狀圖。Ward法既不是降維手法,也不是監督式學習手法,不使用正解標籤。

第14題 | PCA與t-SNE

主成分分析(PCA)與t-SNE的差異,下列何者恰當?

  1. PCA 是線性降維,t-SNE 是非線性且適合可視化
  2. PCA 需要訓練資料,t-SNE 只靠特徵量運作
  3. PCA 是非線性降維,t-SNE 是線性且適合可視化
  4. PCA 用於推估文件主題,t-SNE 用於矩陣分解
正確答案A. PCA 是線性降維,t-SNE 是非線性且適合可視化

PCA是重新取變異數最大方向為軸的線性降維手法,t-SNE則是一種非線性手法,能在保持相近點之間相近程度的前提下映射到低維度,常用於2維或3維的可視化。把這裡的線性與非線性互換是常見的錯誤。推估文件主題的是潛在狄利克雷分配(LDA)等主題模型,進行矩陣分解的是奇異值分解(SVD)。PCA與t-SNE都屬於非監督式學習,因此不需要訓練資料。

第15題 | 冷啟動

協同過濾中的冷啟動問題是哪一項?

  1. 推薦的商品缺貨,無法送達使用者手上
  2. 只依商品說明文字為線索,會使推薦產生偏頗
  3. 對紀錄過多的使用者,推薦的計算跑不完
  4. 對尚無紀錄的使用者或商品,難以做出好的推薦
正確答案D. 對尚無紀錄的使用者或商品,難以做出好的推薦

協同過濾是以使用者之間或商品之間評價相似程度為線索來推薦,因此對於尚無評價紀錄的新使用者或新商品,就抓不到線索,難以做出推薦,這就是冷啟動問題。以商品說明文字或屬性本身為線索的內容式過濾,常被拿來作為彌補這項弱點的方向一併討論。這與計算時間或庫存無關。

第16題 | 強化學習的訊號

強化學習作為學習線索所依據的是哪一項?

  1. 從環境獲得的獎勵訊號
  2. 文件中包含之單字的出現次數
  3. 每一筆由人給定的正解標籤
  4. 只依特徵量彼此的距離遠近
正確答案A. 從環境獲得的獎勵訊號

強化學習透過與環境反覆試錯互動,學習能讓所獲獎勵累積最大化的方針。線索不是每一步的正解標籤而是獎勵,因此並非監督式學習的一種。只依距離遠近為線索的是分群等非監督式學習的想法,單字出現次數則是自然語言處理特徵表示的話題,都不是強化學習的學習訊號。針對獎勵不會馬上返回的情況,以折扣率評估未來,也是這個框架的特徵。

第17題 | 價值與策略

關於強化學習2種代表性方法的說明,下列何者恰當?

  1. 只有學習價值函數的方法,策略會由價值函數唯一決定
  2. 有學習價值函數的方法與直接學習策略的方法,兩者兼具的是Actor-Critic
  3. 只有直接學習策略的方法,價值函數在學習過程中無法使用
  4. 價值函數與策略都是由人手動設計的,不會是學習的對象
正確答案B. 有學習價值函數的方法與直接學習策略的方法,兩者兼具的是Actor-Critic

課綱將「理解學習價值函數與學習策略這2種代表性方法」列為目標。先估算狀態價值函數或行動價值函數、再選擇行動的是前者,Q學習與SARSA是其代表。用參數直接表示策略本身並更新的是後者,策略梯度法與REINFORCE是其代表。Actor-Critic結合負責策略的Actor與負責價值的Critic,兩者兼具。只有其中一種的敘述,或不會成為學習對象的敘述,都是錯誤的。

第18題 | Q學習與SARSA

Q學習與SARSA的差異,下列何者恰當?

  1. Q學習使用實際選擇之行動的價值,SARSA使用下一狀態中最大的行動價值
  2. Q學習需要訓練資料,SARSA不使用訓練資料進行更新
  3. Q學習不使用行動價值函數,只有SARSA會更新行動價值函數
  4. Q學習使用下一狀態中最大的行動價值,SARSA使用實際選擇之行動的價值
正確答案D. Q學習使用下一狀態中最大的行動價值,SARSA使用實際選擇之行動的價值

兩者都是更新行動價值函數的強化學習手法,差異在於更新時使用什麼。Q學習使用下一狀態中可採取行動裡價值最大的那個,SARSA則使用實際選擇之下一個行動的價值來更新。把這兩者互換是常見的錯誤。Q學習也會更新行動價值函數,因此「只有一方會用」的敘述不成立。強化學習兩者都是靠獎勵學習的框架,因此「需要訓練資料」的敘述也是錯誤的。

第19題 | ε-greedy

在有4支拉桿的多臂拉霸機問題中,以機率ε從4支拉桿中均勻隨機選1支,以機率1-ε選估計價值最大的拉桿,採用ε-greedy策略。當ε為0.1時,1次選擇結果選中估計價值最大之拉桿的機率是哪一項?

  1. 0.900
  2. 0.100
  3. 0.250
  4. 0.925
正確答案D. 0.925

選中估計價值最大之拉桿的情況有2種:貪婪選擇的情況,以及隨機選擇結果剛好選中該拉桿的情況。前者是1減去0.1等於0.900,後者是0.1除以4等於0.025,兩者相加為0.925。0.900是漏算了隨機選中部分的值,0.250是從4支拉桿均勻選擇時的機率,0.100則是ε本身。ε越大,探索就越多,這個機率就越低。

第20題 | 折扣率的計算

從某時點起,1步後獲得獎勵4,2步後獲得獎勵12,3步後獲得獎勵8。對1步後的獎勵乘以0.5,對2步後的獎勵乘以0.5的平方,對3步後的獎勵乘以0.5的3次方,再加總,其值是哪一項?

  1. 24.0
  2. 6.0
  3. 7.5
  4. 12.0
正確答案B. 6.0

4乘以0.5得2,12乘以0.5的平方即0.25得3,8乘以0.5的3次方即0.125得1,加總為6.0。24.0是完全不打折扣、直接把4、12、8相加的值;12.0是把那個24只乘一次0.5的值;7.5是把相乘的順序反過來,對4乘0.125、對12乘0.25、對8乘0.5的值,這些都是常見的混淆。折扣率的作用就是讓越遙遠的未來獎勵評價越小,因此越靠近的一方權重越大。

第21題 | 精確率的計算

某模型的預測結果為真陽性40件、偽陽性10件、偽陰性20件、真陰性130件。精確率是多少?

  1. 0.85
  2. 0.80
  3. 0.73
  4. 0.67
正確答案B. 0.80

精確率的分母是預測為陽性的件數,因此以真陽性40除以真陽性40與偽陽性10之和50,得0.80。0.67是以實際為陽性者為分母的召回率,即40除以真陽性40與偽陰性20之和60的值。0.85是全部200件中正確判斷之170件所佔比例的準確率,0.73是精確率0.80與召回率0.67的調和平均即F值,這些都是求出其他指標的錯誤結果。

第22題 | 分母的差異

精確率與召回率在分母上的差異,下列何者恰當?

  1. 精確率以實際為陽性的件數為分母,召回率以預測為陽性的件數為分母
  2. 精確率只以真陰性的件數為分母,召回率只以偽陰性的件數為分母
  3. 精確率與召回率都直接以資料整體的件數為分母
  4. 精確率以預測為陽性的件數為分母,召回率以實際為陽性的件數為分母
正確答案D. 精確率以預測為陽性的件數為分母,召回率以實際為陽性的件數為分母

精確率是「預測為陽性者之中,實際為陽性的比例」,因此分母在預測一方。召回率是「實際為陽性者之中,被抓出來的比例」,因此分母在實際一方。把這兩者互換是最常見的錯誤,可用分母是預測還是實際來幫助記憶。以資料整體為分母的是準確率,只以真陰性或偽陰性為分母的指標,都不是這兩者中的任何一個。想減少誤判時著重精確率,想減少漏抓時著重召回率。

第23題 | F值的計算

精確率為0.6、召回率為0.9時,F值是多少?

  1. 1.50
  2. 0.54
  3. 0.75
  4. 0.72
正確答案D. 0.72

F值是精確率與召回率的調和平均,因此以2乘以0.6與0.9的乘積0.54得1.08,再除以0.6與0.9之和1.5,得0.72。0.75是誤算成算術平均而非調和平均的值,0.54只是把兩者相乘的值,1.50只是把兩者相加的值。調和平均會被較小的一方拉近,因此比算術平均的0.75小,這一點也值得確認。

第24題 | 不平衡資料

對一份陽性只佔整體1%的資料,建立一個把全部都預測為陰性的模型。關於這個狀況的說明,下列何者恰當?

  1. 準確率會是50%,可知其表現與亂猜相同
  2. 準確率高達99%,但召回率是0%,1件陽性都沒抓到
  3. 準確率低至1%,召回率也是0%,兩個指標都能看出問題
  4. 準確率高達99%,召回率也高達99%,可說能夠實用
正確答案B. 準確率高達99%,但召回率是0%,1件陽性都沒抓到

由於陽性只佔1%,只要全部回答陰性就能答對99%,準確率因而達到99%。但實際的陽性1件都沒抓到,召回率是0%,這樣的模型並無用處。當類別數量不平衡時,如果只看準確率就會做出錯誤判斷,因此也需要一併查看召回率、F值、ROC曲線與AUC。在這個設定下,準確率不會是1%,也不會是50%。

第25題 | ROC曲線的軸

ROC曲線縱軸與橫軸的組合,下列何者恰當?

  1. 縱軸為誤差大小,橫軸為學習的迭代次數
  2. 縱軸為準確率,橫軸為學習所用資料的件數
  3. 縱軸為真陽性率,橫軸為偽陽性率,其下方面積為AUC
  4. 縱軸為精確率,橫軸為召回率,其下方面積為AUC
正確答案C. 縱軸為真陽性率,橫軸為偽陽性率,其下方面積為AUC

ROC曲線是一邊移動判定的閾值,一邊以縱軸為真陽性率、橫軸為偽陽性率所繪製的曲線,其下方面積就是AUC。AUC越接近1越好,0.5則代表與隨機判定相同的水準。若把縱軸改為精確率、橫軸改為召回率,就會變成不同的曲線,這是常見的混淆之處。準確率與資料件數、誤差與迭代次數的組合,則是用來觀察學習過程的另一種圖表。

第26題 | AIC與BIC

赤池資訊量準則(AIC)與貝氏資訊量準則(BIC)的使用方式是哪一項?

  1. 觀察擬合程度與參數數量的平衡,選擇數值較大的模型
  2. 只觀察參數數量,選擇參數最多的模型
  3. 只觀察對訓練資料的擬合程度,選擇誤差最小的模型
  4. 觀察擬合程度與參數數量的平衡,選擇數值較小的模型
正確答案D. 觀察擬合程度與參數數量的平衡,選擇數值較小的模型

AIC與BIC都是把對資料的擬合優度,加上因增加參數而受到的懲罰後相加而成的指標,數值越小就視為越好的模型。認為越大越好是錯誤的,這正是最常被考的地方。如果只依對訓練資料的擬合程度來選,就會只選出參數較多的模型而走向過度擬合,因此設置懲罰項來取得平衡。這與「不要不必要地把事情複雜化」的奧坎剃刀原則方向一致。

第27題 | 5折的次數

對200筆資料進行5折交叉驗證時,每次驗證資料的件數,以及重複學習與評估的次數,下列組合何者恰當?

  1. 驗證160件,重複5次學習與評估
  2. 驗證40件,重複5次學習與評估
  3. 驗證40件,只進行1次學習與評估
  4. 驗證100件,重複2次學習與評估
正確答案B. 驗證40件,重複5次學習與評估

k折交叉驗證是把資料分成k份,其中1份作驗證、其餘作訓練的程序重複k次,再將結果平均。將200件分成5份,每份就是40件,因此每次驗證都是40件,訓練用剩下的160件,並重複5次。只分1次就結束的是保留法驗證,計算量輕,但容易受切分方式左右結果。以160件作驗證,是把訓練與驗證算錯的計數方式。

第28題 | RMSE的計算

對4筆預測,實測值減去預測值所得的誤差依序為2、4、-4、0。均方根誤差(RMSE)是多少?

  1. 6.0
  2. 9.0
  3. 2.5
  4. 3.0
正確答案D. 3.0

誤差的平方分別為4、16、16、0,總和為36。除以件數4得到9,即為均方誤差(MSE),其平方根3.0即為RMSE。9.0是誤把MSE當作答案的值,2.5是誤差絕對值2、4、4、0的平均,即平均絕對誤差(MAE),6.0則是忘記除以件數、直接取平方和36之平方根的值。RMSE與原本誤差的單位一致,因此較易解讀。

第29題 | 平均值與中位數

有7筆資料為2、4、4、6、8、10、50,其平均值、中位數、眾數的組合是哪一項?

  1. 平均值12、中位數4、眾數6
  2. 平均值12、中位數6、眾數4
  3. 平均值6、中位數12、眾數4
  4. 平均值6、中位數4、眾數10
正確答案B. 平均值12、中位數6、眾數4

總和84除以件數7,平均值為12;由小到大排列後第4個是6,因此中位數為6;出現2次的4是眾數。重點在於,平均值因50這個離群值而被大幅拉高,中位數與眾數幾乎沒有變動,這正是不應只看單一代表值就下判斷的例子。把平均值與中位數互換、或把中位數與眾數搞混的值,是常見的錯誤。

第30題 | 偽相關

關於偽相關的敘述,下列何者恰當?

  1. 只要相關係數為0,就能確定兩者之間毫無關係
  2. 計算相關係數時,規定必須先剔除離群值
  3. 由於存在共同的因素,使得沒有因果關係的兩者之間也出現相關
  4. 只要相關係數為正,就必定表示一方是另一方的原因
正確答案C. 由於存在共同的因素,使得沒有因果關係的兩者之間也出現相關

偽相關是指,例如由於氣溫這個共同因素,使得冰品銷售額與溺水事故件數一起變動,即使兩者之間沒有直接因果關係,也會出現相關的現象。這裡的教訓是,即使有相關也不代表有因果,因此相關係數為正並不能說是原因與結果的關係。此外,即使相關係數為0,也可能隱藏著非線性的關係,因此不能確定沒有關係。離群值的處理則是另一個議題。

練習:作答本頁的題目

這是隨機出題的練習工具(在啟用 JavaScript 時運作)。即使不使用此工具,也能閱讀上方的所有題目與解說。

※ 解說是供學習用的資訊。考試的出題範圍與制度每年可能變動,請務必確認主辦機構的官方公告。

本頁面譯自日文原文。若譯文與原文內容不一致,以日文版為準。 查看日文原文