クラウド・AI・Python CLOUD / AI / PYTHON
ディープラーニングの手法と応用
講義 4 本・確認問題 40 問 | 本試験では「G検定」(0問)の一部 | 最終更新 2026-09-24
この章で学ぶこと- 単純パーセプトロンの限界から、活性化関数の選び方、誤差関数、誤差逆伝播法までを一本の線でつなぎます。
- 過学習を抑える正則化と、誤差の谷をうまく下っていくための最適化手法を、シラバス14番と16番に沿って整理します。
- 畳み込み層から正規化層、回帰結合層、Attentionまで、深いモデルを組み立てる部品を順に見ていきます。
- 画像・言語・音声・強化学習・生成から、転移学習・マルチモーダル・解釈性・軽量化までを、代表モデルの名前とともに押さえます。
1. ニューラルネットワークの土台と学習の仕組み
単純パーセプトロンの限界から、活性化関数の選び方、誤差関数、誤差逆伝播法までを一本の線でつなぎます。
ニューラルネットワークは、人間の神経回路をおおまかにまねた計算の仕組みです。データを受け取る入力層、答えを出す出力層、そのあいだに置かれる隠れ層という3種類の層が並び、層と層のあいだはそれぞれの重みでつながっています。入力層と出力層だけからなる最も単純な形を単純パーセプトロン、隠れ層を持つものを多層パーセプトロンといいます。ディープラーニングとは、この隠れ層を何層も重ねたニューラルネットワークを使う手法のことです。層を深くすると、前の層が見つけた特徴を次の層がさらに組み合わせられるようになり、人が特徴を設計しなくてもデータのほうから特徴が立ち上がってきます。
単純パーセプトロンには、線形分離可能な問題しか解けないという有名な限界があります。平面に置いた点を1本の直線で2つに切り分けられる場合しか正しく分類できない、という意味です。この限界をはっきり示したのが排他的論理和、いわゆるXORでした。XORの真理値表を平面に描くと、出力が1になる点と0になる点が対角線上に交互に並ぶので、どこに直線を引いても分けられません。隠れ層を1つ加えて多層パーセプトロンにすると境界を折り曲げられるようになり、XORも表現できるようになります。XORが解けないのはどちらかという問いは繰り返し出るので、単純パーセプトロンのほうだと覚えてください。
ディープラーニングの学習は、行列とベクトルのかけ算と足し算を膨大な回数繰り返す計算です。CPUは汎用的な処理を順番に高速にこなすことを得意とする演算装置で、強力なコアを少数だけ持ちます。GPUはもともと画像処理のために作られた装置で、単純な演算を行う小さなコアを大量に持ち、同じ計算を一斉に並列で回すことに向いています。ディープラーニングの計算はまさにその形をしているので、GPUを使うと学習にかかる時間が大きく縮みます。TPUはディープラーニングのテンソル演算に的をしぼって設計された装置で、用途を限る代わりに効率をさらに高めています。この3つの特徴を説明できること、GPUやTPUが学習や推論に適する理由を説明できることが、シラバスの目標に挙げられています。
各ユニットは、入力に重みをかけて足し合わせた値を活性化関数に通してから次の層へ渡します。活性化関数がなければ、何層重ねても全体はひとつの線形変換に押しつぶされてしまい、深くする意味がなくなります。つまり活性化関数の役割は、ネットワークに非線形性を持ち込むことです。シグモイド関数は出力を0から1のあいだに押し込むS字型の関数で、確率として読めるため二値分類の出力層に使われます。tanh関数は出力が-1から1で、原点について対称なぶんシグモイドより扱いやすい面があります。ReLU関数は入力が正ならそのまま、負なら0を返す単純な関数です。Leaky ReLU関数は、負の側にもわずかな傾きを持たせてReLU関数の弱点をやわらげたものです。
活性化関数の選び方は、勾配消失問題と直結しています。シグモイド関数を微分すると、いちばん大きいところでも0.25にしかなりません。層をさかのぼるたびに0.25以下の数がかけ合わされていくので、何層もさかのぼると勾配はほとんど0になり、入力に近い層の重みが動かなくなります。tanh関数は微分の最大値が1なのでいくらかましですが、根本の解決にはなりません。ReLU関数は正の領域で微分が常に1なので、いくらかけ合わせても値が小さくなりません。これがReLU関数が深いネットワークで広く使われる理由です。ただしReLU関数は負の領域では微分が0なので、いったん負側に入ったユニットが二度と学習しなくなることがあり、Leaky ReLU関数はここへの対処にあたります。なおシラバスでは、勾配消失問題は12の活性化関数、15の誤差逆伝播法、22の回帰結合層の3か所に登場します。
出力層だけは、解こうとしている問題に合わせて選びます。二値分類ならシグモイド関数、クラスが3つ以上ある多クラス分類ならソフトマックス関数です。ソフトマックス関数は出力の総和がちょうど1になるように正規化するので、各クラスの確率として読めます。隠れ層の活性化関数として使うものではありません。誤差関数は、モデルの出力と正解のずれをひとつの数値にする関数です。回帰なら平均二乗誤差関数、分類なら交差エントロピーを使うのが基本で、多クラス分類ではソフトマックス関数と交差エントロピーがセットになります。シラバスの13番にはこのほか、2つの確率分布のへだたりを測るカルバック・ライブラー情報量(KL)、2つのデータが同じものかどうかを距離で学ばせるContrastive Loss、基準と正例と負例の3つ組で距離の関係を学ばせるTriplet Lossが挙げられています。
誤差関数の値を小さくするには、それぞれの重みを少し動かしたときに誤差がどれだけ変わるか、つまり勾配を知る必要があります。これを出力側から入力側へさかのぼりながら効率よく計算していく手法が誤差逆伝播法です。土台になっているのは連鎖律で、合成関数の微分を部品ごとの微分のかけ算に分解できるという規則です。ここで大事なのは、誤差逆伝播法は勾配を求めるための計算法であって、重みを実際に更新するのは勾配降下法だという点です。誤差逆伝播法が重みを更新すると言い切ってしまうと不正確になります。また、最終的な誤差に対してどの層のどのユニットがどれだけ責任を負うのかを割り当てる問題を信用割当問題といい、誤差逆伝播法はこれに実用的な答えを与えたと位置づけられています。
誤差逆伝播法を深いネットワークに適用すると、勾配消失問題とは逆に、さかのぼるほど勾配が大きくなりすぎて発散する勾配爆発問題も起こります。1より小さい数をかけ続ければ0に近づき、1より大きい数をかけ続ければ際限なく大きくなる、という同じ計算の裏表です。勾配爆発が起きると重みが一気に飛んで学習が壊れます。シラバスでは、勾配爆発問題は15の誤差逆伝播法と22の回帰結合層の両方に置かれていて、とくに時間の方向へ長くさかのぼる回帰結合層で問題になります。
活性化関数の使い分け| 活性化関数 | 出力の範囲 | 主な使いどころ | 注意点 |
|---|
| シグモイド関数 | 0 から 1 | 二値分類の出力層 | 微分の最大値が0.25で勾配消失を起こしやすい |
| tanh関数 | -1 から 1 | 隠れ層 | 微分の最大値は1だが、端では0に近づく |
| ReLU関数 | 0 以上 | 隠れ層 | 負の入力では勾配が0になり学習が止まることがある |
| Leaky ReLU関数 | 実数全体 | 隠れ層 | 負側の傾きをどれくらいにするかを決める必要がある |
| ソフトマックス関数 | 0 から 1 で総和が1 | 多クラス分類の出力層 | 隠れ層の活性化関数としては使わない |
用語
- 単純パーセプトロン
- 入力層と出力層だけからなる最も単純なニューラルネットワーク。線形分離可能な問題しか解けず、XORは表現できない。
- 多層パーセプトロン
- 入力層と出力層のあいだに隠れ層を持つニューラルネットワーク。境界を折り曲げられるので非線形な分離ができる。
- 隠れ層
- 入力層と出力層のあいだにある層。外から直接値を与えたり読み取ったりしない中間の表現を担う。
- GPU
- 小さな演算コアを大量に持ち、同じ計算を一斉に並列処理する装置。ディープラーニングの行列演算と相性がよい。
- TPU
- ディープラーニングのテンソル演算に的をしぼって設計された演算装置。用途を限る代わりに効率を高めている。
- シグモイド関数
- 出力を0から1に押し込むS字型の活性化関数。二値分類の出力層に使う。微分の最大値が0.25で勾配消失の原因になる。
- tanh関数
- 出力が-1から1の活性化関数。微分の最大値は1で、シグモイド関数よりは勾配が減りにくい。
- ReLU関数
- 入力が正ならそのまま、負なら0を返す活性化関数。正の領域で微分が常に1なので勾配消失を大きく緩和する。
- Leaky ReLU関数
- ReLU関数の負の側にもわずかな傾きを持たせた活性化関数。負側で勾配が0になって学習が止まる問題への対処。
- ソフトマックス関数
- 出力の総和が1になるように正規化する活性化関数。多クラス分類の出力層に使い、交差エントロピーと組み合わせる。
- 勾配消失問題
- 逆伝播の途中で勾配が0に近づき、入力に近い層が学習されなくなる問題。活性化関数の微分が小さいことが典型的な原因。
- 勾配爆発問題
- 逆伝播の途中で勾配が大きくなりすぎて発散し、重みが飛んで学習が壊れる問題。回帰結合層でとくに起きやすい。
- 交差エントロピー
- 分類問題で使われる代表的な誤差関数。予測した確率分布と正解の分布のずれを測る。
- 平均二乗誤差関数
- 回帰問題で使われる代表的な誤差関数。予測と正解の差を二乗して平均する。
- カルバック・ライブラー情報量(KL)
- 2つの確率分布のへだたりを測る量。誤差関数として使われることがある。
- Contrastive Loss
- 2つのデータの組について、同じものなら近く、違うものなら遠くなるように距離を学ばせる誤差関数。
- Triplet Loss
- 基準・正例・負例の3つ組を使い、基準と正例の距離が基準と負例の距離より小さくなるように学ばせる誤差関数。
- 連鎖律
- 合成関数の微分を、部品ごとの微分のかけ算に分解できるという規則。誤差逆伝播法の数学的な土台。
- 信用割当問題
- 最終的な誤差に対して、どの層のどのユニットがどれだけ責任を負うのかを割り当てる問題。
例題
例題:10層のネットワークの活性化関数を、すべて入力をそのまま返す関数に置き換えたら、このネットワークは何と同じものになるか。
答えと考え方 入力層から出力層まで1回の線形変換をするだけのネットワークと同じになる。線形変換をいくつ重ねても、まとめればひとつの線形変換で書ける。つまり層を10に増やしたことがまったく無駄になり、直線でしか分けられないモデルに戻ってしまう。活性化関数は「気分で挟むもの」ではなく、層を重ねることに意味を持たせるための必須の部品である。この理屈が分かっていると、単純パーセプトロンが線形分離しかできない理由と、多層にしただけでは足りず非線形な活性化関数が要る理由が、同じ話としてつながる。
例題:隠れ層の活性化関数をシグモイド関数からtanh関数に替えたら学習が進むようになった。ところが層をさらに深くすると、また入力側の層が動かなくなった。何が起きているのか。
答えと考え方 どちらの関数も、微分の値が場所によっては1をかなり下回る。tanh関数のほうが微分の最大値は大きいので浅いうちは改善するが、逆伝播では層の数だけ微分がかけ合わされるため、1未満の数を何十回もかければやはり勾配は消えていく。tanh関数は勾配消失問題をやわらげはしても、なくしてはいない。次の一手はReLU関数である。正の領域で微分が常に1なので、何度かけ合わせても値が縮まない。ただし負の領域では勾配が0になってユニットが止まることがあるので、そこが気になるならLeaky ReLU関数を検討する。深さの問題は活性化関数だけで片づくとは限らず、スキップ結合や正規化層といった構造の側の工夫と併せて考えることになる。
出典・根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 11. ニューラルネットワークとディープラーニング
2. 正則化と最適化手法
過学習を抑える正則化と、誤差の谷をうまく下っていくための最適化手法を、シラバス14番と16番に沿って整理します。
訓練データにだけ合いすぎて、初めて見るデータでの成績が落ちてしまう状態を過学習といいます。正則化は、この過学習を抑えるためにモデルの自由さをわざと制限する工夫の総称です。代表的なのは、誤差関数に重みの大きさに応じたペナルティを足し込む方法です。ペナルティが加わると、誤差を小さくしたいという力と重みを大きくしたくないという力がつり合うところで学習が落ち着くので、極端に大きな重みを使って訓練データを丸暗記することができなくなります。シラバスの14番には、L0正則化・L1正則化・L2正則化・正則化・ドロップアウト・ラッソ回帰・リッジ回帰の7つが並んでいます。
L0正則化は、値が0でない重みの個数そのものをペナルティにします。考え方は素直ですが、個数は微分できないので、勾配を使う学習にそのまま組み込むのは難しい手法です。L1正則化は重みの絶対値の和をペナルティにします。この形だと重みがちょうど0の点まで押し込まれやすく、使われない特徴が自動的に落ちるので、特徴選択の効果があります。値の多くが0である状態をスパースといいます。L2正則化は重みの二乗和をペナルティにします。全体の重みを小さくそろえる働きはありますが、0に近づけはしてもぴったり0にはなりにくいのが特徴です。線形回帰にL1正則化を組み合わせたものをラッソ回帰、L2正則化を組み合わせたものをリッジ回帰と呼びます。L1とラッソ、L2とリッジの対応は取り違えやすいので、必ずセットで覚えてください。
ドロップアウトは、学習のたびに隠れ層のユニットを一定の割合でランダムに無効にしてしまう手法です。毎回すこしずつ違う形のネットワークで学習することになるので、特定のユニットの組み合わせに頼りきった覚え方ができなくなり、結果として多数のモデルを平均したような効果が生まれます。無効にするのは学習のときだけで、推論のときはすべてのユニットを使います。ここで注意したいのが分類の位置です。名前が似ているので正規化層の仲間だと思われがちですが、シラバスではドロップアウトは14番の正則化に置かれています。19番の正規化層に並ぶのはバッチ正規化・レイヤー正規化・インスタンス正規化・グループ正規化の4つで、ドロップアウトは入っていません。
重みをどう動かすかを決めるのが最適化手法です。基本になるのは勾配降下法で、誤差関数の勾配を求め、その逆の方向へ重みを少しずつ動かします。この少しずつの幅を決めるのが学習率です。学習率が大きすぎると谷を飛び越えて発散し、小さすぎるといつまでも底にたどりつきません。1回の更新にどれだけのデータを使うかで呼び方が変わります。全データをまとめて使うのがバッチ学習、1件ずつ使うのがオンライン学習、その中間で数十から数百件のかたまりを使うのがミニバッチ学習です。実務ではミニバッチ学習がほとんどを占めます。データを1周することをエポック、重みを1回更新することをイテレーションと呼びます。1200件のデータをミニバッチのサイズ60で回すなら、1エポックは20イテレーションです。
勾配降下法が止まってしまう場所はひとつではありません。全体で最も誤差が小さい点を大域最適解、その付近でだけ最も小さい点を局所最適解といいます。さらに、ある方向から見れば谷底なのに別の方向から見れば山頂になっている点があり、これを鞍点といいます。パラメータの数が非常に多いディープラーニングでは、あらゆる方向で同時に谷底になる局所最適解よりも、鞍点にはまって動けなくなるほうが起こりやすいと考えられています。確率的勾配降下法(SGD)は一部のデータだけで勾配を求めるためにばらつきが乗り、そのゆらぎのおかげで鞍点や浅い局所最適解から抜け出しやすいという利点があります。
SGDの弱点を補う工夫は、大きく2つの系統に分かれます。ひとつはモーメンタムで、前回の更新量を慣性として足し込み、行きつ戻りつする振動を抑えて谷に沿ってすべり下りるようにします。もうひとつは学習率をパラメータごとに自動で調整する系統です。AdaGradは、それまでの更新が大きかったパラメータほど学習率を下げますが、下げ続けるので後半に動かなくなるという弱点があります。RMSpropは過去の勾配を指数移動平均で見ることで、この下がりすぎを緩めました。Adamはこの2系統、つまり慣性の考え方と学習率の適応を組み合わせたもので、実務の既定値としてよく使われます。シラバスにはこのほかAdaDelta・AdaBound・AMSBoundも挙がっています。
学習率やミニバッチのサイズ、層の数のように、学習で決まるのではなく人が事前に決める値をハイパーパラメータといいます。良い値を探す代表的な方法は2つあります。グリッドサーチは候補の値を格子状に並べてすべての組み合わせを試す方法で、網羅的ですが組み合わせの数が急激に増えます。ランダムサーチは範囲の中からランダムに点を選んで試す方法で、効いていないハイパーパラメータに試行を浪費しにくいという利点があります。学習を打ち切る時期の決め方もひとつの工夫で、検証データの誤差が悪化に転じたところで止めるやり方を早期終了といいます。なお、あらゆる問題で他より優れた万能のアルゴリズムは存在しないという主張をノーフリーランチの定理といい、手法選びは問題ごとに考えるほかないことを示しています。
モデルを大きくするほど過学習して悪くなるという直感に反する現象も知られています。二重降下現象といい、モデルの大きさや学習の量を増やしていくと検証誤差はいったん悪化し、さらに増やすと再び下がりはじめます。誤差の曲線が2回下がるのでこの名前がつきました。大きなモデルほど良い結果が出ることがある、という近年の経験を説明する枠組みのひとつとして、シラバス16番に収録されています。
最適化手法の系譜| 手法 | 工夫のしかた | 位置づけ |
|---|
| 確率的勾配降下法(SGD) | 一部のデータだけで勾配を求めて更新する | 最も基本的な更新のしかた |
| モーメンタム | 前回の更新量を慣性として足し込む | 振動を抑えて収束を速める系統 |
| AdaGrad | 更新が大きかったパラメータほど学習率を下げる | 学習率を適応させる系統の出発点 |
| RMSprop | 過去の勾配を指数移動平均で見て減衰をゆるめる | AdaGradの学習率が下がりすぎる点への対処 |
| Adam | 慣性と学習率の適応を組み合わせる | AdaDelta・AdaBound・AMSBoundと並ぶ発展形 |
用語
- 正則化
- モデルの自由さをわざと制限して過学習を抑える工夫の総称。誤差関数にペナルティを加える方法が代表的。
- L0正則化
- 値が0でない重みの個数そのものをペナルティにする正則化。微分できないので勾配を使う学習には組み込みにくい。
- L1正則化
- 重みの絶対値の和をペナルティにする正則化。重みがちょうど0になりやすく、特徴選択の効果がある。
- L2正則化
- 重みの二乗和をペナルティにする正則化。重みを小さくそろえるが、ぴったり0にはなりにくい。
- ラッソ回帰
- 線形回帰にL1正則化を組み合わせた手法。不要な特徴の係数が0になり、スパースな解が得られる。
- リッジ回帰
- 線形回帰にL2正則化を組み合わせた手法。係数全体を小さく抑えて過学習を防ぐ。
- ドロップアウト
- 学習時にユニットをランダムに無効化して過学習を抑える手法。シラバスでは正規化層ではなく14番の正則化に分類される。
- 勾配降下法
- 誤差関数の勾配の逆方向へパラメータを少しずつ動かして誤差を小さくしていく最適化の基本手法。
- 学習率
- 1回の更新でパラメータをどれだけ動かすかを決めるハイパーパラメータ。大きすぎると発散し、小さすぎると進まない。
- バッチ学習
- 全データを使って勾配を求め、1回だけ更新する学習の進め方。1回の更新は安定するが計算が重い。
- オンライン学習
- データを1件使うたびにパラメータを更新する学習の進め方。更新は軽いが1回ごとのばらつきが大きい。
- ミニバッチ学習
- 数十から数百件のかたまりごとにパラメータを更新する学習の進め方。実務で最も広く使われる。
- エポック
- 訓練データ全体を1周すること。何周させるかは代表的なハイパーパラメータのひとつ。
- イテレーション
- パラメータを1回更新すること。1エポックあたりのイテレーション数は、データ件数をミニバッチのサイズで割った値になる。
- 鞍点
- ある方向から見れば極小、別の方向から見れば極大になっている点。高次元では学習が停滞する主な原因とされる。
- 局所最適解
- その近くの範囲では最も誤差が小さいが、全体で見ればもっと良い点が別にある解。
- 大域最適解
- 取りうる範囲全体の中で誤差が最も小さい解。
- モーメンタム
- 前回の更新量を慣性として加え、振動を抑えて収束を速める工夫。
- AdaGrad
- 更新が大きかったパラメータほど学習率を下げる適応的な手法。学習率が下がり続けて止まりやすい弱点がある。
- RMSprop
- 過去の勾配を指数移動平均で見ることで、AdaGradの学習率が下がりすぎる弱点を緩めた手法。
- Adam
- 慣性の考え方と学習率の適応を組み合わせた最適化手法。実務の既定値としてよく使われる。
- ハイパーパラメータ
- 学習で決まるのではなく、人が事前に決める設定値。学習率、ミニバッチのサイズ、層の数などが該当する。
- グリッドサーチ
- 候補の値を格子状に並べ、すべての組み合わせを試すハイパーパラメータの探索方法。
- ランダムサーチ
- 探索範囲からランダムに点を選んで試すハイパーパラメータの探索方法。効かない項目に試行を浪費しにくい。
- 早期終了
- 検証データの誤差が悪化に転じた時点で学習を打ち切ること。過学習が進む前に止める工夫。
- ノーフリーランチの定理
- あらゆる問題で他より優れた万能のアルゴリズムは存在しないという主張。
- 二重降下現象
- モデルの大きさや学習量を増やしていくと、検証誤差がいったん悪化してから再び下がる現象。
例題
例題:訓練データ4800件を、ミニバッチのサイズ80で5エポック学習させた。重みは何回更新されるか。
答えと考え方 1エポックあたりのイテレーション数は 4800 わる 80 で60回、これを5エポック行うので合計300回になる。エポックはデータを何周したか、イテレーションは重みを何回更新したかを数える単位で、両者はミニバッチのサイズを介して結びついている。ミニバッチのサイズを大きくすると1エポックあたりの更新回数が減り、1回の勾配は安定するが更新の回数が足りなくなることがある。逆に小さくすると更新は増えるが1回ごとのばらつきが大きくなる。この綱引きがミニバッチのサイズというハイパーパラメータの中身である。
例題:訓練データでの誤差はどんどん下がるのに、検証データでの誤差が途中から上がりはじめた。どの引き出しを開けるべきか。
答えと考え方 過学習が起きているので、正則化の引き出しを開ける。誤差関数にペナルティを足すならL1正則化かL2正則化で、不要な特徴を落として説明しやすいモデルにしたいならL1正則化、全体をなだらかに抑えたいならL2正則化を選ぶ。ニューラルネットワークならドロップアウトも使える。学習の進め方の側では、検証誤差が悪化に転じたところで打ち切る早期終了が単純で効く。なお学習率を上げても過学習は直らない。学習率は谷をどれくらいの歩幅で下るかの設定であって、モデルの自由さを制限する仕組みではないからである。
出典・根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 16. 最適化手法
3. ディープラーニングの要素技術
畳み込み層から正規化層、回帰結合層、Attentionまで、深いモデルを組み立てる部品を順に見ていきます。
全結合層は、前の層のすべてのユニットと次の層のすべてのユニットを重みでつなぐ、いちばん素朴な層です。表現力は高いのですが、つなぎ方が総当たりなので重みの数が入力の大きさと出力の大きさのかけ算で増えていきます。画像のように入力の要素数が数万を超えるデータに全結合層をそのまま当てると、パラメータが膨れ上がって学習できません。畳み込み層は、小さなフィルタを画像の上で滑らせながら同じ重みを使い回すことでこの問題を解きます。つながるのは近くの画素だけ、しかも重みは場所を変えても同じものを使う。この2つの性質のおかげで、パラメータの数を大幅に減らしながら、画像のどこに写っていても同じ特徴を拾えるようになります。
畳み込みの部品には名前が付いています。フィルタあるいはカーネルは、滑らせる小さな重みの並びです。ストライドは、そのフィルタを1回に何画素ずつずらすかという移動の幅で、大きくすると出力が粗くなり計算も軽くなります。パディングは、入力の周囲をあらかじめ値で埋めておく処理で、これをしないと畳み込みのたびに出力が小さくなり、端の画素が中央の画素より参照される回数が少なくなってしまいます。フィルタを1枚通した結果として得られる出力が特徴マップです。シラバスにはこのほか、フィルタの要素のあいだをすかして受け取る範囲を広げるDilated ConvolutionとAtrous Convolution、空間方向とチャネル方向の畳み込みを分けて計算量を減らすDepthwise Separable Convolutionが挙げられています。
正規化層は、中間層の出力の分布をそろえて学習を安定させ、速くするための層です。バッチ正規化は、ミニバッチの中で同じチャネルの値をまとめて平均0・分散1に整えます。ミニバッチのサイズが小さいと統計量が当てにならなくなるのが弱点です。レイヤー正規化は、1つのサンプルの中で層全体の値をまとめて整えるのでミニバッチのサイズに左右されず、系列を扱うモデルでよく使われます。インスタンス正規化はサンプルごと・チャネルごとに整えるもので画像の様式変換などで使われ、グループ正規化はチャネルをいくつかの組に分けて組ごとに整えます。シラバスでは19番の名前がv1.1で正則化層から正規化層に変わっています。似た名前のドロップアウトは、ここではなく14番の正則化に置かれている点に注意してください。
プーリング層は、決まった大きさの領域をひとつの代表値に縮約する層です。領域の最大値をとるのが最大値プーリング、平均をとるのが平均値プーリングです。縮約すると解像度が下がって計算が軽くなりますが、それ以上に大事なのが不変性の獲得です。被写体が数画素ずれても代表値はあまり変わらないので、位置のわずかなずれに強いモデルになります。グローバルアベレージプーリング(GAP)は、特徴マップ1枚をまるごと平均して1つの値に潰すもので、最後に全結合層を積む代わりに使うとパラメータを大きく減らせます。プーリング層には学習する重みがない点も、畳み込み層との違いとして押さえておくとよいでしょう。
層を深く積むほど表現力は上がるはずなのに、実際にはある深さを超えると学習がうまく進まなくなります。スキップ結合は、いくつかの層を飛び越して入力をそのまま先の層の出力に足し込む配線で、この行き詰まりを解きました。勾配が浅い経路をたどって入力側まで届くようになるため、100層を超えるネットワークでも学習できます。この考え方を採り入れた代表的なモデルがResNetです。シラバスでは21番のキーワードがResNetだけで、26番の画像認識にも再び登場します。
回帰結合層は、前の時刻の状態を自分の入力に戻す配線を持つ層で、これを備えたネットワークをリカレントニューラルネットワーク(RNN)といいます。文章や音声、株価のような時系列データを、順番を保ったまま扱えるのが特長です。戻す先の違いで名前が分かれ、隠れ層の出力を次の時刻の隠れ層に戻すのがエルマンネットワーク、出力層の出力を次の時刻の隠れ層に戻すのがジョルダンネットワークです。学習は時間方向にネットワークを展開してから誤差逆伝播法を適用するBPTTで行いますが、長い系列では時間の方向に何度もさかのぼるため勾配消失問題と勾配爆発問題が強く出ます。系列を先頭からと末尾からの両方向で読むのが双方向RNN、学習時に前ステップの予測ではなく正解を次の入力として与えるのが教師強制です。
この勾配の問題に、ゲート機構という答えを出したのがLSTMです。LSTMは情報をためておくCECという記憶の経路を持ち、そこへ何を書き込むかを決める入力ゲート、何を捨てるかを決める忘却ゲート、何を外へ出すかを決める出力ゲートの3つのゲートで出し入れを制御します。GRUはLSTMを簡略化したもので、ゲートはリセットゲートと更新ゲートの2つだけです。パラメータが少なく計算が軽い一方、常にLSTMより高性能というわけではありません。ゲートの数が3と2であること、CECはLSTM側の用語であることが、繰り返し問われる区別です。
Attentionは、入力のどこに注目すべきかを重みとして計算する仕組みです。クエリ・キー・バリューの3つで表現し、クエリとキーの相性から重みを決めて、その重みでバリューを混ぜ合わせます。同じ系列の中で各要素どうしの関係を計算するのがSelf-Attention、翻訳のように別々の2つの系列のあいだで計算するのがSource-Target Attentionです。複数の注目のしかたを並列に走らせて結果をまとめるのがMulti-Head Attentionです。この仕組みだけでネットワークを組み上げたのがTransformerで、回帰結合を使わないので系列全体を並列に計算でき、離れた語どうしの関係も直接つかめます。ただし並列に処理すると語の順番の情報が失われるので、各位置に固有の信号を足す位置エンコーディングで語順を与えます。TransformerはRNNの一種ではない、という点が引っかけどころです。
オートエンコーダは、入力をいったん低い次元に圧縮し、そこから元の入力を復元するように学習するネットワークです。出力に入力と同じものを置くので、正解ラベルを用意しなくても学習でき、次元削減や特徴の抽出に使えます。層を重ねたものが積層オートエンコーダで、これを1層ずつ学習させて深いネットワークの初期値を作るやり方が事前学習です。変分オートエンコーダ(VAE)は、圧縮した先を1点ではなく確率分布として学ぶ点が違い、その分布から取り出した値を復元することで新しいデータを生成できます。シラバスにはVQ-VAE・info VAE・β-VAEも挙げられています。
データ拡張は、手元のデータに変換を加えて水増しし、過学習を抑えて汎化性能を上げる工夫です。画像では、左右を反転するRandom Flip、回転させるRotate、一部を切り出すCrop、明るさを変えるBrightness、コントラストを変えるContrast、一部を四角く塗りつぶすCutoutやRandom Erasing、2枚の画像を重ね合わせるMixup、2枚の一部を貼り合わせるCutMix、どの変換をどれだけかけるかを自動で決めるRandAugumentが挙げられています。テキストでは言い換えを作るparaphrasing、ノイズを混ぜるnoisingがあります。ここで気をつけたいのは、意味を壊す変換を選ばないことです。手書き数字を上下反転すれば、それはもうその数字ではありません。
層の種類と役割| 層の種類 | 何をするか | シラバスのキーワード |
|---|
| 全結合層 | 前の層のすべてのユニットと重みでつなぐ | 重み, 線形関数 |
| 畳み込み層 | フィルタを滑らせて局所的な特徴を取り出す | カーネル, ストライド, パディング, 特徴マップ, CNN |
| 正規化層 | 中間層の出力の分布をそろえて学習を安定させる | バッチ正規化, レイヤー正規化, インスタンス正規化, グループ正規化 |
| プーリング層 | 領域を代表値に縮約して位置ずれに強くする | 最大値プーリング, 平均値プーリング, GAP, 不変性の獲得 |
| 回帰結合層 | 前の時刻の状態を戻して系列を扱う | RNN, LSTM, GRU, BPTT, 教師強制, 双方向RNN |
用語
- 全結合層
- 前の層のすべてのユニットと次の層のすべてのユニットを重みでつなぐ層。重みの数が多くなりやすい。
- 畳み込み層
- 小さなフィルタを滑らせながら同じ重みを使い回して局所的な特徴を取り出す層。パラメータが少なく済む。
- ストライド
- フィルタを1回に何画素ずつずらすかという移動の幅。大きくすると出力が粗くなり計算が軽くなる。
- パディング
- 入力の周囲をあらかじめ値で埋めておく処理。出力サイズの縮小を抑え、端の情報が失われにくくなる。
- 特徴マップ
- フィルタを1枚通した結果として得られる出力。どこにその特徴があったかを示す。
- バッチ正規化
- ミニバッチの中で同じチャネルの値をまとめて平均0・分散1に整える正規化。ミニバッチが小さいと不安定になる。
- レイヤー正規化
- 1つのサンプルの中で層全体の値をまとめて整える正規化。ミニバッチのサイズに左右されない。
- 最大値プーリング
- 領域の中の最大値を代表値としてとるプーリング。位置のわずかなずれに強くなる。
- グローバルアベレージプーリング(GAP)
- 特徴マップ1枚をまるごと平均して1つの値に潰す操作。全結合層の代わりに使うとパラメータを減らせる。
- 不変性の獲得
- 被写体の位置が多少ずれても出力が変わりにくくなること。プーリング層の重要な役割。
- スキップ結合
- いくつかの層を飛び越して入力を先の層の出力に足し込む配線。勾配が浅い経路を通れるので深いモデルでも学習できる。
- ResNet
- スキップ結合を採り入れ、100層を超える深さの学習を可能にした画像認識モデル。
- エルマンネットワーク
- 隠れ層の出力を次の時刻の隠れ層に戻す形のリカレントニューラルネットワーク。
- ジョルダンネットワーク
- 出力層の出力を次の時刻の隠れ層に戻す形のリカレントニューラルネットワーク。
- BPTT
- 時間方向にネットワークを展開してから誤差逆伝播法を適用する、RNNの学習方法。
- 教師強制
- 系列を生成する学習で、前ステップの予測ではなく正解を次の入力として与えるやり方。
- LSTM
- CECという記憶の経路と、入力・忘却・出力の3つのゲートを持つ回帰結合層。長い依存関係を保持できる。
- GRU
- LSTMを簡略化し、リセットゲートと更新ゲートの2つだけにした回帰結合層。パラメータが少なく計算が軽い。
- Self-Attention
- 同じ系列の中で各要素どうしの関係を計算するAttention。Transformerの中心的な部品。
- Source-Target Attention
- 別々の2つの系列のあいだで注目の重みを計算するAttention。翻訳のような入力と出力が分かれるタスクで使う。
- Transformer
- 回帰結合を使わずAttentionを中心に構成した系列モデル。並列に計算でき、位置エンコーディングで語順を与える。
- 位置エンコーディング
- 系列の各位置に固有の信号を足して語順の情報を与える仕組み。Transformerで必要になる。
- オートエンコーダ
- 入力を低い次元に圧縮してから元の入力を復元するように学習するネットワーク。次元削減や事前学習に使う。
- 変分オートエンコーダ(VAE)
- 圧縮した先を1点ではなく確率分布として学ぶオートエンコーダ。分布から取り出した値を復元して新しいデータを作れる。
- データ拡張
- 手元のデータに変換を加えて水増しし、過学習を抑えて汎化性能を上げる工夫。Mixup・CutMix・Cutoutなどがある。
例題
例題:手書き数字の分類器を作っている。学習データが少ないのでデータ拡張をしたい。左右反転と上下反転を入れてよいか。
答えと考え方 どちらも入れてはいけない。手書き数字を左右に反転すれば2は2に見えなくなり、上下に反転すれば6と9の関係が壊れる。正解ラベルはそのままなのに中身だけが別のものになるので、モデルには矛盾した例を教えることになる。データ拡張で使ってよいのは、人が見てもラベルが変わらない範囲の変換に限られる。手書き数字なら、わずかな回転、平行移動、線の太さや明るさの変化あたりが安全である。逆に、自然物の写真の分類のように左右の向きに意味がない対象であれば、左右反転は有効な水増しになる。どの変換が使えるかはタスクとデータで決まる、というのがこの中項目の目標にあたる。
例題:リカレントニューラルネットワークで長い文章を読ませたところ、文の後半にいくほど前半に書かれていた内容が効かなくなった。何が起きていて、どの部品で対処するか。
答えと考え方 時間の方向にさかのぼる学習で勾配が縮んでいる。BPTTでは系列の長さだけ誤差を過去へ運ぶので、100語前まで届くころには勾配がほとんど残らず、遠い過去との結びつきが学習されない。逆に勾配が発散してしまうこともあり、これが勾配爆発問題である。対処はゲート機構を持つ層に替えることで、LSTMは情報をためておくCECという経路を持ち、何を書き込み何を捨て何を出すかをゲートで制御するので、遠い過去の情報を必要なあいだ保てる。GRUはこれを簡略化した軽い選択肢である。文全体を一度に見てよいのであれば、そもそも回帰結合を使わずAttentionで組む道もある。
出典・根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 23. Attention
4. ディープラーニングの応用例
画像・言語・音声・強化学習・生成から、転移学習・マルチモーダル・解釈性・軽量化までを、代表モデルの名前とともに押さえます。
画像認識といっても、何を出力するかでタスクは分かれます。画像1枚に何が写っているかのクラスを答えるのが物体識別、あらかじめ決めた種類に限らず一般的な物体を認識することを一般物体認識といいます。物体を四角い枠で囲んで位置とクラスを答えるのが物体検出、画素ひとつひとつにクラスを割り当てるのがセマンティックセグメンテーションです。セマンティックセグメンテーションでは同じクラスの物体が2つ並んでいても区別されませんが、個体まで分けるのがインスタンスセグメンテーションです。この2つを合わせて、数えられる物体は個体ごとに、空や道路のように数えられない領域はクラスごとに塗り分けるのがパノプティックセグメンテーションです。人体の関節点の位置を求めるのが姿勢推定で、Open Poseが代表例です。
画像認識モデルの流れも押さえておきましょう。AlexNetは2012年のILSVRCで優勝し、ReLU関数・ドロップアウト・GPUによる学習を組み合わせて従来手法に大差をつけました。2014年のILSVRCではVGGとGoogLeNetが上位に入り、VGGは3かける3の小さな畳み込みだけを積み重ねる単純で深い構成、GoogLeNetは大きさの違うフィルタを並列に当てるInceptionモジュールでパラメータを抑えたまま深くする構成をとりました。2015年にはスキップ結合を使ったResNetが登場し、100層を超える深さが現実になります。以降はResNetの幅を広げたWide ResNet、すべての層をつなぐDenseNet、チャネルの重要度を学習するSENet、深さ・幅・解像度の釣り合いを取ったEfficientNet、携帯端末向けに軽くしたMobileNetやMnasNet、そして構造そのものを探索させるNASへと広がりました。畳み込みを使わずTransformerの考え方を画像に持ち込んだのがVision Transformerです。
物体検出のモデルは、処理の段数で2つに分かれます。YOLOとSSDは、候補領域の抽出とクラスの判定をまとめて1回の推論で行う1段階の方式で、速さが持ち味です。R-CNNから始まりFast R-CNN、Faster R-CNNと発展した系統は、まず候補領域を出してから分類するという2段階の方式で、遅い代わりに精度が出やすい傾向があります。Mask R-CNNはFaster R-CNNに画素単位の予測を足したもので、インスタンスセグメンテーションまで行えます。セグメンテーション側の代表はFCN、SegNet、U-Net、PSPNet、DeepLabで、U-Netはエンコーダとデコーダをスキップ結合でつないだU字の構造を持ち、医用画像でよく使われます。U-Netは物体検出のモデルではない、という点を取り違えないでください。異なる解像度の特徴を組み合わせるFPNも収録語です。
自然言語処理は、文を単語に切り分ける形態素解析、語のかかり受けを調べる構文解析といった下ごしらえから始まります。単語をどうベクトルにするかが次の課題で、いちばん素朴なのが1語に1つの次元を割り当てるワンホットベクトルですが、次元が語彙の大きさになるうえ、どの語とどの語が似ているかという情報を持ちません。文書を語の出現回数の集まりとして扱うBoW、語の重要度を文書内の頻度と文書をまたいだ珍しさから測るTF-IDF、連続するn個の語の並びを単位とするn-gramも古典的な扱い方です。これらに対して、語を密なベクトルで表す分散表現を学習するのがword2vecで、周辺の語から中心の語を当てるCBOWと、中心の語から周辺の語を当てるスキップグラムの2方式があります。向きが逆なので取り違えに注意してください。単語を部分文字列に分けて扱うfastText、文脈に応じてベクトルを変えるELMoと続きます。
系列を入力して系列を出力する枠組みがSeq2Seqで、機械翻訳や文書要約に使われます。ここにAttentionとTransformerが加わって性能が大きく伸びました。BERTはTransformerのエンコーダを使い、文の前後の両方向から文脈を見て事前学習する言語モデルです。双方向であることがBERTの特徴で、大量のテキストで事前学習してから各タスクに適応させるという使い方を広めました。PaLMや、より一般に大規模言語モデル(LLM)もシラバスの27番に置かれています。GLUEは言語理解の能力を複数のタスクでまとめて測るベンチマークです。応用のタスクとしては感情分析、機械翻訳、質問応答、情報検索、文書要約が挙がっています。
音声処理では、まずマイクで拾った空気の振動を数値の列に直します。標本化と量子化を行うA-D変換、その代表的な方式であるパルス符号変調器(PCM)がここに当たります。時間の波形を周波数の成分に分けるのが高速フーリエ変換(FFT)で、そこから声道の共鳴による山であるフォルマントやフォルマント周波数、周波数ごとの大まかな形であるスペクトル包絡を読み取ります。人の聞こえ方に合わせた尺度がメル尺度で、これを使って作る代表的な特徴量がメル周波数ケプストラム係数(MFCC)です。言語の音の単位が音素、それより広い音の単位が音韻です。古くは隠れマルコフモデルが音声認識の中心で、現在は音声の波形を直接生成するWaveNetや、入力と出力の長さがそろわない系列を学習させるCTCが使われます。話者識別や感情分析も音声処理のタスクです。
強化学習にディープラーニングを組み合わせたのが深層強化学習です。DQNは行動価値関数をニューラルネットワークで近似し、画面の画像だけからゲームを学習させました。過大評価を抑えるダブルDQN、状態の価値と行動の優位性を分けて扱うデュエリングネットワーク、探索のためのノイズを重みに入れるノイジーネットワーク、こうした改良をまとめたRainbowと発展します。複数の環境を並列に走らせるA3CやAPE-X、その延長のAgent57、方策を安定して更新するPPO、複数のエージェントが同時に学ぶマルチエージェント強化学習(MARL)、報酬の与え方を工夫する報酬成形も収録語です。実機での学習は危険で高くつくため、模擬環境で学んで実機へ移すsim2realや、模擬環境の見た目や物理をわざとばらつかせるドメインランダマイゼーションが使われます。人間のフィードバックから報酬モデルを作って言語モデルを調整するRLHFは、自然言語処理ではなくこの29番の深層強化学習に置かれています。
データ生成では、敵対的生成ネットワーク(GAN)がよく知られています。データを作り出す側のネットワークと、本物か作られたものかを見分ける側のネットワークを競わせながら学習させる仕組みで、畳み込みを使うDCGAN、対になっていない2群の画像を相互に変換するCycleGAN、線画から写真のように対応づけて変換するPix2Pixが派生しました。Diffusion Modelは考え方がまったく違い、画像に少しずつノイズを加えていく過程を逆にたどることで、ノイズから画像を作り出します。GANの一種ではありません。NeRFは複数の視点の写真から三次元の見え方を学び、任意の視点の画像を作ります。前の講義で扱った変分オートエンコーダ(VAE)も生成の手法のひとつで、GANとVAEとDiffusion Modelは並列に置かれる別々の系統だと整理してください。
大量のデータで事前学習した事前学習済みモデルを、手元の小さなタスクに使い回すのが転移学習とファインチューニングです。転移学習は、事前学習で得た特徴の抽出部分は固定したまま、主に出力層のあたりだけを新しいタスクで学習します。ファインチューニングは、重みの全体または広い範囲を新しいデータで学習し直します。ファインチューニングのほうが必要なデータも計算も多くなり、元のタスクで身についていた能力が失われる破滅的忘却が起こることがあります。少ない事例で適応させることをFew-shot、1例だけならOne-shotといい、事例を1つも与えないZero-shotは32番のマルチモーダルに置かれています。ラベルのないデータから疑似的な問題を作って学ぶ自己教師あり学習、少数のラベルと大量の未ラベルデータを併せて使う半教師あり学習も、この31番の収録語です。
画像と言語のように、種類の違う情報をまとめて扱うのがマルチモーダルです。CLIPは画像と説明文を同じベクトル空間に対応づけ、DALL-Eは文から画像を作ります。画像に説明文を付けるImage Captioning、画像について質問に答えるVisual Question Answering、文から画像を作るText-To-Image、複数の入出力形式をひとつのモデルで扱うUnified-IOやFlamingoも収録語です。ここで押さえておきたいのが基盤モデルの置き場所です。大量のデータで事前学習し、さまざまな下流のタスクに転用できる大規模なモデルを基盤モデルといいますが、シラバスではこの語が32番のマルチモーダルに置かれています。大規模言語モデル(LLM)は27番の自然言語処理、RLHFは29番の深層強化学習で、生成AIまわりの語は3か所に散っていることになります。
最後に、作ったモデルを実際に使うための2つの論点です。ひとつはモデルの解釈性で、なぜその判断になったのかを人が理解できる形で示す取り組みを説明可能AI(XAI)といいます。個々の予測の近くで単純なモデルを当てはめて説明するLIME、協力ゲーム理論の考え方で各特徴の寄与を配分するSHAP、特徴の値をわざと入れ替えて精度の落ち方を見るPermutation Importance、画像のどこを見て判断したかを熱の地図で示すCAMとGrad-CAMが挙げられています。もうひとつはモデルの軽量化です。大きな教師モデルの出力を小さなモデルに学ばせる蒸留、寄与の小さい結合や層を削るプルーニング、重みを表す数値の精度を落とす量子化があり、これらをまとめてモデル圧縮といいます。大きなネットワークの中には単独で学習させても同等の性能に届く部分ネットワークが含まれている、という宝くじ仮説はプルーニングの背景にある考え方です。軽量化が求められる典型が、端末側で推論を動かすエッジAIです。
画像認識のタスクと代表モデル| タスク | 何を出力するか | 代表的なモデル |
|---|
| 物体識別 | 画像1枚に写っている物体のクラス | AlexNet, VGG, GoogLeNet, ResNet |
| 物体検出 | 物体を囲む枠とそのクラス | YOLO, SSD, Faster R-CNN |
| セマンティックセグメンテーション | 画素ごとのクラス | FCN, SegNet, U-Net, PSPNet, DeepLab |
| インスタンスセグメンテーション | 画素ごとのクラスと個体の区別 | Mask R-CNN |
| 姿勢推定 | 人体の関節点の位置 | Open Pose |
用語
- 物体検出
- 画像の中の物体を枠で囲み、位置とクラスを同時に答えるタスク。YOLO・SSD・R-CNN系が代表。
- セマンティックセグメンテーション
- 画素ひとつひとつにクラスを割り当てるタスク。同じクラスの個体どうしは区別しない。
- インスタンスセグメンテーション
- 画素ごとのクラスに加えて、同じクラスの物体を個体ごとに分けるタスク。Mask R-CNNが代表。
- AlexNet
- 2012年のILSVRCで優勝した画像認識モデル。ReLU関数・ドロップアウト・GPU学習を組み合わせた。
- VGG
- 3かける3の小さな畳み込みだけを積み重ねた、単純で深い構成の画像認識モデル。
- GoogLeNet
- 大きさの違うフィルタを並列に当てるInceptionモジュールを用い、パラメータを抑えたまま深くしたモデル。
- YOLO
- 候補領域の抽出とクラス判定を1回の推論でまとめて行う1段階の物体検出モデル。SSDも同じ系統。
- Faster R-CNN
- 候補領域を出してから分類する2段階の物体検出モデル。Mask R-CNNはこれに画素単位の予測を加えたもの。
- U-Net
- エンコーダとデコーダをスキップ結合でつないだU字構造のモデル。セマンティックセグメンテーションに用いる。
- ワンホットベクトル
- 1語に1つの次元を割り当てる素朴な単語表現。次元が語彙の大きさになり、語どうしの近さを表せない。
- 分散表現
- 単語を密なベクトルで表す表現。意味の近い語がベクトル空間で近くに配置される。
- CBOW
- word2vecの方式のひとつ。周辺の語から中心の語を当てるように学習する。
- スキップグラム
- word2vecの方式のひとつ。中心の語から周辺の語を当てるように学習する。
- TF-IDF
- 語の重要度を、文書内での出現頻度と文書をまたいだ珍しさから測る指標。
- BERT
- Transformerのエンコーダを用い、前後の両方向から文脈を見て事前学習する言語モデル。
- 大規模言語モデル(LLM)
- 大量のテキストで学習した非常に大きな言語モデル。シラバスでは27番の自然言語処理に置かれている。
- メル周波数ケプストラム係数(MFCC)
- 人の聞こえ方に合わせたメル尺度をもとに作る、音声処理の代表的な特徴量。
- DQN
- 行動価値関数をニューラルネットワークで近似する深層強化学習の代表手法。
- RLHF
- 人間のフィードバックから報酬モデルを作り、強化学習でモデルを調整する手法。シラバスでは29番の深層強化学習に置かれている。
- 敵対的生成ネットワーク(GAN)
- データを作る側と見分ける側のネットワークを競わせて学習させる生成モデル。DCGAN・CycleGAN・Pix2Pixが派生。
- Diffusion Model
- ノイズを段階的に加える過程を逆にたどってデータを生成するモデル。GANとは別の系統。
- 転移学習
- 事前学習済みモデルの特徴抽出部分を流用し、主に出力層のあたりを新しいタスクで学習する方法。
- ファインチューニング
- 事前学習済みモデルの重みの全体または広い範囲を、新しいデータで学習し直す方法。
- 破滅的忘却
- 新しいタスクを学習した結果、以前のタスクでの性能が大きく落ちてしまう現象。
- 基盤モデル
- 大量のデータで事前学習し、多様な下流タスクに転用できる大規模なモデル。シラバスでは32番のマルチモーダルに置かれている。
- 説明可能AI(XAI)
- モデルの判断根拠を人が理解できる形で示す取り組み。LIME・SHAP・CAM・Grad-CAMなどの手法がある。
- 蒸留
- 大きな教師モデルの出力を小さなモデルに学ばせる軽量化の手法。
- プルーニング
- 寄与の小さい結合や層を削ってモデルを小さくする軽量化の手法。
- 量子化
- 重みを表す数値の精度を落としてモデルを小さく速くする軽量化の手法。
- 宝くじ仮説
- 大きなネットワークの中に、単独で学習させても同等の性能に届く部分ネットワークが含まれているという仮説。
例題
例題:工場の検査ラインで、傷のある部品を見つけたい。傷がどこにあるかを画素の単位で知りたい場合、どの種類のタスクとして設計すればよいか。
答えと考え方 セマンティックセグメンテーションとして設計する。画素ごとに傷か地の面かのクラスを割り当てるので、傷の形と広がりがそのまま得られる。U-NetやFCN、SegNetがこの系統のモデルである。傷の個数を数えたい、あるいは1つ1つの傷を別々に管理したいのであれば、個体まで分けるインスタンスセグメンテーションを選ぶ。四角い枠だけで足りるなら物体検出、画像に傷があるかないかだけを判定すればよいなら物体識別で足りる。どこまでの粒度が業務に必要かで、選ぶタスクとモデルが決まる。粒度を上げるほど注釈を付ける手間も増えるので、必要のない細かさを求めないことも設計のうちである。
例題:学習済みの大きな画像認識モデルを、通信の届かない現場の端末に載せて動かしたい。どんな手を考えるか。
答えと考え方 端末の側で推論を動かすので、エッジAIの文脈になる。まず考えるのはモデルの軽量化である。大きな教師モデルの出力を小さなモデルに学ばせる蒸留、寄与の小さい結合や層を削るプルーニング、重みを表す数値の精度を落とす量子化の3つが代表で、まとめてモデル圧縮という。組み合わせて使うこともできる。設計の段階から軽さを狙うなら、携帯端末向けに作られたMobileNetやMnasNet、深さと幅と解像度の釣り合いを取ったEfficientNetを土台に選ぶ手もある。どこまで小さくすると精度がどれだけ落ちるかは対象によって違うので、実際の現場のデータで測りながら決めることになる。
出典・根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 26. 画像認識
確認問題(40問)
四肢択一。「正解と解説」を開くと、正解の理由と他の選択肢が違う理由を確認できます。
問1|単純パーセプトロン
単純パーセプトロンについて、正しく述べているものはどれか。
- 隠れ層を複数持ち、非線形な分離ができるので排他的論理和も表現できる
- 時間の方向に状態を戻す配線を持ち、系列データを順番のまま扱うことができる
- 入力層と出力層だけからなり、線形分離可能な問題しか解くことができない
- フィルタを画像の上で滑らせて、局所的な特徴を取り出すことを得意とする
正解と解説
正解:C. 入力層と出力層だけからなり、線形分離可能な問題しか解くことができない単純パーセプトロンは入力層と出力層だけからなる最も単純なニューラルネットワークで、直線1本で分けられる線形分離可能な問題しか解けない。排他的論理和(XOR)は出力が1になる点と0になる点が対角線上に交互に並ぶため、どこに直線を引いても分けられず、単純パーセプトロンでは表現できない。隠れ層を加えて境界を折り曲げられるようにした多層パーセプトロンならXORも表現でき、1つ目の選択肢はその多層パーセプトロンの説明にあたる。前の時刻の状態を戻して系列を扱うのはリカレントニューラルネットワーク、フィルタを滑らせて局所的な特徴を取り出すのは畳み込み層の説明である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 11. ニューラルネットワークとディープラーニング
問2|GPUの適性
GPUがディープラーニングの学習に適しているとされる理由として、最も適切なものはどれか。
- 小さな演算コアを大量に持ち、同じ計算を一斉に並列で処理できるため
- 分岐の多い複雑な処理を、少数の強力なコアで順番に高速にこなせるため
- 学習に使うデータを保存しておく記憶容量が、CPUよりはるかに大きいため
- 誤差逆伝播法で使う連鎖律を、専用の回路として最初から内蔵しているため
正解と解説
正解:A. 小さな演算コアを大量に持ち、同じ計算を一斉に並列で処理できるためディープラーニングの学習は、行列とベクトルのかけ算と足し算を膨大な回数繰り返す計算である。GPUは単純な演算を行う小さなコアを大量に持ち、同じ計算を一斉に並列で回すことに向いているので、この形の計算と相性がよい。分岐の多い処理を少数の強力なコアで順に高速にこなすのはCPUの得意分野で、コアの数は多くない。GPUの利点は記憶容量の大きさではなく並列度である。連鎖律を専用回路として内蔵しているという事実はなく、ディープラーニングのテンソル演算に的をしぼって設計されているのはTPUのほうである。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 11. ニューラルネットワークとディープラーニング
問3|勾配消失の原因
シグモイド関数を隠れ層に使うと勾配消失問題を招きやすいのはなぜか。
- 出力が0から1の範囲に収まるため、層を重ねると出力そのものが0に近づくから
- 負の入力に対して出力が常に0になり、そのユニットが学習しなくなるから
- 出力の総和が1になるよう正規化されるため、値が層ごとに小さくなるから
- 微分の最大値が0.25であり、層をさかのぼるたびにかけ合わされていくから
正解と解説
正解:D. 微分の最大値が0.25であり、層をさかのぼるたびにかけ合わされていくから勾配消失問題は、逆伝播の途中で勾配が0に近づいて入力側の層が学習されなくなる現象である。シグモイド関数は微分の最大値が0.25しかないため、層をさかのぼるたびに0.25以下の数がかけ合わされ、深いネットワークでは勾配がほとんど残らない。問題になるのは出力の値そのものではなく、その微分の大きさである。負の入力に対して勾配が0になり学習が止まるのはReLU関数の弱点で、Leaky ReLU関数はここへの対処にあたる。出力の総和が1になるよう正規化するのはソフトマックス関数である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 12. 活性化関数
問4|ReLU関数
ReLU関数の説明として適切なものはどれか。
- 入力を0から1のあいだに押し込む、S字型の曲線を描く関数である
- 入力が正ならその値をそのまま返し、負なら0を返す関数である
- 入力を-1から1のあいだに収め、原点について対称な形をとる関数である
- 出力の総和が1になるように、すべての出力をまとめて正規化する関数である
正解と解説
正解:B. 入力が正ならその値をそのまま返し、負なら0を返す関数であるReLU関数は、入力が正ならその値をそのまま、負なら0を返す単純な関数である。正の領域では微分が常に1なので、層をさかのぼっても勾配が小さくならず、勾配消失問題を大きく緩和できる。ただし負の領域では微分が0になるため、いったん負側に入ったユニットが学習しなくなることがあり、負側にわずかな傾きを持たせたLeaky ReLU関数が用意されている。0から1に押し込むS字型はシグモイド関数、-1から1で原点対称なのはtanh関数、出力の総和が1になるよう正規化するのはソフトマックス関数の説明である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 12. 活性化関数
問5|Leaky ReLU
Leaky ReLU関数が用意されているのは、ReLU関数のどのような点に対処するためか。
- 負の入力に対して勾配が0になり、そのユニットが学習しなくなること
- 正の入力に対して勾配が1のままで、更新量が大きくなりすぎること
- 出力の総和が1にならないため、確率として解釈できないこと
- 計算に指数関数を含むため、1回あたりの処理が重くなること
正解と解説
正解:A. 負の入力に対して勾配が0になり、そのユニットが学習しなくなることReLU関数は負の領域で出力も微分も0になるので、あるユニットの入力がずっと負のままだと勾配が流れず、そのユニットは二度と学習しなくなる。Leaky ReLU関数は負の側にもわずかな傾きを持たせることで、この行き止まりを避ける。正の領域で勾配が1であることはReLU関数の利点であって欠点ではなく、勾配消失を防いでいるのはまさにこの性質である。出力の総和が1にならないのは活性化関数として当然のことで、確率として読ませたい出力層にはソフトマックス関数を使う。計算に指数関数を含むのはシグモイド関数やtanh関数で、ReLU関数はむしろ計算が軽い。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 12. 活性化関数
問6|ソフトマックス
ソフトマックス関数の代表的な使いどころはどれか。
- 回帰問題の出力層に置き、連続値をそのまま出力する
- 隠れ層の活性化関数として使い、層に非線形性を与える
- 二値分類の出力層に置き、片方のクラスの確率を出す
- 多クラス分類の出力層に置き、各クラスの確率を出す
正解と解説
正解:D. 多クラス分類の出力層に置き、各クラスの確率を出すソフトマックス関数は、出力の総和がちょうど1になるように全体を正規化するので、クラスが3つ以上ある多クラス分類の出力層に置き、各クラスに属する確率として読ませる。誤差関数には交差エントロピーを組み合わせるのが基本である。二値分類の出力層に置いて確率を出すのはシグモイド関数、隠れ層の活性化関数として広く使われるのはReLU関数やtanh関数である。回帰問題では出力層で値をそのまま出し、誤差関数に平均二乗誤差関数を使う。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 12. 活性化関数
問7|回帰の誤差関数
住宅の価格のような連続値を予測する回帰の問題で、誤差関数として選ぶのが基本とされるものはどれか。
- 予測した確率分布と正解の分布のずれを測る交差エントロピー
- 予測と正解の差を二乗して平均していく平均二乗誤差関数
- 3つ組の距離の関係を学ばせるTriplet Loss
- 同じものかどうかを距離で学ばせるContrastive Loss
正解と解説
正解:B. 予測と正解の差を二乗して平均していく平均二乗誤差関数回帰は連続値を当てる問題なので、予測と正解の差をそのまま二乗して平均する平均二乗誤差関数が素直な選択になる。交差エントロピーは確率分布どうしのずれを測る関数で、分類の問題に用いる。多クラス分類なら出力層のソフトマックス関数と組み合わせるのが基本の形である。Triplet Lossは基準と正例と負例の3つ組で距離の関係を、Contrastive Lossは2つのデータが同じものかどうかを距離で学ばせるもので、いずれも似ているかどうかを測る表現を得るための誤差関数である。誤差関数はタスクに応じて選ぶ、というのがこの中項目の目標にあたる。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 13. 誤差関数
問8|3つ組の誤差
誤差関数である Triplet Loss の説明として適切なものはどれか。
- 2つの確率分布のあいだのへだたりを測り、分布を近づけるように働く
- 予測と正解の差を二乗して平均し、値の大きさのずれを直接に測る
- 基準と正例と負例の3つ組を使い、正例が負例より近くなるようにする
- 予測した確率分布と正解の分布のずれを測り、分類の学習に広く使う
正解と解説
正解:C. 基準と正例と負例の3つ組を使い、正例が負例より近くなるようにするTriplet Lossは、基準となるデータ、それと同じ種類のデータ(正例)、異なる種類のデータ(負例)の3つ組を使い、基準と正例の距離が基準と負例の距離より小さくなるように学習させる誤差関数である。似ているかどうかを距離で表す空間を作るときに使われる。2つの確率分布のへだたりを測るのはカルバック・ライブラー情報量(KL)、予測と正解の差を二乗して平均するのは平均二乗誤差関数、確率分布のずれを測って分類に広く使われるのは交差エントロピーである。なお2つのデータの組で同じか違うかを学ばせるContrastive Lossも同じ中項目に収録されている。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 13. 誤差関数
問9|誤差逆伝播法
誤差逆伝播法についての説明として、最も適切なものはどれか。
- 出力層から順に重みを直接書き換えていく、更新そのものの手順である
- 重みを乱数で少しずつ動かし、誤差が減った方向を採用する手順である
- 入力側から出力側へ順に計算を進め、出力を求めるための手順である
- 連鎖律を使い、出力側から入力側へさかのぼって勾配を求める手順である
正解と解説
正解:D. 連鎖律を使い、出力側から入力側へさかのぼって勾配を求める手順である誤差逆伝播法は、合成関数の微分を部品ごとの微分のかけ算に分解する連鎖律を使い、出力側から入力側へさかのぼりながら各重みの勾配を効率よく求める手法である。ここで求まるのはあくまで勾配であり、その勾配を使って重みを実際に動かすのは勾配降下法の役目である。誤差逆伝播法が重みを更新すると言い切ると不正確になるので注意したい。乱数で動かして良い方向を採用するのは勾配を使わない探索の考え方であり、入力側から出力側へ計算を進めるのは順伝播、つまり推論の手順である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 15. 誤差逆伝播法
問10|信用割当問題
最終的な誤差に対して、どの層のどのユニットがどれだけ責任を負うのかを割り当てる問題を何と呼ぶか。
- 信用割当問題
- 勾配消失問題
- 勾配爆発問題
- 次元の呪い
正解と解説
正解:A. 信用割当問題信用割当問題は、出力に現れた誤差の責任を、途中のどの層のどのユニットにどれだけ帰すべきかという問題である。誤差逆伝播法は連鎖律によってこの割り当てを計算可能にしたと位置づけられている。勾配消失問題は、さかのぼるうちに勾配が0に近づいて入力側の層が学習されなくなる現象、勾配爆発問題はその逆に勾配が大きくなりすぎて発散する現象で、どちらも誤差逆伝播法を適用したときに生じる問題である。次元の呪いは特徴量の次元が増えるほど必要なデータが急増する現象で、シラバスでは機械学習の中項目に置かれている。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 15. 誤差逆伝播法
問11|L1正則化
L1正則化の特徴として適切なものはどれか。
- 重みの二乗和をペナルティにし、値を小さくそろえるが0にはしにくい
- 重みの絶対値の和をペナルティにし、値がちょうど0になりやすい
- 学習のたびにユニットをランダムに無効化し、依存の偏りを防ぐ
- 検証データの誤差が悪化に転じた時点で、学習そのものを打ち切る
正解と解説
正解:B. 重みの絶対値の和をペナルティにし、値がちょうど0になりやすいL1正則化は重みの絶対値の和をペナルティとして誤差関数に加える正則化で、重みがちょうど0の点まで押し込まれやすい。その結果、使われない特徴の係数が0になって自動的に落ち、特徴選択の効果が生まれる。この状態をスパースという。重みの二乗和をペナルティにするのはL2正則化で、値を小さくそろえはするが0にはなりにくい。学習時にユニットをランダムに無効化するのはドロップアウト、検証誤差の悪化を見て学習を打ち切るのは早期終了で、どちらも過学習への対処だが仕組みが異なる。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 14. 正則化
問12|リッジ回帰
リッジ回帰で用いられている正則化はどれか。
- 0でない重みの個数をペナルティにするL0正則化
- 重みの絶対値の和をペナルティにするL1正則化
- 学習時にユニットをランダムに無効化するドロップアウト
- 重みの二乗和をペナルティに加えるL2正則化
正解と解説
正解:D. 重みの二乗和をペナルティに加えるL2正則化リッジ回帰は、線形回帰にL2正則化を組み合わせた手法である。重みの二乗和をペナルティとして加えるので係数全体が小さく抑えられ、過学習を防げる。線形回帰にL1正則化を組み合わせたほうはラッソ回帰で、こちらは係数がちょうど0になりやすくスパースな解が得られる。L1とラッソ、L2とリッジの対応は取り違えやすいので、必ずセットで覚えておきたい。L0正則化は0でない重みの個数そのものをペナルティにする考え方で、個数は微分できないため勾配を使う学習には組み込みにくい。ドロップアウトはニューラルネットワーク向けの正則化手法である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 14. 正則化
問13|ドロップアウト
ドロップアウトの説明として適切なものはどれか。
- 学習時にユニットを一定の割合でランダムに無効化して過学習を抑える
- ミニバッチの中で中間層の出力を平均0・分散1に整えて学習を安定させる
- 画像を左右に反転したり切り出したりして、学習データそのものを水増しする
- 検証データの誤差が上がりはじめた時点で学習を打ち切って過学習を防ぐ
正解と解説
正解:A. 学習時にユニットを一定の割合でランダムに無効化して過学習を抑えるドロップアウトは、学習のたびに隠れ層のユニットを一定の割合でランダムに無効にする手法である。毎回すこしずつ違う形のネットワークで学習することになるので、特定のユニットの組み合わせに頼りきった覚え方ができなくなり、多数のモデルを平均したような効果が得られる。無効にするのは学習時だけで、推論時にはすべてのユニットを使う。名前が似ているが、シラバスではドロップアウトは14番の正則化に分類されていて、19番の正規化層ではない。ミニバッチの中で分布を整えるのはバッチ正規化、データを水増しするのはデータ拡張、誤差の悪化で打ち切るのは早期終了である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 14. 正則化
問14|ミニバッチ学習
ミニバッチ学習の説明として適切なものはどれか。
- 訓練データを1件使うたびに、重みを更新していく進め方である
- 訓練データ全体で勾配を求めて、1回だけ重みを更新する進め方である
- 数十から数百件のかたまりごとに、重みを更新していく進め方である
- 重みを更新せず、あらかじめ決めた値をそのまま使いつづける進め方である
正解と解説
正解:C. 数十から数百件のかたまりごとに、重みを更新していく進め方であるミニバッチ学習は、訓練データを数十から数百件のかたまりに分け、そのかたまりごとに勾配を求めて重みを更新する進め方である。1件ずつ更新するオンライン学習ほど1回の勾配がばらつかず、全データで1回だけ更新するバッチ学習ほど計算も重くならないという中間の性質を持つため、実務ではこれがほとんどを占める。確率的勾配降下法(SGD)は一部のデータだけで勾配を求めるので、そのゆらぎのおかげで鞍点や浅い局所最適解から抜け出しやすいという利点がある。重みを更新しないのは学習ではなく、単なる推論である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 16. 最適化手法
問15|エポック
エポックとイテレーションの関係として適切なものはどれか。
- エポックは重みを1回更新すること、イテレーションはデータを1周することを指す
- エポックもイテレーションも、どちらもデータを1周することを指している
- エポックはミニバッチの大きさ、イテレーションは学習率の大きさを指している
- エポックはデータを1周すること、イテレーションは重みを1回更新することを指す
正解と解説
正解:D. エポックはデータを1周すること、イテレーションは重みを1回更新することを指すエポックは訓練データ全体を1周すること、イテレーションは重みを1回更新することを指す。両者はミニバッチのサイズを介して結びついていて、1エポックあたりのイテレーション数はデータ件数をミニバッチのサイズで割った値になる。たとえば3000件のデータをサイズ50で回すなら1エポックは60イテレーションである。ミニバッチのサイズを大きくすると1回の勾配は安定するが1エポックあたりの更新回数が減り、小さくすると更新は増えるがばらつきが大きくなる。ミニバッチのサイズも学習率も、人が事前に決めるハイパーパラメータであってエポックやイテレーションとは別の概念である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 16. 最適化手法
問16|鞍点
鞍点の説明として適切なものはどれか。
- 取りうる範囲全体の中で、誤差が最も小さくなっている点である
- ある方向から見れば極小、別の方向から見れば極大になっている点である
- その近くの範囲では最も誤差が小さいが、全体ではもっと良い点がある
- 誤差の値が範囲全体で一定になり、どの方向にも傾きがない領域である
正解と解説
正解:B. ある方向から見れば極小、別の方向から見れば極大になっている点である鞍点は、ある方向から見れば谷底なのに別の方向から見れば山頂になっている点である。馬の鞍のような形をしていることからこの名がある。パラメータの数が非常に多いディープラーニングでは、あらゆる方向で同時に谷底になる局所最適解よりも、鞍点にはまって動けなくなるほうが起こりやすいと考えられている。範囲全体で誤差が最も小さい点は大域最適解、近くの範囲でだけ最も小さい点は局所最適解である。確率的勾配降下法(SGD)は勾配にばらつきが乗るため、こうした停滞から抜け出しやすい。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 16. 最適化手法
問17|Adam
Adam はどのような考え方を組み合わせた最適化手法か。
- 重みの絶対値の和と二乗和という、2種類のペナルティを組み合わせている
- グリッドサーチとランダムサーチという、2種類の探索を組み合わせている
- 慣性を使う工夫と、学習率を適応させる工夫を組み合わせている
- バッチ学習とオンライン学習という、2つの進め方を交互に切り替えている
正解と解説
正解:C. 慣性を使う工夫と、学習率を適応させる工夫を組み合わせているAdamは、前回の更新量を慣性として足し込むモーメンタムの考え方と、パラメータごとに学習率を自動で調整するRMSpropの考え方を組み合わせた最適化手法で、実務の既定値としてよく使われる。学習率を適応させる系統はAdaGradから始まっていて、AdaGradは更新が大きかったパラメータほど学習率を下げるものの下げ続けてしまうため、RMSpropが指数移動平均でこれをゆるめた。同じ系統にはAdaDelta・AdaBound・AMSBoundもある。重みへのペナルティは正則化の話、グリッドサーチとランダムサーチはハイパーパラメータ探索の話で、いずれも更新則そのものではない。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 16. 最適化手法
問18|ノーフリーランチ
ノーフリーランチの定理が述べていることはどれか。
- あらゆる問題で他より優れた万能のアルゴリズムは存在しないということ
- モデルを大きくすると誤差がいったん悪化してから再び下がるということ
- 特徴量の次元が増えるほど必要な学習データが急激に増えるということ
- 学習率を下げ続ければ必ず大域最適解にたどりつけるということ
正解と解説
正解:A. あらゆる問題で他より優れた万能のアルゴリズムは存在しないということノーフリーランチの定理は、想定しうるあらゆる問題を平均すれば、他のすべてより優れた万能のアルゴリズムは存在しないという主張である。したがって手法の選択は問題ごとに考えるほかなく、いつでもこれを使えばよいという答えはない。モデルを大きくすると誤差がいったん悪化してから再び下がるのは二重降下現象で、これも同じ中項目に収録されている。特徴量の次元が増えるほど必要なデータが急増するのは次元の呪いである。学習率を下げ続ければ必ず大域最適解に届くという保証はなく、局所最適解や鞍点で止まりうる。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 16. 最適化手法
問19|ランダムサーチ
ハイパーパラメータの探索方法であるランダムサーチの説明として適切なものはどれか。
- 候補の値を格子状に並べ、すべての組み合わせを順に試していく
- 探索する範囲の中からランダムに点を選び、その組み合わせを試す
- 検証データの誤差が悪化に転じた時点で、学習そのものを打ち切る
- 学習のたびにユニットをランダムに無効化し、平均的な挙動を得る
正解と解説
正解:B. 探索する範囲の中からランダムに点を選び、その組み合わせを試すランダムサーチは、ハイパーパラメータの探索範囲の中からランダムに点を選んで試す方法である。候補を格子状に並べて総当たりするグリッドサーチと違い、効いていないハイパーパラメータに試行を浪費しにくく、同じ試行回数でも効く軸を細かく探れるという利点がある。学習率やミニバッチのサイズ、層の数のように人が事前に決める値がハイパーパラメータである。検証誤差の悪化で学習を打ち切るのは早期終了、学習時にユニットをランダムに無効化するのはドロップアウトで、どちらも探索の方法ではない。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 16. 最適化手法
問20|二重降下現象
モデルの大きさや学習量を増やしていくと、検証誤差がいったん悪化した後に再び下がっていく現象を何と呼ぶか。
- 信用割当問題
- 勾配爆発問題
- 二重降下現象
- 不変性の獲得
正解と解説
正解:C. 二重降下現象二重降下現象は、モデルの大きさや学習の量を増やしていったときに、検証誤差がいったん悪化してからさらに増やすと再び下がりはじめる現象である。誤差の曲線が2回下がることからこの名がついた。モデルを大きくするほど過学習して悪くなるという素朴な直感には反するが、大きなモデルほど良い結果が出ることがあるという近年の経験を説明する枠組みのひとつとして、シラバスの最適化手法に収録されている。信用割当問題は誤差の責任をどのユニットに帰すかという問題、勾配爆発問題は逆伝播で勾配が発散する問題、不変性の獲得はプーリング層の役割である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの概要 16. 最適化手法
問21|畳み込み層
全結合層と比べたときの畳み込み層の特徴として、適切なものはどれか。
- 前の層のすべてのユニットとつなぐので、入力が大きいほど重みが増える
- 学習する重みを一切持たず、領域の代表値をとって出力を小さくしていく
- 前の時刻の状態を入力に戻すことで、順番のある系列データを扱っていく
- 同じフィルタを位置を変えて使い回すので、少ない重みで特徴を取り出せる
正解と解説
正解:D. 同じフィルタを位置を変えて使い回すので、少ない重みで特徴を取り出せる畳み込み層は、小さなフィルタを入力の上で滑らせながら同じ重みを使い回して局所的な特徴を取り出す。つながる相手が近くの要素に限られること、そして位置を変えても同じ重みを使うことの2つによって、全結合層よりはるかに少ないパラメータで画像を扱える。使い回しの副産物として、被写体が画像のどこに写っていても同じ特徴として拾えるようになる。前の層のすべてのユニットとつなぐのは全結合層、学習する重みを持たず代表値をとるのはプーリング層、前の時刻の状態を戻すのは回帰結合層の説明である。フィルタを1枚通した結果が特徴マップ、ずらす幅がストライド、周囲を埋めるのがパディングである。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 18. 畳み込み層
問22|バッチ正規化
バッチ正規化の説明として適切なものはどれか。
- 1つのサンプルの中で層全体の値をまとめて整え、ミニバッチの大きさに左右されない
- ミニバッチの中で同じチャネルの値をまとめて、平均0・分散1に整える
- 重みの二乗和をペナルティとして誤差関数に加え、重みを小さくそろえる
- 学習のたびにユニットを一定の割合で無効にし、依存の偏りをなくしていく
正解と解説
正解:B. ミニバッチの中で同じチャネルの値をまとめて、平均0・分散1に整えるバッチ正規化は、ミニバッチの中で同じチャネルの値をまとめて平均0・分散1に整える正規化層で、学習を安定させ速くする。ミニバッチのサイズが小さいと統計量が当てにならなくなるのが弱点である。1つのサンプルの中で層全体の値を整えるのはレイヤー正規化で、ミニバッチのサイズに左右されないため系列を扱うモデルでよく使われる。ほかにインスタンス正規化とグループ正規化があり、この4つがシラバスの正規化層に並ぶ。なおこの中項目は第1.1版で正則化層から正規化層に名称が変わっている。重みの二乗和をペナルティにするL2正則化と、ユニットを無効化するドロップアウトは、正規化層ではなく正則化に分類される。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 19. 正規化層
問23|プーリング層
プーリング層が果たす役割として、最も適切なものはどれか。
- 層を飛び越えて入力を先の層に足し込み、勾配が届く経路を作る
- 中間層の出力の分布をそろえて、学習を安定させ速くしていく
- 領域を代表値に縮約して、位置のわずかなずれに強いモデルにする
- 入力を低い次元に圧縮してから、元の入力を復元できるようにする
正解と解説
正解:C. 領域を代表値に縮約して、位置のわずかなずれに強いモデルにするプーリング層は決まった大きさの領域をひとつの代表値に縮約する層で、領域の最大値をとる最大値プーリングと平均をとる平均値プーリングがある。解像度が下がって計算が軽くなるだけでなく、被写体が数画素ずれても代表値が変わりにくいので、位置のずれに強くなる。これを不変性の獲得という。特徴マップ1枚をまるごと平均して1つの値に潰すグローバルアベレージプーリング(GAP)は、最後に全結合層を積む代わりに使うとパラメータを大きく減らせる。プーリング層には学習する重みがない点も畳み込み層との違いである。層を飛び越えて足し込むのはスキップ結合、分布をそろえるのは正規化層、圧縮して復元するのはオートエンコーダである。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 20. プーリング層
問24|スキップ結合
スキップ結合を採り入れると、非常に深いネットワークでも学習が進むようになるのはなぜか。
- 層を飛び越える経路ができ、勾配が浅い道をたどって入力側まで届くから
- ユニットがランダムに無効になり、特定の経路に頼らなくなるから
- 各層の出力の分布がそろい、値のばらつきが層ごとに抑えられるから
- 重みの数が減って、限られたデータでも過学習しにくくなるから
正解と解説
正解:A. 層を飛び越える経路ができ、勾配が浅い道をたどって入力側まで届くからスキップ結合は、いくつかの層を飛び越して入力をそのまま先の層の出力に足し込む配線である。逆伝播のとき、勾配はたくさんの層を通る長い経路だけでなく、飛び越しの短い経路も通って入力側まで届くので、深く積んでも勾配が消えにくくなる。この考え方を採り入れて100層を超える深さを現実にした代表例がResNetで、シラバスではスキップ結合の中項目に置かれたキーワードはResNetだけである。ユニットをランダムに無効化するのはドロップアウト、各層の分布をそろえるのは正規化層で、いずれもスキップ結合とは別の仕組みである。スキップ結合は重みの数を減らす工夫でもない。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 21. スキップ結合
問25|LSTMとGRU
LSTMとGRUが持つゲートについて、正しい組み合わせはどれか。
- LSTMはリセットと更新の2つ、GRUは入力と出力と忘却の3つを持つ
- LSTMは入力と出力と忘却の3つ、GRUはリセットと更新の2つを持つ
- LSTMもGRUも、入力と出力と忘却の3つのゲートを共通して持つ
- LSTMもGRUも、リセットと更新の2つのゲートを共通して持つ
正解と解説
正解:B. LSTMは入力と出力と忘却の3つ、GRUはリセットと更新の2つを持つLSTMは、情報をためておくCECという記憶の経路を持ち、そこへ何を書き込むかを決める入力ゲート、何を捨てるかを決める忘却ゲート、何を外へ出すかを決める出力ゲートの3つで出し入れを制御する。この仕組みによって長い依存関係を保てるようになり、リカレントニューラルネットワークの勾配消失問題が大きく緩和された。GRUはLSTMを簡略化したもので、ゲートはリセットゲートと更新ゲートの2つだけである。パラメータが少なく計算が軽い一方、常にLSTMより高性能というわけではない。ゲートの数が3と2であること、CECはLSTM側の用語であることが繰り返し問われる区別である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 22. 回帰結合層
問26|ジョルダン
ジョルダンネットワークの構造として適切なものはどれか。
- 隠れ層の出力を、次の時刻の隠れ層に戻して入力する
- 入力層の値を、そのまま出力層まで飛ばして足し込む
- 出力層の出力を、次の時刻の隠れ層に戻して入力する
- 出力層の出力を、同じ時刻の入力層に戻して入力する
正解と解説
正解:C. 出力層の出力を、次の時刻の隠れ層に戻して入力するジョルダンネットワークは、出力層の出力を次の時刻の隠れ層に戻して入力する形のリカレントニューラルネットワークである。これに対して、隠れ層の出力を次の時刻の隠れ層に戻すのがエルマンネットワークで、何を戻すかが両者の違いになる。どちらも時系列データを順番のまま扱うための構造で、学習には時間方向にネットワークを展開してから誤差逆伝播法を適用するBPTTを使う。長い系列では勾配消失問題と勾配爆発問題が強く出るため、ゲート機構を持つLSTMやGRUが用いられる。層を飛び越えて足し込むのはスキップ結合で、時間方向の話ではない。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 22. 回帰結合層
問27|Attention
Source-Target Attention の説明として適切なものはどれか。
- 別々の2つの系列のあいだで、関連の強さを計算する仕組みである
- 同じ系列の中で、各要素どうしの関連の強さを計算する仕組みである
- 各位置に固有の信号を足して、語の順番の情報を与える仕組みである
- 複数の注目のしかたを並列に走らせて、結果をまとめる仕組みである
正解と解説
正解:A. 別々の2つの系列のあいだで、関連の強さを計算する仕組みであるAttentionは、入力のどこに注目すべきかを重みとして計算する仕組みで、クエリ・キー・バリューの3つで表される。このうちSource-Target Attentionは、翻訳のように入力の系列と出力の系列が分かれている場面で、別々の2つの系列のあいだで関連の強さを計算する。同じ系列の中で各要素どうしの関係を計算するほうがSelf-Attentionで、Transformerの中心的な部品になっている。各位置に固有の信号を足して語順を与えるのは位置エンコーディング、複数の注目のしかたを並列に走らせて結果をまとめるのはMulti-Head Attentionで、いずれもTransformerを構成する別々の部品である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 23. Attention
問28|位置エンコーディング
Transformer の説明として適切なものはどれか。
- 回帰結合を積み重ねた構造で、前の時刻の状態を順番に受け渡していくモデル
- 畳み込みとプーリングを交互に重ねて、局所的な特徴を段階的に集めるモデル
- 入力を低い次元に圧縮し、そこから元の入力を復元するように学習するモデル
- 回帰結合を使わずAttentionで構成し、語順は位置エンコーディングで与える
正解と解説
正解:D. 回帰結合を使わずAttentionで構成し、語順は位置エンコーディングで与えるTransformerは、回帰結合を使わずAttentionを中心に構成した系列モデルである。前の時刻の計算を待つ必要がないので系列全体を並列に処理でき、離れた語どうしの関係も1回の計算で直接つかめる。ただし並列に処理すると語の順番の情報が消えてしまうため、各位置に固有の信号を足す位置エンコーディングで語順を与える。Transformerはリカレントニューラルネットワークの一種ではない、という点が引っかけどころである。回帰結合を積み重ねて前の時刻の状態を受け渡すのはRNN、畳み込みとプーリングを重ねるのはCNN、圧縮してから復元するのはオートエンコーダの説明である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 23. Attention
問29|VAE
変分オートエンコーダ(VAE)が、通常のオートエンコーダと異なる点はどれか。
- 入力をいったん低い次元に圧縮してから、元の入力を復元する点
- 正解ラベルを用意しなくても、学習を進められるようにした点
- 圧縮した先を1点ではなく確率分布として学び、新しいデータを作れる点
- 層を1つずつ順に学習させて、深いネットワークの初期値を作る点
正解と解説
正解:C. 圧縮した先を1点ではなく確率分布として学び、新しいデータを作れる点変分オートエンコーダ(VAE)は、入力を圧縮した先を1つの点ではなく確率分布として学ぶ。その分布から値を取り出して復元すれば、学習データにはなかった新しいデータを作れるので、生成モデルとして扱われる。低い次元に圧縮してから復元することと、正解ラベルなしで学習できることは通常のオートエンコーダにも共通する性質で、VAEだけの特徴ではない。層を1つずつ順に学習させて深いネットワークの初期値を作るのは積層オートエンコーダによる事前学習である。シラバスにはVQ-VAE・info VAE・β-VAEも同じ中項目に挙げられている。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 24. オートエンコーダ
問30|Mixup
画像のデータ拡張手法のうち、Mixup が行う操作はどれか。
- 画像の一部を四角く塗りつぶして、その部分の情報を隠す
- 画像を左右に反転させて、向きの違う例を作り出す
- 画像の一部を切り出して、拡大したものを新しい例にする
- 2枚の画像を重ね合わせて、1枚の新しい例を作り出す
正解と解説
正解:D. 2枚の画像を重ね合わせて、1枚の新しい例を作り出すMixupは2枚の画像を一定の比率で重ね合わせ、正解ラベルも同じ比率で混ぜて新しい学習データを作るデータ拡張手法である。似た名前のCutMixは、重ね合わせるのではなく2枚の一部を切り貼りして1枚にする。画像の一部を四角く塗りつぶすのはCutoutやRandom Erasing、左右に反転するのはRandom Flip、一部を切り出すのはCropである。ほかに回転させるRotate、明るさを変えるBrightness、コントラストを変えるContrast、どの変換をどれだけかけるかを自動で決めるRandAugumentがあり、テキスト向けにはparaphrasingとnoisingが挙げられている。いずれも意味を壊す変換を選ばないことが大切である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの要素技術 25. データ拡張
問31|GoogLeNet
GoogLeNet の特徴として適切なものはどれか。
- 大きさの違うフィルタを並列に当てるInceptionモジュールを用いた
- 3かける3の小さな畳み込みだけを積み重ねて、深い構成をとった
- 層を飛び越えるスキップ結合を導入し、100層を超える深さを実現した
- 2012年のILSVRCで優勝し、ReLU関数とGPUによる学習を用いた
正解と解説
正解:A. 大きさの違うフィルタを並列に当てるInceptionモジュールを用いたGoogLeNetは、大きさの違うフィルタを並列に当てて結果をまとめるInceptionモジュールを用い、パラメータを抑えたまま深い構成を実現したモデルである。3かける3の小さな畳み込みだけを積み重ねる単純で深い構成をとったのはVGGで、GoogLeNetと同じ2014年のILSVRCで上位に入った。層を飛び越えるスキップ結合で100層を超える深さを可能にしたのはResNet、2012年のILSVRCで優勝しReLU関数とドロップアウトとGPU学習を組み合わせたのはAlexNetである。以降はWide ResNet、DenseNet、SENet、EfficientNet、MobileNetなどへ広がり、畳み込みを使わずTransformerの考え方を持ち込んだVision Transformerも収録されている。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 26. 画像認識
問32|1段階検出
YOLO や SSD に共通する特徴として適切なものはどれか。
- 画素ひとつひとつにクラスを割り当てて、画像の領域を塗り分ける
- 候補領域を出してから分類するという、2段階の手順で物体を検出する
- 候補領域の抽出と分類を1回の推論でまとめて行い、速さを重視する
- 人体の関節点の位置を推定して、姿勢を求めることを目的としている
正解と解説
正解:C. 候補領域の抽出と分類を1回の推論でまとめて行い、速さを重視するYOLOとSSDは、候補領域の抽出とクラスの判定を1回の推論でまとめて行う1段階の物体検出モデルで、速さが持ち味である。これに対してR-CNNから始まりFast R-CNN、Faster R-CNNと発展した系統は、まず候補領域を出してから分類する2段階の方式で、遅い代わりに精度が出やすい。画素ごとにクラスを割り当てるのはセマンティックセグメンテーションで、FCN・SegNet・U-Net・PSPNet・DeepLabが代表例である。同じクラスの物体を個体まで分けるインスタンスセグメンテーションはMask R-CNNが担い、人体の関節点を推定する姿勢推定はOpen Poseが代表である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 26. 画像認識
問33|BERT
BERT の説明として適切なものはどれか。
- 回帰結合層を積み重ね、単語を1つずつ順に読み進めて文脈を作る
- Transformerのエンコーダを使い、前後の両方向から文脈を見る
- 画像と説明文を同じベクトル空間に対応づけて、両者を結びつける
- ノイズを加える過程を逆にたどって、データを少しずつ生成していく
正解と解説
正解:B. Transformerのエンコーダを使い、前後の両方向から文脈を見るBERTはTransformerのエンコーダを用いた言語モデルで、文の前後の両方向から文脈を見て事前学習する点が特徴である。大量のテキストで事前学習してから個別のタスクに適応させるという使い方を広めた。回帰結合層を積み重ねて単語を順に読み進めるのはリカレントニューラルネットワークを使ったモデルで、Transformerは回帰結合を持たない。画像と説明文を同じベクトル空間に対応づけるのはCLIPで、シラバスではマルチモーダルに置かれている。ノイズを加える過程を逆にたどって生成するのはDiffusion Modelで、こちらはデータ生成の中項目である。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 27. 自然言語処理
問34|CBOW
word2vec の CBOW が学習する向きとして適切なものはどれか。
- 中心の語から、その周辺に現れる語を当てるように学習する
- 文全体から、その文が肯定的か否定的かを当てるように学習する
- 前半の文から、続く後半の文が来るかどうかを当てるように学習する
- 周辺に現れる語から、その中心の語を当てるように学習する
正解と解説
正解:D. 周辺に現れる語から、その中心の語を当てるように学習するCBOWは、周辺に現れる語からその中心の語を当てるように学習する方式である。逆に、中心の語から周辺の語を当てるように学習するのがスキップグラムで、向きが逆なので取り違えに注意したい。どちらもword2vecの方式で、単語を密なベクトルで表す分散表現を得ることが目的である。1語に1つの次元を割り当てるワンホットベクトルは、次元が語彙の大きさになるうえ語どうしの近さを表せないのに対し、分散表現では意味の近い語がベクトル空間で近くに配置される。文が肯定的か否定的かを当てるのは感情分析という応用タスクで、単語表現の学習方式の話ではない。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 27. 自然言語処理
問35|RLHF
人間のフィードバックをもとに報酬モデルを作り、強化学習でモデルを調整する手法はどれか。
- PPO
- DQN
- RLHF
- A3C
正解と解説
正解:C. RLHFRLHFは、人間が付けた好みの評価から報酬モデルを作り、それを報酬として強化学習でモデルを調整する手法である。言語モデルの調整で知られているが、シラバスでは自然言語処理ではなく深層強化学習の中項目に置かれている点が意外なところで、覚えておくと効く。DQNは行動価値関数をニューラルネットワークで近似する深層強化学習の代表手法、PPOは方策の更新幅を抑えて安定させる方策の学習手法、A3Cは複数の環境を並列に走らせて学習を進める手法である。同じ中項目にはダブルDQN、デュエリングネットワーク、Rainbow、APE-X、Agent57なども並ぶ。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 29. 深層強化学習
問36|Diffusion
Diffusion Model の説明として適切なものはどれか。
- ノイズを段階的に加えていく過程を逆にたどって、データを生成する
- 2つのネットワークを競わせながら、本物らしいデータを生成する
- 複数の視点の写真から三次元の見え方を学び、新しい視点の像を作る
- 圧縮した先を確率分布として学び、そこから取り出して復元する
正解と解説
正解:A. ノイズを段階的に加えていく過程を逆にたどって、データを生成するDiffusion Modelは、データに少しずつノイズを加えていく過程を逆にたどることで、ノイズから目的のデータを作り出す生成モデルである。2つのネットワークを競わせながら学習させる敵対的生成ネットワーク(GAN)とは仕組みがまったく異なり、GANの一種ではない。GANからはDCGAN、CycleGAN、Pix2Pixが派生している。複数の視点の写真から三次元の見え方を学ぶのはNeRF、圧縮した先を確率分布として学ぶのは変分オートエンコーダ(VAE)である。GANとVAEとDiffusion Modelは並列に置かれる別々の系統だと整理しておきたい。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 30. データ生成
問37|転移学習
転移学習とファインチューニングの違いとして適切なものはどれか。
- 転移学習は重みの全体を学習し直し、ファインチューニングは出力層だけを学習する
- 転移学習もファインチューニングも、事前学習をせずに一から重みを学習していく
- 転移学習は画像だけに、ファインチューニングは言語だけに使える手法である
- 転移学習は主に出力層の付近を学習し、ファインチューニングは広い範囲を学習し直す
正解と解説
正解:D. 転移学習は主に出力層の付近を学習し、ファインチューニングは広い範囲を学習し直す転移学習は、事前学習済みモデルの特徴を抽出する部分は固定したまま、主に出力層の付近だけを新しいタスクで学習する方法である。ファインチューニングは重みの全体または広い範囲を新しいデータで学習し直すもので、必要なデータも計算も多くなる代わりに、対象の領域が事前学習のデータと大きく違う場合に伸びやすい。ファインチューニングでは、元のモデルが持っていた能力が失われる破滅的忘却が起こることがある。どちらも事前学習済みモデルを前提とする手法であり、一から学習するわけではない。また扱うデータの種類で使い分けが決まるものでもない。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 31. 転移学習・ファインチューニング
問38|基盤モデル
シラバスにおいて基盤モデルという語が置かれている中項目はどれか。
- 自然言語処理に置かれ、大規模言語モデル(LLM)と並んでいる
- マルチモーダルに置かれ、CLIPやDALL-Eと並んでいる
- 深層強化学習に置かれ、DQNやRLHFと並んでいる
- 転移学習とファインチューニングに置かれ、Few-shotと並んでいる
正解と解説
正解:B. マルチモーダルに置かれ、CLIPやDALL-Eと並んでいる基盤モデルは、大量のデータで事前学習して多様な下流のタスクに転用できる大規模なモデルを指す語で、シラバスでは32番のマルチモーダルに置かれ、CLIP・DALL-E・Flamingo・Unified-IO・Zero-shotなどと並んでいる。生成AIまわりの語は置き場所が散っていて、大規模言語モデル(LLM)は27番の自然言語処理、RLHFは29番の深層強化学習に収録されている。31番の転移学習・ファインチューニングに並ぶのはFew-shot、One-shot、自己教師あり学習、事前学習済みモデル、破滅的忘却などである。どの中項目に何が置かれているかを押さえておくと、範囲の全体像がつかみやすい。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 32. マルチモーダル
問39|SHAP
説明可能AI(XAI)の手法である SHAP の考え方として適切なものはどれか。
- 協力ゲーム理論の考え方で、各特徴の寄与を配分して示す
- 画像のどこを見て判断したかを、熱の地図のような形で示す
- 特徴の値をわざと入れ替えて、精度の落ち方から重要度を測る
- 予測の近くで単純なモデルを当てはめ、その係数で説明する
正解と解説
正解:A. 協力ゲーム理論の考え方で、各特徴の寄与を配分して示すSHAPは、協力ゲーム理論で使われる考え方を借りて、予測に対する各特徴の寄与を公平に配分して示す手法である。画像のどこを見て判断したかを熱の地図のような形で示すのはCAMやGrad-CAM、特徴の値をわざと入れ替えて精度の落ち方から重要度を測るのはPermutation Importance、個々の予測の近くで単純なモデルを当てはめてその係数で説明するのはLIMEである。これらはいずれもシラバスの33番モデルの解釈性に収録されていて、判断根拠を人が理解できる形で示す取り組みをまとめて説明可能AI(XAI)と呼ぶ。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 33. モデルの解釈性
問40|宝くじ仮説
モデルの軽量化に関する宝くじ仮説の内容として適切なものはどれか。
- 大きな教師モデルの出力を、小さなモデルに学ばせれば性能を保てるという考え
- 大きなネットワークの中に、単独で学習しても同等の性能に届く部分があるという考え
- 重みを表す数値の精度を落としても、精度の低下はごくわずかで済むという考え
- モデルを大きくするほど、必要な学習データが指数的に増えていくという考え
正解と解説
正解:B. 大きなネットワークの中に、単独で学習しても同等の性能に届く部分があるという考え宝くじ仮説は、大きなネットワークの中に、それだけを取り出して学習させても全体と同等の性能に届く当たりの部分ネットワークが含まれている、という仮説である。寄与の小さい結合や層を削るプルーニングがなぜうまくいくのかを説明する背景として語られる。大きな教師モデルの出力を小さなモデルに学ばせるのは蒸留、重みを表す数値の精度を落とすのは量子化で、プルーニングと合わせた3つがシラバスの軽量化手法にあたり、まとめてモデル圧縮という。必要な学習データが急激に増えるのは次元の呪いの話である。軽量化が求められる典型は、端末側で推論を動かすエッジAIである。
根拠:一般社団法人日本ディープラーニング協会「G検定 試験出題範囲(シラバス 2024)」第1.4版(2026年5月11日) 技術分野 ディープラーニングの応用例 34. モデルの軽量化
演習:この章の問題を解く
ランダム出題の演習ツールです(JavaScript が有効な場合に動きます)。上の「確認問題」はそのままでもすべて読めます。
※ 解説は学習用の情報提供です。最新の出題範囲・制度は必ず公式発表をご確認ください。
※ 出題は、AWS公式ドキュメント・試験ガイド、JDLA「G検定 試験出題範囲(シラバス2024)第1.4版」、一般社団法人Pythonエンジニア育成推進協会の公開情報とPython公式ドキュメントに沿った仮の宿 学習室のオリジナル問題です(2026年8月時点で確認)。Pythonの問題はすべて実行して確認しています。試験制度・出題範囲は各実施団体の公式発表をご確認ください。