시간 방향으로 상태를 되돌리는 연결을 가지며 순서가 있는 계열 데이터를 그대로 다룰 수 있다
은닉층을 여러 개 가지며 비선형 분리가 가능하므로 배타적 논리합도 표현할 수 있다
정답A. 입력층과 출력층만으로 이루어지며 선형 분리 가능한 문제만 풀 수 있다
단순 퍼셉트론은 입력층과 출력층만으로 이루어진 가장 단순한 신경망으로, 직선 하나로 나눌 수 있는 선형 분리 가능한 문제만 풀 수 있다. 배타적 논리합(XOR)은 출력이 1이 되는 점과 0이 되는 점이 대각선 상에 번갈아 놓이므로 어디에 직선을 그어도 나눌 수 없어 단순 퍼셉트론으로는 표현할 수 없다. 은닉층을 더해 경계를 구부릴 수 있게 한 다층 퍼셉트론이라면 XOR도 표현할 수 있으며, 첫 번째 선택지는 그 다층 퍼셉트론에 대한 설명이다. 이전 시각의 상태를 되돌려 계열을 다루는 것은 순환 신경망, 필터를 이동시키며 국소적 특징을 추출하는 것은 합성곱층에 대한 설명이다.
문제 2 | GPU의 적합성
GPU가 딥러닝 학습에 적합하다고 하는 이유로 가장 적절한 것은 어느 것인가?
학습에 사용하는 데이터를 저장해 두는 기억 용량이 CPU보다 훨씬 크기 때문에
오차역전파법에서 쓰는 연쇄법칙을 전용 회로로 처음부터 내장하고 있기 때문에
분기가 많은 복잡한 처리를 소수의 강력한 코어로 순서대로 고속으로 처리할 수 있기 때문에
작은 연산 코어를 대량으로 가지고 있어 같은 계산을 일제히 병렬로 처리할 수 있기 때문에
정답D. 작은 연산 코어를 대량으로 가지고 있어 같은 계산을 일제히 병렬로 처리할 수 있기 때문에
딥러닝의 학습은 행렬과 벡터의 곱셈과 덧셈을 방대한 횟수로 반복하는 계산이다. GPU는 단순한 연산을 수행하는 작은 코어를 대량으로 가지고 있어 같은 계산을 일제히 병렬로 돌리는 데 적합하므로 이 형태의 계산과 궁합이 좋다. 분기가 많은 처리를 소수의 강력한 코어로 순서대로 고속 처리하는 것은 CPU가 잘하는 분야로, 코어 수는 많지 않다. GPU의 장점은 기억 용량의 크기가 아니라 병렬도이다. 연쇄법칙을 전용 회로로 내장하고 있다는 사실은 없으며, 딥러닝의 텐서 연산에 초점을 맞춰 설계된 것은 TPU 쪽이다.
문제 3 | 기울기 소실의 원인
시그모이드 함수를 은닉층에 쓰면 기울기 소실 문제를 일으키기 쉬운 이유는 무엇인가?
출력이 0에서 1 범위에 들어오므로 층을 쌓으면 출력 자체가 0에 가까워지기 때문에
출력의 총합이 1이 되도록 정규화되므로 값이 층마다 작아지기 때문에
미분의 최댓값이 0.25이며 층을 거슬러 올라갈 때마다 곱해지기 때문에
음의 입력에 대해 출력이 항상 0이 되어 그 유닛이 학습하지 않게 되기 때문에
정답C. 미분의 최댓값이 0.25이며 층을 거슬러 올라갈 때마다 곱해지기 때문에
기울기 소실 문제는 역전파 도중 기울기가 0에 가까워져 입력 쪽 층이 학습되지 않게 되는 현상이다. 시그모이드 함수는 미분의 최댓값이 0.25밖에 되지 않으므로 층을 거슬러 올라갈 때마다 0.25 이하의 수가 곱해져 깊은 신경망에서는 기울기가 거의 남지 않는다. 문제가 되는 것은 출력값 자체가 아니라 그 미분의 크기이다. 음의 입력에 대해 기울기가 0이 되어 학습이 멈추는 것은 ReLU 함수의 약점으로, Leaky ReLU 함수는 이에 대한 대처에 해당한다. 출력의 총합이 1이 되도록 정규화하는 것은 소프트맥스 함수이다.
문제 4 | ReLU 함수
ReLU 함수에 대한 설명으로 적절한 것은 어느 것인가?
입력을 0에서 1 사이로 밀어 넣는 S자형 곡선을 그리는 함수이다
출력의 총합이 1이 되도록 모든 출력을 한꺼번에 정규화하는 함수이다
입력을 -1에서 1 사이로 수렴시키며 원점에 대해 대칭인 형태를 가진다
입력이 양수면 그 값을 그대로 반환하고 음수면 0을 반환하는 함수이다
정답D. 입력이 양수면 그 값을 그대로 반환하고 음수면 0을 반환하는 함수이다
ReLU 함수는 입력이 양수면 그 값을 그대로, 음수면 0을 반환하는 단순한 함수이다. 양의 영역에서는 미분이 항상 1이므로 층을 거슬러 올라가도 기울기가 작아지지 않아 기울기 소실 문제를 크게 완화할 수 있다. 다만 음의 영역에서는 미분이 0이 되므로 한번 음의 쪽으로 들어간 유닛이 학습하지 않게 되는 경우가 있어, 음의 쪽에 약간의 기울기를 준 Leaky ReLU 함수가 마련되어 있다. 0에서 1로 밀어 넣는 S자형은 시그모이드 함수, -1에서 1이며 원점 대칭인 것은 tanh 함수, 출력의 총합이 1이 되도록 정규화하는 것은 소프트맥스 함수에 대한 설명이다.
문제 5 | Leaky ReLU
Leaky ReLU 함수가 마련된 것은 ReLU 함수의 어떤 점에 대처하기 위해서인가?
출력의 총합이 1이 되지 않아 확률로 해석할 수 없는 것
음의 입력에 대해 기울기가 0이 되어 그 유닛이 학습하지 않게 되는 것
계산에 지수함수를 포함하므로 한 번의 처리가 무거워지는 것
양의 입력에 대해 기울기가 1인 채로 유지되어 갱신량이 너무 커지는 것
정답B. 음의 입력에 대해 기울기가 0이 되어 그 유닛이 학습하지 않게 되는 것
ReLU 함수는 음의 영역에서 출력도 미분도 0이 되므로, 어떤 유닛의 입력이 계속 음수이면 기울기가 흐르지 않아 그 유닛은 두 번 다시 학습하지 않게 된다. Leaky ReLU 함수는 음의 쪽에도 약간의 기울기를 주어 이 막다른 상태를 피한다. 양의 영역에서 기울기가 1인 것은 ReLU 함수의 장점이지 단점이 아니며, 기울기 소실을 막아 주는 것이 바로 이 성질이다. 출력의 총합이 1이 되지 않는 것은 활성화 함수로서 당연한 것으로, 확률로 읽고 싶은 출력층에는 소프트맥스 함수를 사용한다. 계산에 지수함수를 포함하는 것은 시그모이드 함수와 tanh 함수이며, ReLU 함수는 오히려 계산이 가볍다.
문제 6 | 소프트맥스
소프트맥스 함수의 대표적인 쓰임새는 어느 것인가?
회귀 문제의 출력층에 두어 연속값을 그대로 출력한다
은닉층의 활성화 함수로 사용해 층에 비선형성을 부여한다
이진 분류의 출력층에 두어 한쪽 클래스의 확률을 낸다
다중 클래스 분류의 출력층에 두어 각 클래스의 확률을 낸다
정답D. 다중 클래스 분류의 출력층에 두어 각 클래스의 확률을 낸다
소프트맥스 함수는 출력의 총합이 정확히 1이 되도록 전체를 정규화하므로, 클래스가 3개 이상인 다중 클래스 분류의 출력층에 두어 각 클래스에 속할 확률로 읽게 한다. 오차 함수로는 교차 엔트로피를 조합하는 것이 기본이다. 이진 분류의 출력층에 두어 확률을 내는 것은 시그모이드 함수, 은닉층의 활성화 함수로 널리 쓰이는 것은 ReLU 함수나 tanh 함수이다. 회귀 문제에서는 출력층에서 값을 그대로 내고 오차 함수로 평균제곱오차 함수를 사용한다.
문제 7 | 회귀의 오차 함수
주택 가격과 같은 연속값을 예측하는 회귀 문제에서 오차 함수로 선택하는 것이 기본으로 여겨지는 것은 어느 것인가?
예측한 확률분포와 정답 분포의 차이를 재는 교차 엔트로피
세 쌍의 거리 관계를 학습시키는 Triplet Loss
같은 것인지 아닌지를 거리로 학습시키는 Contrastive Loss
예측과 정답의 차이를 제곱해 평균 내는 평균제곱오차 함수
정답D. 예측과 정답의 차이를 제곱해 평균 내는 평균제곱오차 함수
회귀는 연속값을 맞히는 문제이므로 예측과 정답의 차이를 그대로 제곱해 평균 내는 평균제곱오차 함수가 자연스러운 선택이 된다. 교차 엔트로피는 확률분포 간의 차이를 재는 함수로 분류 문제에 쓰인다. 다중 클래스 분류라면 출력층의 소프트맥스 함수와 조합하는 것이 기본 형태이다. Triplet Loss는 기준과 정례와 부례의 세 쌍으로 거리 관계를, Contrastive Loss는 두 데이터가 같은 것인지 아닌지를 거리로 학습시키는 것으로, 둘 다 유사한지 여부를 재는 표현을 얻기 위한 오차 함수이다. 오차 함수는 과제에 맞게 고른다는 것이 이 중항목의 목표에 해당한다.
문제 8 | 세 쌍의 오차
오차 함수인 Triplet Loss에 대한 설명으로 적절한 것은 어느 것인가?
예측과 정답의 차이를 제곱해 평균 내어 값 크기의 차이를 직접 잰다
예측한 확률분포와 정답 분포의 차이를 재어 분류의 학습에 널리 쓰인다
기준과 정례와 부례의 세 쌍을 사용해 정례가 부례보다 가까워지도록 한다
두 확률분포 사이의 거리를 재어 분포를 가깝게 만들도록 작용한다
정답C. 기준과 정례와 부례의 세 쌍을 사용해 정례가 부례보다 가까워지도록 한다
Triplet Loss는 기준이 되는 데이터, 그와 같은 종류의 데이터(정례), 다른 종류의 데이터(부례)의 세 쌍을 사용해 기준과 정례의 거리가 기준과 부례의 거리보다 작아지도록 학습시키는 오차 함수이다. 유사한지 여부를 거리로 나타내는 공간을 만들 때 쓰인다. 두 확률분포 사이의 거리를 재는 것은 쿨백-라이블러 발산(KL divergence), 예측과 정답의 차이를 제곱해 평균 내는 것은 평균제곱오차 함수, 확률분포의 차이를 재어 분류에 널리 쓰이는 것은 교차 엔트로피이다. 참고로 두 데이터의 쌍으로 같은지 다른지를 학습시키는 Contrastive Loss도 같은 중항목에 수록되어 있다.
문제 9 | 오차역전파법
오차역전파법에 대한 설명으로 가장 적절한 것은 어느 것인가?
출력층부터 차례로 가중치를 직접 다시 쓰는, 갱신 그 자체의 절차이다
가중치를 난수로 조금씩 움직여 오차가 줄어든 방향을 채택하는 절차이다
입력 쪽에서 출력 쪽으로 순서대로 계산을 진행해 출력을 구하는 절차이다
연쇄법칙을 사용해 출력 쪽에서 입력 쪽으로 거슬러 올라가며 기울기를 구하는 절차이다
정답D. 연쇄법칙을 사용해 출력 쪽에서 입력 쪽으로 거슬러 올라가며 기울기를 구하는 절차이다
오차역전파법은 합성함수의 미분을 부분별 미분의 곱으로 분해하는 연쇄법칙을 사용해 출력 쪽에서 입력 쪽으로 거슬러 올라가며 각 가중치의 기울기를 효율적으로 구하는 방법이다. 여기서 구해지는 것은 어디까지나 기울기이며, 그 기울기를 사용해 가중치를 실제로 움직이는 것은 경사하강법의 역할이다. 오차역전파법이 가중치를 갱신한다고 단정하면 부정확해지므로 주의해야 한다. 난수로 움직여 좋은 방향을 채택하는 것은 기울기를 쓰지 않는 탐색 방식이며, 입력 쪽에서 출력 쪽으로 계산을 진행하는 것은 순전파, 즉 추론의 절차이다.
문제 10 | 신용 할당 문제
최종 오차에 대해 어느 층의 어느 유닛이 얼마만큼 책임을 지는지를 할당하는 문제를 무엇이라 부르는가?
신용 할당 문제
기울기 폭발 문제
기울기 소실 문제
차원의 저주
정답A. 신용 할당 문제
신용 할당 문제는 출력에 나타난 오차의 책임을 도중의 어느 층 어느 유닛에 얼마만큼 돌려야 하는지에 대한 문제이다. 오차역전파법은 연쇄법칙으로 이 할당을 계산 가능하게 만들었다고 자리매김된다. 기울기 소실 문제는 거슬러 올라가는 동안 기울기가 0에 가까워져 입력 쪽 층이 학습되지 않게 되는 현상, 기울기 폭발 문제는 그 반대로 기울기가 너무 커져 발산하는 현상으로, 둘 다 오차역전파법을 적용했을 때 생기는 문제이다. 차원의 저주는 특징량의 차원이 늘어날수록 필요한 데이터가 급증하는 현상으로, 시라버스에서는 머신러닝의 중항목에 놓여 있다.
문제 11 | L1 정칙화
L1 정칙화의 특징으로 적절한 것은 어느 것인가?
가중치의 제곱합을 페널티로 삼아 값을 작게 맞추지만 0으로는 만들기 어렵다
가중치의 절댓값의 합을 페널티로 삼아 값이 정확히 0이 되기 쉽다
학습할 때마다 유닛을 무작위로 비활성화해 의존의 편향을 막는다
검증 데이터의 오차가 악화되기 시작한 시점에서 학습 자체를 중단한다
정답B. 가중치의 절댓값의 합을 페널티로 삼아 값이 정확히 0이 되기 쉽다
L1 정칙화는 가중치의 절댓값의 합을 페널티로 오차 함수에 더하는 정칙화로, 가중치가 정확히 0인 지점까지 밀리기 쉽다. 그 결과 쓰이지 않는 특징의 계수가 0이 되어 자동으로 빠지므로 특징 선택의 효과가 생긴다. 이 상태를 희소하다(스파스, sparse)고 한다. 가중치의 제곱합을 페널티로 삼는 것은 L2 정칙화로, 값을 작게 맞추기는 하지만 0이 되기는 어렵다. 학습 시 유닛을 무작위로 비활성화하는 것은 드롭아웃, 검증 오차의 악화를 보고 학습을 중단하는 것은 조기 종료로, 둘 다 과적합에 대한 대처이지만 방식이 다르다.
문제 12 | 리지 회귀
리지 회귀에서 사용되는 정칙화는 어느 것인가?
0이 아닌 가중치의 개수를 페널티로 삼는 L0 정칙화
가중치의 제곱합을 페널티로 더하는 L2 정칙화
가중치의 절댓값의 합을 페널티로 삼는 L1 정칙화
학습 시 유닛을 무작위로 비활성화하는 드롭아웃
정답B. 가중치의 제곱합을 페널티로 더하는 L2 정칙화
리지 회귀는 선형회귀에 L2 정칙화를 조합한 방법이다. 가중치의 제곱합을 페널티로 더하므로 계수 전체가 작게 억제되어 과적합을 막을 수 있다. 선형회귀에 L1 정칙화를 조합한 쪽은 라쏘 회귀로, 이쪽은 계수가 정확히 0이 되기 쉬워 희소한 해를 얻을 수 있다. L1과 라쏘, L2와 리지의 대응은 헷갈리기 쉬우므로 반드시 세트로 기억해 두어야 한다. L0 정칙화는 0이 아닌 가중치의 개수 자체를 페널티로 삼는 사고방식으로, 개수는 미분할 수 없으므로 기울기를 쓰는 학습에는 넣기 어렵다. 드롭아웃은 신경망을 위한 정칙화 기법이다.
문제 13 | 드롭아웃
드롭아웃에 대한 설명으로 적절한 것은 어느 것인가?
이미지를 좌우로 뒤집거나 잘라내어 학습 데이터 자체를 늘린다
학습 시 유닛을 일정 비율로 무작위로 비활성화해 과적합을 억제한다
검증 데이터의 오차가 오르기 시작한 시점에서 학습을 중단해 과적합을 막는다
미니배치 안에서 중간층의 출력을 평균 0·분산 1로 맞춰 학습을 안정시킨다
정답B. 학습 시 유닛을 일정 비율로 무작위로 비활성화해 과적합을 억제한다
드롭아웃은 학습할 때마다 은닉층의 유닛을 일정 비율로 무작위로 비활성화하는 기법이다. 매번 조금씩 다른 형태의 신경망으로 학습하게 되므로 특정 유닛 조합에만 의존하는 학습을 할 수 없게 되어, 다수의 모델을 평균 낸 것 같은 효과를 얻을 수 있다. 비활성화하는 것은 학습 시뿐이며 추론 시에는 모든 유닛을 사용한다. 이름이 비슷하지만 시라버스에서는 드롭아웃이 14번 정칙화로 분류되어 있으며 19번 정규화층이 아니다. 미니배치 안에서 분포를 맞추는 것은 배치 정규화, 데이터를 늘리는 것은 데이터 증강, 오차 악화로 중단하는 것은 조기 종료이다.
문제 14 | 미니배치 학습
미니배치 학습에 대한 설명으로 적절한 것은 어느 것인가?
가중치를 갱신하지 않고 미리 정한 값을 그대로 계속 사용하는 방식이다
훈련 데이터 전체로 기울기를 구해 1회만 가중치를 갱신하는 방식이다
수십에서 수백 건 단위로 묶어 가중치를 갱신해 나가는 방식이다
훈련 데이터를 1건 사용할 때마다 가중치를 갱신해 나가는 방식이다
정답C. 수십에서 수백 건 단위로 묶어 가중치를 갱신해 나가는 방식이다
미니배치 학습은 훈련 데이터를 수십에서 수백 건 단위로 나누어 그 단위마다 기울기를 구해 가중치를 갱신하는 방식이다. 1건씩 갱신하는 온라인 학습만큼 매번의 기울기가 흔들리지 않고, 전체 데이터로 1회만 갱신하는 배치 학습만큼 계산이 무거워지지도 않는 중간적인 성질을 가지므로 실무에서는 이것이 대부분을 차지한다. 확률적 경사하강법(SGD)은 일부 데이터만으로 기울기를 구하므로 그 흔들림 덕분에 안장점이나 얕은 국소 최적해에서 빠져나오기 쉽다는 장점이 있다. 가중치를 갱신하지 않는 것은 학습이 아니라 단순한 추론이다.
문제 15 | 에폭
에폭과 이터레이션의 관계로 적절한 것은 어느 것인가?
에폭은 미니배치의 크기, 이터레이션은 학습률의 크기를 가리킨다
에폭은 데이터를 한 바퀴 도는 것, 이터레이션은 가중치를 1회 갱신하는 것을 가리킨다
에폭은 가중치를 1회 갱신하는 것, 이터레이션은 데이터를 한 바퀴 도는 것을 가리킨다
에폭도 이터레이션도 둘 다 데이터를 한 바퀴 도는 것을 가리킨다
정답B. 에폭은 데이터를 한 바퀴 도는 것, 이터레이션은 가중치를 1회 갱신하는 것을 가리킨다
에폭은 훈련 데이터 전체를 한 바퀴 도는 것, 이터레이션은 가중치를 1회 갱신하는 것을 가리킨다. 둘은 미니배치의 크기를 매개로 이어져 있어 1에폭당 이터레이션 수는 데이터 건수를 미니배치 크기로 나눈 값이 된다. 예를 들어 3000건의 데이터를 크기 50으로 돌리면 1에폭은 60 이터레이션이다. 미니배치 크기를 키우면 한 번의 기울기는 안정되지만 1에폭당 갱신 횟수는 줄고, 작게 하면 갱신은 늘지만 흔들림이 커진다. 미니배치 크기도 학습률도 사람이 미리 정하는 하이퍼파라미터로, 에폭이나 이터레이션과는 다른 개념이다.
문제 16 | 안장점
안장점에 대한 설명으로 적절한 것은 어느 것인가?
어떤 방향에서 보면 극소, 다른 방향에서 보면 극대가 되는 지점이다
그 근처 범위에서는 오차가 가장 작지만 전체적으로는 더 좋은 지점이 있다
오차 값이 범위 전체에서 일정해져 어느 방향으로도 기울기가 없는 영역이다
취할 수 있는 범위 전체에서 오차가 가장 작아지는 지점이다
정답A. 어떤 방향에서 보면 극소, 다른 방향에서 보면 극대가 되는 지점이다
안장점은 어떤 방향에서 보면 골짜기 바닥인데 다른 방향에서 보면 산꼭대기가 되는 지점이다. 말 안장 같은 모양을 하고 있어 이런 이름이 붙었다. 파라미터 수가 매우 많은 딥러닝에서는 모든 방향에서 동시에 골짜기 바닥이 되는 국소 최적해보다 안장점에 빠져 움직이지 못하게 되는 쪽이 더 일어나기 쉽다고 여겨진다. 범위 전체에서 오차가 가장 작은 지점은 전역 최적해, 근처 범위에서만 가장 작은 지점은 국소 최적해이다. 확률적 경사하강법(SGD)은 기울기에 흔들림이 실리므로 이런 정체 상태에서 빠져나오기 쉽다.
문제 17 | Adam
Adam은 어떤 사고방식을 조합한 최적화 기법인가?
가중치의 절댓값의 합과 제곱합이라는 두 종류의 페널티를 조합하고 있다
관성을 이용하는 방식과 학습률을 적응시키는 방식을 조합하고 있다
배치 학습과 온라인 학습이라는 두 가지 방식을 번갈아 전환하고 있다
그리드 서치와 랜덤 서치라는 두 종류의 탐색을 조합하고 있다
정답B. 관성을 이용하는 방식과 학습률을 적응시키는 방식을 조합하고 있다
Adam은 이전 갱신량을 관성으로 더해 넣는 모멘텀의 사고방식과, 파라미터마다 학습률을 자동으로 조정하는 RMSprop의 사고방식을 조합한 최적화 기법으로, 실무의 기본값으로 자주 쓰인다. 학습률을 적응시키는 계열은 AdaGrad에서 시작되었는데, AdaGrad는 갱신이 컸던 파라미터일수록 학습률을 낮추지만 계속 낮추기만 하므로 RMSprop이 지수이동평균으로 이를 완화했다. 같은 계열에는 AdaDelta·AdaBound·AMSBound도 있다. 가중치에 대한 페널티는 정칙화의 이야기, 그리드 서치와 랜덤 서치는 하이퍼파라미터 탐색의 이야기로, 둘 다 갱신 규칙 자체는 아니다.
문제 18 | 노 프리 런치
노 프리 런치 정리가 말하는 내용은 어느 것인가?
모든 문제에서 다른 것보다 뛰어난 만능 알고리즘은 존재하지 않는다는 것
특징량의 차원이 늘어날수록 필요한 학습 데이터가 급격히 늘어난다는 것
학습률을 계속 낮추면 반드시 전역 최적해에 도달할 수 있다는 것
모델을 크게 하면 오차가 한 번 악화된 후 다시 내려간다는 것
정답A. 모든 문제에서 다른 것보다 뛰어난 만능 알고리즘은 존재하지 않는다는 것
노 프리 런치 정리는 상정할 수 있는 모든 문제를 평균 내면 다른 모든 것보다 뛰어난 만능 알고리즘은 존재하지 않는다는 주장이다. 따라서 기법의 선택은 문제마다 생각할 수밖에 없으며 언제나 이것을 쓰면 된다는 답은 없다. 모델을 크게 하면 오차가 한 번 악화된 후 다시 내려가는 것은 이중 하강 현상으로, 이것도 같은 중항목에 수록되어 있다. 특징량의 차원이 늘어날수록 필요한 데이터가 급증하는 것은 차원의 저주이다. 학습률을 계속 낮추면 반드시 전역 최적해에 도달한다는 보장은 없으며, 국소 최적해나 안장점에서 멈출 수 있다.
문제 19 | 랜덤 서치
하이퍼파라미터 탐색 방법인 랜덤 서치에 대한 설명으로 적절한 것은 어느 것인가?
후보값을 격자 형태로 나열해 모든 조합을 순서대로 시도한다
학습할 때마다 유닛을 무작위로 비활성화해 평균적인 거동을 얻는다
검증 데이터의 오차가 악화되기 시작한 시점에서 학습 자체를 중단한다
탐색할 범위 안에서 무작위로 점을 골라 그 조합을 시도한다
정답D. 탐색할 범위 안에서 무작위로 점을 골라 그 조합을 시도한다
랜덤 서치는 하이퍼파라미터 탐색 범위 안에서 무작위로 점을 골라 시도하는 방법이다. 후보를 격자 형태로 나열해 전수 조사하는 그리드 서치와 달리, 효과가 없는 하이퍼파라미터에 시도를 낭비하기 어렵고 같은 시도 횟수로도 효과가 있는 축을 세밀하게 탐색할 수 있다는 장점이 있다. 학습률이나 미니배치 크기, 층 수처럼 사람이 미리 정하는 값이 하이퍼파라미터이다. 검증 오차의 악화로 학습을 중단하는 것은 조기 종료, 학습 시 유닛을 무작위로 비활성화하는 것은 드롭아웃으로, 둘 다 탐색 방법은 아니다.
문제 20 | 이중 하강 현상
모델의 크기나 학습량을 늘려 갈 때 검증 오차가 한 번 악화된 후 다시 내려가는 현상을 무엇이라 부르는가?
기울기 폭발 문제
불변성 획득
이중 하강 현상
신용 할당 문제
정답C. 이중 하강 현상
이중 하강 현상은 모델의 크기나 학습량을 늘려 갈 때 검증 오차가 한 번 악화된 뒤 더 늘리면 다시 내려가기 시작하는 현상이다. 오차 곡선이 두 번 내려가는 것에서 이런 이름이 붙었다. 모델을 크게 할수록 과적합해서 나빠진다는 소박한 직관에는 반하지만, 큰 모델일수록 좋은 결과가 나오는 경우가 있다는 최근의 경험을 설명하는 틀 중 하나로서 시라버스의 최적화 기법에 수록되어 있다. 신용 할당 문제는 오차의 책임을 어느 유닛에 돌릴지에 대한 문제, 기울기 폭발 문제는 역전파에서 기울기가 발산하는 문제, 불변성 획득은 풀링층의 역할이다.
문제 21 | 합성곱층
완전연결층과 비교했을 때 합성곱층의 특징으로 적절한 것은 어느 것인가?
앞 층의 모든 유닛과 연결되므로 입력이 클수록 가중치가 늘어난다
같은 필터를 위치를 바꿔가며 재사용하므로 적은 가중치로 특징을 추출할 수 있다
이전 시각의 상태를 입력으로 되돌려 순서가 있는 계열 데이터를 다룬다
학습하는 가중치를 전혀 가지지 않으며 영역의 대표값을 취해 출력을 줄여 나간다
정답B. 같은 필터를 위치를 바꿔가며 재사용하므로 적은 가중치로 특징을 추출할 수 있다
합성곱층은 작은 필터를 입력 위에서 이동시키며 같은 가중치를 재사용해 국소적인 특징을 추출한다. 연결 상대가 가까운 요소로 한정된다는 점과 위치를 바꿔도 같은 가중치를 사용한다는 점, 이 두 가지 덕분에 완전연결층보다 훨씬 적은 파라미터로 이미지를 다룰 수 있다. 재사용의 부산물로 피사체가 이미지의 어디에 찍혀 있든 같은 특징으로 포착할 수 있게 된다. 앞 층의 모든 유닛과 연결되는 것은 완전연결층, 학습하는 가중치 없이 대표값을 취하는 것은 풀링층, 이전 시각의 상태를 되돌리는 것은 회귀 결합층에 대한 설명이다. 필터 하나를 통과시킨 결과가 특징 맵, 이동시키는 폭이 스트라이드, 주변을 채우는 것이 패딩이다.
문제 22 | 배치 정규화
배치 정규화에 대한 설명으로 적절한 것은 어느 것인가?
가중치의 제곱합을 페널티로 오차 함수에 더해 가중치를 작게 맞춘다
학습할 때마다 유닛을 일정 비율로 비활성화해 의존의 편향을 없앤다
하나의 샘플 안에서 층 전체의 값을 함께 맞추어 미니배치 크기에 좌우되지 않는다
미니배치 안에서 같은 채널의 값을 모아 평균 0·분산 1로 맞춘다
정답D. 미니배치 안에서 같은 채널의 값을 모아 평균 0·분산 1로 맞춘다
배치 정규화는 미니배치 안에서 같은 채널의 값을 모아 평균 0·분산 1로 맞추는 정규화층으로, 학습을 안정시키고 빠르게 한다. 미니배치 크기가 작으면 통계량을 믿을 수 없게 되는 것이 약점이다. 하나의 샘플 안에서 층 전체의 값을 맞추는 것은 레이어 정규화로, 미니배치 크기에 좌우되지 않으므로 계열을 다루는 모델에서 자주 쓰인다. 그 밖에 인스턴스 정규화와 그룹 정규화가 있어 이 네 가지가 시라버스의 정규화층에 나란히 놓인다. 참고로 이 중항목은 제1.1판에서 정칙화층에서 정규화층으로 명칭이 바뀌었다. 가중치의 제곱합을 페널티로 삼는 L2 정칙화와 유닛을 비활성화하는 드롭아웃은 정규화층이 아니라 정칙화로 분류된다.
문제 23 | 풀링층
풀링층이 담당하는 역할로 가장 적절한 것은 어느 것인가?
층을 건너뛰어 입력을 앞의 층에 더해 넣어 기울기가 도달하는 경로를 만든다
중간층 출력의 분포를 맞추어 학습을 안정시키고 빠르게 한다
영역을 대표값으로 축약해 위치의 미세한 차이에 강한 모델로 만든다
입력을 낮은 차원으로 압축한 뒤 원래 입력을 복원할 수 있게 한다
정답C. 영역을 대표값으로 축약해 위치의 미세한 차이에 강한 모델로 만든다
풀링층은 정해진 크기의 영역을 하나의 대표값으로 축약하는 층으로, 영역의 최댓값을 취하는 최대 풀링과 평균을 취하는 평균 풀링이 있다. 해상도가 낮아져 계산이 가벼워질 뿐 아니라 피사체가 몇 픽셀 어긋나도 대표값이 잘 바뀌지 않으므로 위치의 어긋남에 강해진다. 이를 불변성 획득이라 한다. 특징 맵 한 장을 통째로 평균 내어 하나의 값으로 만드는 글로벌 평균 풀링(GAP)은 마지막에 완전연결층을 쌓는 대신 사용하면 파라미터를 크게 줄일 수 있다. 풀링층에 학습하는 가중치가 없다는 점도 합성곱층과의 차이이다. 층을 건너뛰어 더해 넣는 것은 스킵 연결, 분포를 맞추는 것은 정규화층, 압축한 뒤 복원하는 것은 오토인코더이다.
문제 24 | 스킵 연결
스킵 연결을 도입하면 매우 깊은 신경망에서도 학습이 진행되는 이유는 무엇인가?
층을 건너뛰는 경로가 생겨 기울기가 얕은 길을 따라 입력 쪽까지 도달하기 때문에
유닛이 무작위로 비활성화되어 특정 경로에 의존하지 않게 되기 때문에
각 층의 출력 분포가 맞춰져 값의 흔들림이 층마다 억제되기 때문에
가중치의 수가 줄어 한정된 데이터로도 과적합하기 어려워지기 때문에
정답A. 층을 건너뛰는 경로가 생겨 기울기가 얕은 길을 따라 입력 쪽까지 도달하기 때문에
스킵 연결은 몇 개의 층을 건너뛰어 입력을 그대로 앞의 층의 출력에 더해 넣는 배선이다. 역전파 시 기울기는 많은 층을 지나는 긴 경로뿐 아니라 건너뛰는 짧은 경로도 지나 입력 쪽까지 도달하므로, 깊게 쌓아도 기울기가 사라지기 어려워진다. 이 사고방식을 도입해 100층을 넘는 깊이를 현실로 만든 대표 사례가 ResNet으로, 시라버스에서 스킵 연결 중항목에 놓인 키워드는 ResNet뿐이다. 유닛을 무작위로 비활성화하는 것은 드롭아웃, 각 층의 분포를 맞추는 것은 정규화층으로, 둘 다 스킵 연결과는 다른 구조이다. 스킵 연결은 가중치의 수를 줄이는 방법도 아니다.
문제 25 | LSTM과 GRU
LSTM과 GRU가 가진 게이트에 대해 올바른 조합은 어느 것인가?
LSTM도 GRU도 리셋과 업데이트 2개의 게이트를 공통으로 가진다
LSTM도 GRU도 입력과 출력과 망각 3개의 게이트를 공통으로 가진다
LSTM은 입력과 출력과 망각 3개, GRU는 리셋과 업데이트 2개를 가진다
LSTM은 리셋과 업데이트 2개, GRU는 입력과 출력과 망각 3개를 가진다
정답C. LSTM은 입력과 출력과 망각 3개, GRU는 리셋과 업데이트 2개를 가진다
LSTM은 정보를 저장해 두는 CEC라는 기억 경로를 가지며, 거기에 무엇을 써넣을지 정하는 입력 게이트, 무엇을 버릴지 정하는 망각 게이트, 무엇을 밖으로 낼지 정하는 출력 게이트 3개로 출입을 제어한다. 이 구조 덕분에 긴 의존 관계를 유지할 수 있게 되어 순환 신경망의 기울기 소실 문제가 크게 완화되었다. GRU는 LSTM을 간략화한 것으로 게이트는 리셋 게이트와 업데이트 게이트 2개뿐이다. 파라미터가 적어 계산이 가벼운 한편 항상 LSTM보다 성능이 좋은 것은 아니다. 게이트 수가 3개와 2개라는 점, CEC는 LSTM 쪽의 용어라는 점이 반복해서 출제되는 구분이다.
문제 26 | 조르당
조르당 네트워크의 구조로 적절한 것은 어느 것인가?
출력층의 출력을 다음 시각의 은닉층에 되돌려 입력한다
은닉층의 출력을 다음 시각의 은닉층에 되돌려 입력한다
출력층의 출력을 같은 시각의 입력층에 되돌려 입력한다
입력층의 값을 그대로 출력층까지 건너뛰어 더해 넣는다
정답A. 출력층의 출력을 다음 시각의 은닉층에 되돌려 입력한다
조르당 네트워크는 출력층의 출력을 다음 시각의 은닉층에 되돌려 입력하는 형태의 순환 신경망이다. 이에 반해 은닉층의 출력을 다음 시각의 은닉층에 되돌리는 것이 엘만 네트워크로, 무엇을 되돌리는지가 둘의 차이가 된다. 둘 다 시계열 데이터를 순서 그대로 다루기 위한 구조로, 학습에는 시간 방향으로 신경망을 펼친 뒤 오차역전파법을 적용하는 BPTT를 사용한다. 긴 계열에서는 기울기 소실 문제와 기울기 폭발 문제가 강하게 나타나므로 게이트 구조를 가진 LSTM이나 GRU가 쓰인다. 층을 건너뛰어 더해 넣는 것은 스킵 연결로, 시간 방향의 이야기가 아니다.
문제 27 | Attention
Source-Target Attention에 대한 설명으로 적절한 것은 어느 것인가?
같은 계열 안에서 각 요소끼리의 관련 강도를 계산하는 구조이다
서로 다른 두 계열 사이에서 관련의 강도를 계산하는 구조이다
여러 주목 방식을 병렬로 실행해 결과를 모으는 구조이다
각 위치에 고유한 신호를 더해 단어 순서 정보를 부여하는 구조이다
정답B. 서로 다른 두 계열 사이에서 관련의 강도를 계산하는 구조이다
Attention은 입력의 어디에 주목해야 할지를 가중치로 계산하는 구조로, 쿼리·키·밸류 세 가지로 표현된다. 이 중 Source-Target Attention은 번역처럼 입력 계열과 출력 계열이 나뉘어 있는 상황에서 서로 다른 두 계열 사이의 관련 강도를 계산한다. 같은 계열 안에서 각 요소끼리의 관계를 계산하는 쪽이 Self-Attention으로, Transformer의 중심 구성 요소이다. 각 위치에 고유한 신호를 더해 어순을 부여하는 것은 위치 인코딩, 여러 주목 방식을 병렬로 실행해 결과를 모으는 것은 Multi-Head Attention으로, 모두 Transformer를 구성하는 별개의 부품이다.
문제 28 | 위치 인코딩
Transformer에 대한 설명으로 적절한 것은 어느 것인가?
입력을 낮은 차원으로 압축한 뒤 그로부터 원래 입력을 복원하도록 학습하는 모델
합성곱과 풀링을 번갈아 쌓아 국소적인 특징을 단계적으로 모으는 모델
회귀 결합을 쓰지 않고 Attention으로 구성하며 어순은 위치 인코딩으로 부여한다
회귀 결합을 쌓은 구조로 이전 시각의 상태를 순서대로 넘겨주는 모델
정답C. 회귀 결합을 쓰지 않고 Attention으로 구성하며 어순은 위치 인코딩으로 부여한다
Transformer는 회귀 결합을 쓰지 않고 Attention을 중심으로 구성한 계열 모델이다. 이전 시각의 계산을 기다릴 필요가 없으므로 계열 전체를 병렬로 처리할 수 있고, 멀리 떨어진 단어끼리의 관계도 한 번의 계산으로 직접 파악할 수 있다. 다만 병렬로 처리하면 단어의 순서 정보가 사라지므로 각 위치에 고유한 신호를 더하는 위치 인코딩으로 어순을 부여한다. Transformer는 순환 신경망의 일종이 아니라는 점이 함정이다. 회귀 결합을 쌓아 이전 시각의 상태를 넘겨주는 것은 RNN, 합성곱과 풀링을 쌓는 것은 CNN, 압축한 뒤 복원하는 것은 오토인코더에 대한 설명이다.
문제 29 | VAE
변분 오토인코더(VAE)가 일반적인 오토인코더와 다른 점은 어느 것인가?
입력을 일단 낮은 차원으로 압축한 뒤 원래 입력을 복원하는 점
압축한 곳을 하나의 점이 아니라 확률분포로 학습해 새로운 데이터를 만들 수 있는 점
정답 라벨을 준비하지 않아도 학습을 진행할 수 있게 한 점
층을 하나씩 순서대로 학습시켜 깊은 신경망의 초깃값을 만드는 점
정답B. 압축한 곳을 하나의 점이 아니라 확률분포로 학습해 새로운 데이터를 만들 수 있는 점
변분 오토인코더(VAE)는 입력을 압축한 곳을 하나의 점이 아니라 확률분포로 학습한다. 그 분포에서 값을 꺼내 복원하면 학습 데이터에는 없던 새로운 데이터를 만들 수 있으므로 생성 모델로 다뤄진다. 낮은 차원으로 압축한 뒤 복원하는 것과 정답 라벨 없이 학습할 수 있는 것은 일반적인 오토인코더에도 공통되는 성질로 VAE만의 특징이 아니다. 층을 하나씩 순서대로 학습시켜 깊은 신경망의 초깃값을 만드는 것은 적층 오토인코더에 의한 사전학습이다. 시라버스에는 VQ-VAE·info VAE·β-VAE도 같은 중항목에 실려 있다.
문제 30 | Mixup
이미지의 데이터 증강 기법 중 Mixup이 수행하는 조작은 어느 것인가?
이미지의 일부를 잘라내어 확대한 것을 새로운 예로 만든다
두 장의 이미지를 겹쳐서 한 장의 새로운 예를 만들어 낸다
이미지를 좌우로 뒤집어 방향이 다른 예를 만들어 낸다
이미지의 일부를 사각형으로 칠해 그 부분의 정보를 가린다
정답B. 두 장의 이미지를 겹쳐서 한 장의 새로운 예를 만들어 낸다
Mixup은 두 장의 이미지를 일정한 비율로 겹치고 정답 라벨도 같은 비율로 섞어 새로운 학습 데이터를 만드는 데이터 증강 기법이다. 이름이 비슷한 CutMix는 겹치는 대신 두 장의 일부를 잘라 붙여 한 장으로 만든다. 이미지의 일부를 사각형으로 칠하는 것은 Cutout이나 Random Erasing, 좌우로 뒤집는 것은 Random Flip, 일부를 잘라내는 것은 Crop이다. 그 밖에 회전시키는 Rotate, 밝기를 바꾸는 Brightness, 대비를 바꾸는 Contrast, 어떤 변환을 얼마나 적용할지 자동으로 정하는 RandAugment가 있으며 텍스트용으로는 paraphrasing과 noising이 제시되어 있다. 모두 의미를 해치지 않는 변환을 고르는 것이 중요하다.
문제 31 | GoogLeNet
GoogLeNet의 특징으로 적절한 것은 어느 것인가?
크기가 다른 필터를 병렬로 적용하는 Inception 모듈을 사용했다
2012년 ILSVRC에서 우승했으며 ReLU 함수와 GPU를 이용한 학습을 사용했다
층을 건너뛰는 스킵 연결을 도입해 100층을 넘는 깊이를 실현했다
3×3의 작은 합성곱만을 쌓아 깊은 구성을 취했다
정답A. 크기가 다른 필터를 병렬로 적용하는 Inception 모듈을 사용했다
GoogLeNet은 크기가 다른 필터를 병렬로 적용해 결과를 모으는 Inception 모듈을 사용해 파라미터를 억제하면서도 깊은 구성을 실현한 모델이다. 3×3의 작은 합성곱만을 쌓는 단순하고 깊은 구성을 취한 것은 VGG로, GoogLeNet과 같은 2014년 ILSVRC에서 상위에 들었다. 층을 건너뛰는 스킵 연결로 100층을 넘는 깊이를 가능하게 한 것은 ResNet, 2012년 ILSVRC에서 우승하고 ReLU 함수와 드롭아웃, GPU 학습을 조합한 것은 AlexNet이다. 이후 Wide ResNet, DenseNet, SENet, EfficientNet, MobileNet 등으로 이어졌고, 합성곱을 쓰지 않고 Transformer의 사고방식을 들여온 Vision Transformer도 수록되어 있다.
문제 32 | 1단계 검출
YOLO와 SSD에 공통되는 특징으로 적절한 것은 어느 것인가?
후보 영역을 낸 뒤 분류한다는 2단계 절차로 물체를 검출한다
픽셀 하나하나에 클래스를 할당해 이미지의 영역을 나누어 칠한다
후보 영역 추출과 분류를 한 번의 추론으로 모아서 수행해 속도를 중시한다
인체 관절 위치를 추정해 자세를 구하는 것을 목적으로 한다
정답C. 후보 영역 추출과 분류를 한 번의 추론으로 모아서 수행해 속도를 중시한다
YOLO와 SSD는 후보 영역 추출과 클래스 판정을 한 번의 추론으로 모아서 수행하는 1단계 물체 검출 모델로, 속도가 강점이다. 이에 반해 R-CNN에서 시작해 Fast R-CNN, Faster R-CNN으로 발전한 계통은 먼저 후보 영역을 낸 뒤 분류하는 2단계 방식으로, 느린 대신 정확도가 나오기 쉽다. 픽셀마다 클래스를 할당하는 것은 시맨틱 세그멘테이션으로 FCN·SegNet·U-Net·PSPNet·DeepLab이 대표적이다. 같은 클래스의 물체를 개체까지 구분하는 인스턴스 세그멘테이션은 Mask R-CNN이 담당하고, 인체 관절을 추정하는 자세 추정은 OpenPose가 대표적이다.
문제 33 | BERT
BERT에 대한 설명으로 적절한 것은 어느 것인가?
이미지와 설명문을 같은 벡터 공간에 대응시켜 둘을 연결한다
노이즈를 더하는 과정을 거꾸로 되짚어 데이터를 조금씩 생성해 나간다
Transformer의 인코더를 사용해 앞뒤 양방향에서 문맥을 본다
회귀 결합층을 쌓아 단어를 하나씩 순서대로 읽어 나가며 문맥을 만든다
정답C. Transformer의 인코더를 사용해 앞뒤 양방향에서 문맥을 본다
BERT는 Transformer의 인코더를 사용한 언어 모델로, 문장의 앞뒤 양방향에서 문맥을 보며 사전학습한다는 점이 특징이다. 대량의 텍스트로 사전학습한 뒤 개별 과제에 적응시키는 사용법을 널리 퍼뜨렸다. 회귀 결합층을 쌓아 단어를 순서대로 읽어 나가는 것은 순환 신경망을 사용한 모델로, Transformer는 회귀 결합을 가지지 않는다. 이미지와 설명문을 같은 벡터 공간에 대응시키는 것은 CLIP으로, 시라버스에서는 멀티모달에 놓여 있다. 노이즈를 더하는 과정을 거꾸로 되짚어 생성하는 것은 Diffusion Model로, 이쪽은 데이터 생성의 중항목이다.
문제 34 | CBOW
word2vec의 CBOW가 학습하는 방향으로 적절한 것은 어느 것인가?
주변에 나타나는 단어로부터 그 중심 단어를 맞히도록 학습한다
중심 단어로부터 그 주변에 나타나는 단어를 맞히도록 학습한다
문장 전체로부터 그 문장이 긍정적인지 부정적인지를 맞히도록 학습한다
앞쪽 문장으로부터 이어지는 뒤쪽 문장이 오는지 여부를 맞히도록 학습한다
정답A. 주변에 나타나는 단어로부터 그 중심 단어를 맞히도록 학습한다
CBOW는 주변에 나타나는 단어로부터 그 중심 단어를 맞히도록 학습하는 방식이다. 반대로 중심 단어로부터 주변 단어를 맞히도록 학습하는 것이 Skip-gram으로, 방향이 반대이므로 혼동에 주의해야 한다. 둘 다 word2vec의 방식으로, 단어를 밀집 벡터로 나타내는 분산 표현을 얻는 것이 목적이다. 단어 하나에 차원 하나를 할당하는 원-핫 벡터는 차원이 어휘 크기가 되는 데다 단어끼리의 가까움을 나타낼 수 없는 반면, 분산 표현에서는 의미가 가까운 단어가 벡터 공간에서 가깝게 배치된다. 문장이 긍정적인지 부정적인지를 맞히는 것은 감성 분석이라는 응용 과제로, 단어 표현의 학습 방식에 대한 이야기가 아니다.
문제 35 | RLHF
사람의 피드백을 바탕으로 보상 모델을 만들고 강화학습으로 모델을 조정하는 기법은 어느 것인가?
DQN
A3C
PPO
RLHF
정답D. RLHF
RLHF는 사람이 매긴 선호 평가로부터 보상 모델을 만들고, 이를 보상으로 삼아 강화학습으로 모델을 조정하는 기법이다. 언어 모델의 조정으로 잘 알려져 있지만 시라버스에서는 자연어 처리가 아니라 심층 강화학습의 중항목에 놓여 있는 점이 의외이니 기억해 두면 도움이 된다. DQN은 행동 가치 함수를 신경망으로 근사하는 심층 강화학습의 대표 기법, PPO는 정책의 갱신 폭을 억제해 안정시키는 정책 학습 기법, A3C는 여러 환경을 병렬로 돌려 학습을 진행하는 기법이다. 같은 중항목에는 더블 DQN, 듀얼링 네트워크, Rainbow, APE-X, Agent57 등도 나란히 놓인다.
문제 36 | Diffusion
Diffusion Model에 대한 설명으로 적절한 것은 어느 것인가?
여러 시점의 사진으로부터 3차원적인 모습을 학습해 새로운 시점의 상을 만든다
압축한 곳을 확률분포로 학습해 거기서 꺼내어 복원한다
두 개의 신경망을 경쟁시키며 진짜 같은 데이터를 생성한다
노이즈를 단계적으로 더해 가는 과정을 거꾸로 되짚어 데이터를 생성한다
정답D. 노이즈를 단계적으로 더해 가는 과정을 거꾸로 되짚어 데이터를 생성한다
Diffusion Model은 데이터에 노이즈를 조금씩 더해 가는 과정을 거꾸로 되짚음으로써 노이즈에서 목표하는 데이터를 만들어 내는 생성 모델이다. 두 개의 신경망을 경쟁시키며 학습하는 적대적 생성 신경망(GAN)과는 구조가 전혀 달라 GAN의 일종이 아니다. GAN에서는 DCGAN, CycleGAN, Pix2Pix가 파생되었다. 여러 시점의 사진으로부터 3차원적인 모습을 학습하는 것은 NeRF, 압축한 곳을 확률분포로 학습하는 것은 변분 오토인코더(VAE)이다. GAN과 VAE와 Diffusion Model은 나란히 놓이는 별개의 계통으로 정리해 두어야 한다.
문제 37 | 전이 학습
전이 학습과 파인튜닝의 차이로 적절한 것은 어느 것인가?
전이 학습은 가중치 전체를 다시 학습하고, 파인튜닝은 출력층만 학습한다
전이 학습도 파인튜닝도 사전학습을 하지 않고 처음부터 가중치를 학습해 나간다
전이 학습은 주로 출력층 부근을 학습하고, 파인튜닝은 넓은 범위를 다시 학습한다
전이 학습은 이미지에만, 파인튜닝은 언어에만 사용할 수 있는 기법이다
정답C. 전이 학습은 주로 출력층 부근을 학습하고, 파인튜닝은 넓은 범위를 다시 학습한다
전이 학습은 사전학습된 모델에서 특징을 추출하는 부분은 고정한 채 주로 출력층 부근만을 새로운 과제로 학습하는 방법이다. 파인튜닝은 가중치의 전체 또는 넓은 범위를 새로운 데이터로 다시 학습하는 것으로, 필요한 데이터와 계산은 늘어나는 대신 대상 영역이 사전학습 데이터와 크게 다를 경우 성능이 오르기 쉽다. 파인튜닝에서는 원래 모델이 가지고 있던 능력이 사라지는 파괴적 망각이 일어날 수 있다. 둘 다 사전학습된 모델을 전제로 하는 기법이며 처음부터 학습하는 것이 아니다. 또한 다루는 데이터의 종류로 용도가 나뉘는 것도 아니다.
문제 38 | 기반 모델
시라버스에서 기반 모델이라는 용어가 놓여 있는 중항목은 어느 것인가?
전이 학습과 파인튜닝에 놓여 있으며 Few-shot과 나란히 있다
멀티모달에 놓여 있으며 CLIP이나 DALL-E와 나란히 있다
심층 강화학습에 놓여 있으며 DQN이나 RLHF와 나란히 있다
자연어 처리에 놓여 있으며 대규모 언어 모델(LLM)과 나란히 있다
정답B. 멀티모달에 놓여 있으며 CLIP이나 DALL-E와 나란히 있다
기반 모델은 대량의 데이터로 사전학습해 다양한 다운스트림 과제에 전용할 수 있는 대규모 모델을 가리키는 용어로, 시라버스에서는 32번 멀티모달에 놓여 있으며 CLIP·DALL-E·Flamingo·Unified-IO·Zero-shot 등과 나란히 있다. 생성형 AI 관련 용어는 배치가 흩어져 있어, 대규모 언어 모델(LLM)은 27번 자연어 처리, RLHF는 29번 심층 강화학습에 수록되어 있다. 31번 전이 학습·파인튜닝에 나란히 놓이는 것은 Few-shot, One-shot, 자기지도학습, 사전학습 모델, 파괴적 망각 등이다. 어느 중항목에 무엇이 놓여 있는지를 파악해 두면 범위의 전체상을 잡기 쉽다.
문제 39 | SHAP
설명 가능한 AI(XAI)의 기법인 SHAP의 사고방식으로 적절한 것은 어느 것인가?
특징값을 일부러 뒤바꾸어 정확도가 떨어지는 정도로 중요도를 잰다
이미지의 어디를 보고 판단했는지를 열지도 같은 형태로 보여 준다
예측 주변에서 단순한 모델을 적합시켜 그 계수로 설명한다
협력 게임 이론의 사고방식으로 각 특징의 기여를 배분해 보여 준다
정답D. 협력 게임 이론의 사고방식으로 각 특징의 기여를 배분해 보여 준다
SHAP은 협력 게임 이론에서 쓰이는 사고방식을 빌려 예측에 대한 각 특징의 기여를 공평하게 배분해 보여 주는 기법이다. 이미지의 어디를 보고 판단했는지를 열지도 같은 형태로 보여 주는 것은 CAM이나 Grad-CAM, 특징값을 일부러 뒤바꾸어 정확도가 떨어지는 정도로 중요도를 재는 것은 Permutation Importance, 개별 예측 주변에서 단순한 모델을 적합시켜 그 계수로 설명하는 것은 LIME이다. 이들은 모두 시라버스의 33번 모델의 해석 가능성에 수록되어 있으며, 판단 근거를 사람이 이해할 수 있는 형태로 보여 주는 노력을 통틀어 설명 가능한 AI(XAI)라 부른다.
문제 40 | 복권 가설
모델 경량화에 관한 복권 가설의 내용으로 적절한 것은 어느 것인가?
큰 교사 모델의 출력을 작은 모델에 학습시키면 성능을 유지할 수 있다는 사고방식
큰 신경망 안에 단독으로 학습해도 동등한 성능에 도달하는 부분이 있다는 사고방식
모델을 크게 할수록 필요한 학습 데이터가 지수적으로 늘어난다는 사고방식
가중치를 나타내는 수치의 정밀도를 낮춰도 정확도 저하는 아주 미미하다는 사고방식
정답B. 큰 신경망 안에 단독으로 학습해도 동등한 성능에 도달하는 부분이 있다는 사고방식
복권 가설은 큰 신경망 안에 그것만 따로 꺼내 학습시켜도 전체와 동등한 성능에 도달하는 당첨 부분 신경망이 포함되어 있다는 가설이다. 기여가 작은 연결이나 층을 잘라내는 가지치기가 왜 잘 작동하는지를 설명하는 배경으로 이야기된다. 큰 교사 모델의 출력을 작은 모델에 학습시키는 것은 지식 증류, 가중치를 나타내는 수치의 정밀도를 낮추는 것은 양자화로, 가지치기와 합친 세 가지가 시라버스의 경량화 기법에 해당하며 통틀어 모델 압축이라 한다. 필요한 학습 데이터가 급격히 늘어나는 것은 차원의 저주 이야기이다. 경량화가 요구되는 전형적인 예는 단말 쪽에서 추론을 돌리는 엣지 AI이다.
연습: 이 페이지의 문제 풀기
무작위로 출제하는 연습 도구입니다(JavaScript가 활성화된 경우에 작동합니다). 위의 문제와 해설은 그대로 모두 읽을 수 있습니다.
※ 해설은 학습용 정보 제공입니다. 시험 출제 범위와 제도는 연도에 따라 바뀌므로, 반드시 시행 기관의 공식 발표를 확인하십시오.
이 페이지는 일본어 원문을 번역한 것입니다. 번역과 원문의 내용이 다를 경우 일본어판이 우선합니다. 일본어 원문 보기