데이터 분석 프로젝트의 표준적인 진행 방식인 CRISP-DM에서 맨 처음에 놓이는 단계의 내용은 어느 것인가?
가지고 있는 데이터의 품질이나 분포를 조사해 경향을 파악한다
결측값 처리와 특징량 작성을 수행해 학습용으로 정리한다
풀어야 할 업무상의 과제와 성공이라 할 수 있는 기준을 명확히 한다
만든 모델을 업무 시스템에 넣어 운용한다
정답C. 풀어야 할 업무상의 과제와 성공이라 할 수 있는 기준을 명확히 한다
CRISP-DM은 비즈니스 이해, 데이터 이해, 데이터 준비, 모델링, 평가, 전개의 6단계로 이루어진다. 맨 처음은 비즈니스 이해로, 풀어야 할 업무 과제와 어떻게 되면 성공이라 할 수 있는지의 기준을 정한다. 데이터의 품질이나 분포를 조사하는 것은 데이터 이해, 결측값 처리와 특징량 작성은 데이터 준비, 업무 시스템에의 반영은 전개 단계에 해당한다. 6단계는 한 방향으로만 흐르는 것이 아니라 앞 단계로 돌아가며 반복하는 순환 구조로 그려진다는 점도 기억해 두어야 한다.
문제 2 | PoC
AI 프로젝트에서 PoC의 위치로 가장 적절한 것은 어느 것인가?
본격적인 개발에 들어가기 전에 소규모로 시험해 실현 가능성과 효과를 확인하는 공정
학습 데이터에 정답 라벨을 붙이는 작업을 기준을 정해 진행하는 공정
완성한 모델을 실제 운영 환경에 배치해 지속적으로 모니터링과 재학습을 수행하는 공정
업무의 흐름 자체를 목적에서부터 다시 설계해 생산성을 높이는 공정
정답A. 본격적인 개발에 들어가기 전에 소규모로 시험해 실현 가능성과 효과를 확인하는 공정
PoC는 개념 증명을 뜻하며, 본격적인 개발에 투자하기 전에 작게 만들어 시험함으로써 그 데이터로 필요한 정확도가 나오는지, 나온다면 업무가 돌아가는지를 확인하는 공정이다. 완성품을 만드는 것이 목적이 아니므로 시작하기 전에 다음으로 나아갈 조건과 철수할 조건을 정해 두지 않으면 성과 없는 시도를 반복하게 된다. 실제 운영 배치 후 모니터링과 재학습을 돌리는 것은 MLOps, 정답 라벨을 붙이는 작업은 어노테이션, 업무의 흐름 자체를 다시 설계하는 것은 BPR로, 모두 PoC와는 다른 공정을 가리킨다.
문제 3 | 어노테이션
머신러닝을 위한 데이터 준비에서 수행하는 어노테이션에 대한 설명으로 적절한 것은 어느 것인가?
수집한 데이터에서 결측값이나 이상값을 제거해 분포를 정리한다
수집한 문장을 대량으로 모아 정리해 언어 처리용 데이터 집합으로 만든다
수집한 데이터를 훈련용과 검증용으로 나누어 성능을 잴 수 있는 형태로 만든다
수집한 데이터에 학습의 정답이 되는 라벨이나 영역 정보를 사람이 직접 붙인다
정답D. 수집한 데이터에 학습의 정답이 되는 라벨이나 영역 정보를 사람이 직접 붙인다
어노테이션은 원본 데이터에 정답 라벨이나 영역 정보를 사람이 직접 붙이는 작업으로, 지도학습에 빠질 수 없다. 붙이는 기준이 작업자마다 흔들리면 모델 성능의 상한이 거기서 정해져 버리므로 작업 지침서와 품질 점검 설계가 중요하다. 대량의 문장을 모아 정리한 것은 코퍼스, 훈련용과 검증용으로의 분할이나 결측값과 이상값 처리는 데이터 준비 중 다른 작업으로, 모두 라벨을 붙이는 행위 자체는 아니다.
문제 4 | 리키지
학습 데이터 취급에서 비롯되는 데이터 리키지에 대한 설명으로 가장 적절한 것은 어느 것인가?
검증용 데이터가 너무 적어 측정한 정확도 자체가 불안정해지는 현상
예측 시점에는 얻을 수 없는 정보가 학습에 섞여 들어가 성능이 부당하게 높게 보이는 현상
훈련 데이터에 지나치게 맞춘 결과 미지의 데이터에 대한 성능이 떨어지는 현상
특징량의 차원이 지나치게 늘어나 필요한 데이터양이 급격히 부풀어 오르는 현상
정답B. 예측 시점에는 얻을 수 없는 정보가 학습에 섞여 들어가 성능이 부당하게 높게 보이는 현상
데이터 리키지는 예측을 수행하는 시점에는 본래 얻을 수 없어야 할 정보가 학습 데이터에 섞여 들어가 검증 시 정확도가 실제 실력보다 훨씬 높게 나오는 현상이다. 해지 예측에 해지 절차 접수일을 넣거나, 전처리의 평균이나 표준편차를 검증 데이터까지 포함한 전체에서 계산하거나, 시계열 데이터를 시간을 무시하고 무작위로 분할하는 등의 형태로 일어난다. 훈련 데이터에 지나치게 맞추는 것은 과적합으로, 원인은 '써서는 안 되는 정보를 썼다'는 것이 아니라 '지나치게 맞췄다'는 데 있다. 차원이 늘어나 필요 데이터양이 부풀어 오르는 것은 차원의 저주로, 모두 리키지와는 원인이 다르다.
문제 5 | MLOps
AI 시스템 운용에서 MLOps의 사고방식으로 가장 적절한 것은 어느 것인가?
배치 후에도 데이터와 정확도를 모니터링하며 재학습과 재배치를 지속적으로 돌린다
학습에 쓰는 계산 자원을 클라우드에서 빌려 쓴 만큼만 비용을 억제한다
개발 환경을 컨테이너로 모아 실제 운영에서도 같은 환경을 재현할 수 있게 한다
실제 운영 배치 전에 모델의 정확도가 요구사항을 만족하는지 한 번 확인해 둔다
정답A. 배치 후에도 데이터와 정확도를 모니터링하며 재학습과 재배치를 지속적으로 돌린다
MLOps는 모델을 배치하고 끝내는 것이 아니라 입력 데이터의 분포나 예측 경향, 업무 지표까지 모니터링하며 어긋남이 생기면 학습 데이터를 갱신해 다시 만들고 다시 배치하는 순환을 구조로서 돌리는 사고방식이다. 세상이 바뀌면 입력의 경향도 바뀌어 정확도는 조용히 떨어지므로 한 번의 확인만으로는 부족하다. 계산 자원을 빌리는 것은 클라우드의 이용, 실행 환경을 모아 재현하는 것은 Docker의 역할로, 둘 다 MLOps를 뒷받침하는 도구이기는 하지만 그 자체가 MLOps의 정의는 아니다.
문제 6 | BPR
AI 도입과 함께 논의되는 BPR의 내용으로 적절한 것은 어느 것인가?
업무 담당자를 모아 AI에 요구하는 요건을 청취해 나가는 것
업무 데이터를 수집해 AI가 학습할 수 있는 형태로 정리해 나가는 것
목적으로 거슬러 올라가 업무의 흐름 자체를 다시 설계하는 것
기존 업무 절차를 유지한 채 일부 작업을 AI로 대체하는 것
정답C. 목적으로 거슬러 올라가 업무의 흐름 자체를 다시 설계하는 것
BPR은 비즈니스 프로세스 리엔지니어링을 뜻하며, 기존 업무 절차를 부분적으로 개선하는 것이 아니라 무엇을 위한 업무인지로 거슬러 올라가 흐름 자체를 다시 설계하는 시도를 가리킨다. 절차를 남긴 채 AI를 얹으면 AI의 출력을 사람이 옮겨 적는 공정만 늘어나 효과가 나지 않는 경우가 있어, AI 도입의 성패는 정확도보다 이 지점에서 정해지는 경우가 적지 않다. 요건 청취는 이해관계자 요구 파악, 학습할 수 있는 형태로의 정리는 데이터 준비에 해당하며 모두 업무 프로세스 자체의 재설계는 아니다.
문제 7 | 개발 진행 방식
AI 개발에 워터폴을 그대로 적용하기 어렵다고 여겨지는 이유로 가장 적절한 것은 어느 것인가?
개발에 사용하는 언어나 라이브러리의 선택지가 많아 표준화가 진행되지 않았기 때문에
개발에 관여하는 담당자의 직종이 다양해 공정 분담을 정하기 어렵기 때문에
학습해 보기 전까지는 도달할 정확도를 알 수 없어 요구사항을 미리 고정할 수 없기 때문에
학습에 필요한 계산 자원의 조달에 시간이 걸려 공정이 예정대로 진행되지 않기 때문에
정답C. 학습해 보기 전까지는 도달할 정확도를 알 수 없어 요구사항을 미리 고정할 수 없기 때문에
워터폴은 요구사항 정의부터 순서대로 공정을 굳혀 뒤로 돌아가지 않는 것을 전제로 진행하는 방식이다. 그런데 AI 개발은 실제로 학습시켜 보기 전까지는 어느 정도의 정확도에 도달할지 알 수 없다는 성질을 가지므로 산출물과 요구사항을 미리 확정할 수 없다. 그래서 탐색이나 PoC 단계는 짧은 반복으로 진행하는 애자일 형태를 취하고, 정확도가 전망된 이후 본개발 공정을 굳히는 조합이 취해진다. 이 성질은 개발 위탁을 도급계약과 준위임계약 중 어느 쪽으로 할지를 정하는 계약 설계에도 직접 영향을 준다.
문제 8 | Docker
AI 개발에서 Docker를 사용하는 주된 목적은 어느 것인가?
라이브러리까지 포함한 실행 환경을 모아 다른 환경에서도 같은 상태로 동작시킨다
학습을 마친 모델을 다른 시스템에서 HTTP로 호출할 수 있는 형태로 공개한다
학습의 중간 경과와 실행 결과를 설명문과 함께 하나의 문서로 남긴다
대량의 계산 자원을 필요한 시간만큼 빌리고 다 쓰면 반환한다
정답A. 라이브러리까지 포함한 실행 환경을 모아 다른 환경에서도 같은 상태로 동작시킨다
Docker는 애플리케이션과 라이브러리를 포함한 실행 환경을 컨테이너로 모으는 기술이다. 같은 컨테이너를 개발용 기기에서도 실제 운영에서도 돌릴 수 있으므로 버전 차이로 인한 '내 환경에서는 되는데' 하는 불일치가 줄어든다. 중간 경과와 결과를 설명문과 함께 하나의 문서로 남기는 것은 Jupyter Notebook, HTTP로 호출할 수 있는 형태로 만드는 것은 Web API, 필요한 시간만큼 계산 자원을 빌리는 것은 클라우드의 이용으로, 모두 AI 개발에서 쓰이는 별개의 도구를 가리킨다.
문제 9 | 코퍼스
자연어 처리 분야에서 말하는 코퍼스에 대한 설명으로 적절한 것은 어느 것인가?
연구나 개발을 위해 널리 공개되어 있는 이미지나 음성 데이터 집합
문장을 단어로 나누어 품사를 판정하는 형태소 분석 처리의 집합
언어 처리를 위해 수집되고 정리된 대량의 문장 데이터 집합
단어를 벡터로 나타내기 위해 학습된 가중치 파라미터의 집합
정답C. 언어 처리를 위해 수집되고 정리된 대량의 문장 데이터 집합
코퍼스는 자연어 처리를 위해 수집되고 정리된 대량의 문장 데이터를 가리킨다. 용도에 따라 품사나 구문 정보가 부여되어 있는 경우도 있다. 연구나 개발을 위해 공개되어 있는 데이터 집합 일반은 오픈 데이터셋으로, 이미지나 음성도 포함하며 문장에 한정되지 않는다. 단어의 벡터 표현은 학습의 결과물이지 데이터 집합이 아니며, 형태소 분석은 문장을 처리하는 기법으로, 모두 코퍼스의 정의와는 다르다. 참고로 코퍼스에도 라이선스와 이용 약관이 있으므로 상업적 이용이나 재배포 가능 여부는 개별적으로 확인해야 한다.
문제 10 | 외부와의 연계
AI 개발의 맥락에서 말하는 오픈 이노베이션에 대한 설명으로 가장 적절한 것은 어느 것인가?
공개되어 있는 데이터셋을 활용해 수집의 수고를 줄이는 것
개발한 모델과 소스 코드를 누구나 쓸 수 있는 형태로 무상 공개하는 것
사내 각 부문에서 사람을 모아 부문을 넘나드는 개발 체제를 만드는 것
외부의 기술이나 지식, 인재를 적극적으로 받아들여 새로운 가치를 만드는 것
정답D. 외부의 기술이나 지식, 인재를 적극적으로 받아들여 새로운 가치를 만드는 것
오픈 이노베이션은 자사 내부의 연구개발에만 갇히지 않고 외부의 기술·지식·인재를 적극적으로 받아들여 가치를 만드는 사고방식이다. 시라버스는 같은 중항목에 산학연계와 다른 기업·다른 업종과의 연계를 나란히 두고 있으며, 대학 등 연구기관과의 공동 연구나 자사에 없는 데이터·판로를 가진 상대와의 조합이 그 수단이 된다. 성과물을 무상 공개하는 것은 오픈소스의 사고방식으로, 외부 자원을 받아들이는 것과는 방향이 반대이다. 사내 부문 횡단 체제나 공개 데이터셋 활용은 모두 사외 주체와의 연계 그 자체를 가리키지는 않는다.
문제 11 | 가공정보의 구분
개인정보보호법에서 익명가공정보와 가명가공정보의 차이로 옳은 것은 어느 것인가?
둘 다 본인 동의가 있으면 제3자에게 제공할 수 있고 동의가 없으면 제공할 수 없다
익명가공정보는 본인 동의 없이 제3자에게 제공할 수 없지만 가명가공정보는 제공할 수 있다
둘 다 가공 정도와 관계없이 제3자 제공이 일률적으로 금지되어 있다
익명가공정보는 본인 동의 없이 제3자에게 제공할 수 있지만 가명가공정보는 원칙적으로 할 수 없다
정답D. 익명가공정보는 본인 동의 없이 제3자에게 제공할 수 있지만 가명가공정보는 원칙적으로 할 수 없다
익명가공정보는 특정 개인을 식별할 수 없도록 가공하고 원래의 개인정보를 복원할 수 없도록 만든 것이다. 여기까지 가공되어 있으므로 정해진 절차를 거치면 본인 동의 없이 제3자에게 제공할 수 있다. 한편 가명가공정보는 다른 정보와 대조하지 않는 한 특정 개인을 식별할 수 없는 정도까지 가공한 것으로, 이름을 삭제하는 등 가공의 수고는 가벼워 분석 가치를 남길 수 있지만 그 대신 원칙적으로 제3자 제공은 할 수 없으며 사업자 내부에서의 분석 이용이 상정되어 있다. 가공이 가벼울수록 밖으로 내보낼 수 없게 된다고 기억해 두면 헷갈리지 않는다.
문제 12 | 개인식별부호
개인정보보호법의 개인식별부호에 관한 설명으로 옳은 것은 어느 것인가?
여권번호나 얼굴인식 데이터 등은 그것만으로도 개인정보로 취급된다
이름과 조합해야 비로소 특정 개인을 식별할 수 있는 것으로 취급된다
본인의 동의를 얻어 취득한 경우에 한해 개인정보로 취급하게 된다
취득 시점에는 대상이 아니며 데이터베이스화한 시점에 개인정보가 된다
정답A. 여권번호나 얼굴인식 데이터 등은 그것만으로도 개인정보로 취급된다
개인식별부호에는 지문 데이터·얼굴인식 데이터·DNA 염기서열을 변환한 부호와 같은 신체적 특징 데이터와, 마이넘버·여권번호·운전면허증 번호처럼 개인에게 부여된 번호가 있다. 이들은 그것만으로도 개인정보에 해당하므로 이름이 들어 있지 않으면 개인정보가 아니라는 이해는 잘못이다. 개인정보에 해당하는지 여부는 취득 시 동의 여부로 정해지는 것도, 데이터베이스화해야 비로소 개인정보가 되는 것도 아니다. 참고로 체계적으로 정리되어 검색할 수 있는 상태가 된 것은 개인데이터라 불리며 추가 의무가 부과된다.
문제 13 | GDPR
GDPR의 위치에 대해 옳은 것은 어느 것인가?
국제기구가 제시한 지침이며 각국에 대한 법적 구속력은 갖지 않는다
일본의 개인정보보호법을 국제적으로 확장하기 위해 정해진 규칙이다
EU의 규칙이며 EU 역내에 거점을 둔 사업자만이 대상이 된다
EU의 규칙이며 EU 역외의 사업자에게도 적용되는 경우가 있다
정답D. EU의 규칙이며 EU 역외의 사업자에게도 적용되는 경우가 있다
GDPR은 EU의 일반 데이터 보호 규칙으로, 일본의 개인정보보호법과는 별개인 EU의 법령이다. 특징은 역외적용이 있다는 점으로, EU 역내에 있는 사람에게 상품이나 서비스를 제공하고 있거나 EU 역내에 있는 사람의 행동을 감시하고 있다는 사정이 있으면 일본 국내에서 개발하고 있는 사업자에게도 적용될 수 있다. 따라서 거점이 EU에 있는지 여부만으로 대상을 판단할 수는 없다. 일본법을 확장한 것도 아니고 구속력 없는 지침도 아니라는 점도 기억해 두어야 한다.
문제 14 | 제30조의4
저작권법 제30조의4가 저작권자의 허락 없이 저작물을 이용할 수 있다고 하는 경우는 어느 것인가?
저작물의 사상이나 감정을 스스로 향수하거나 타인에게 향수시킬 목적이 아닌 경우
이용할 저작물의 분량이 전체의 극히 일부에 그치는 경우
이용할 저작물이 인터넷상에 무상 공개되어 있는 경우
이용 목적이 영리가 아니라 학술적 연구에 한정되어 있는 경우
정답A. 저작물의 사상이나 감정을 스스로 향수하거나 타인에게 향수시킬 목적이 아닌 경우
저작권법 제30조의4는 저작물에 표현된 사상 또는 감정을 스스로 향수하거나 타인에게 향수시키는 것을 목적으로 하지 않는 경우, 필요하다고 인정되는 한도에서 저작물을 이용할 수 있다고 정하고 있다. 향수란 저작물에 표현된 사상이나 감정을 감상해 지적·정신적 만족을 얻는 것을 가리키며, 머신러닝을 위해 데이터로 읽어들이는 행위는 여기에 해당하지 않는다고 정리된다. 같은 조 제2호에는 정보해석이 명시되어 있으며 학습용 데이터의 작성과 학습은 여기에 해당한다. 무상 공개되어 있는 것, 영리 목적이 아닌 것, 분량이 적은 것은 모두 이 조문이 정하는 요건이 아니다.
문제 15 | 단서 조항
AI 학습을 위한 저작물 이용에 대해 저작권법 제30조의4에 대한 이해로 옳은 것은 어느 것인가?
저작물을 유상으로 구입한 경우에 한해 학습을 위한 이용이 인정된다
학습을 위한 이용이라면 어떤 경우에도 저작권자의 이익은 문제가 되지 않는다
저작권자의 이익을 부당하게 해치게 되는 경우에는 이 규정이 적용되지 않는다
학습이 적법하다면 생성물이 기존 저작물과 비슷해도 침해가 되지 않는다
정답C. 저작권자의 이익을 부당하게 해치게 되는 경우에는 이 규정이 적용되지 않는다
제30조의4에는 해당 저작물의 종류 및 용도와 해당 이용 형태에 비추어 저작권자의 이익을 부당하게 해치게 되는 경우에는 그러하지 아니하다는 단서 조항이 있다. 따라서 'AI 학습이라면 어떤 이용도 자유롭다'라고는 할 수 없다. 예를 들어 정보해석용으로 판매되는 데이터베이스를 구입하지 않고 복제해 학습에 사용하면 그 데이터베이스의 시장을 해치므로 단서 조항에 해당한다고 여겨진다. 또한 학습이라는 입력 단계가 적법하더라도 생성물이 기존 저작물과 유사하다면 생성이나 이용이라는 출력 단계에서 저작권 침해가 별도로 문제될 수 있다. 입력과 출력은 별도로 평가된다. 유상으로 구입했는지 여부는 이 조문의 적용을 정하는 기준이 아니다.
문제 16 | 생성물의 저작권
AI 생성물의 저작물성에 대해 현재 확립되어 있는 사고방식에 가장 가까운 것은 어느 것인가?
이용한 서비스의 제공자에게 저작권이 당연히 귀속된다
AI가 출력한 것인 이상 저작물로 인정되는 일은 없다
인간의 창작적 기여가 인정되는지 여부에 따라 개별적으로 판단된다
생성을 지시한 자에게 저작권이 항상 인정된다
정답C. 인간의 창작적 기여가 인정되는지 여부에 따라 개별적으로 판단된다
저작권은 인간의 창작적인 표현을 보호하는 제도이므로 AI가 자동으로 출력하기만 한 것은 저작물이 되지 않는다. 반면 인간이 표현상의 본질적인 특징을 부여했다고 할 수 있을 정도로 관여했다면 저작물성이 인정될 여지가 있다. 판단의 열쇠가 되는 것이 창작적 기여로, 지시나 시행착오의 구체성, 생성물의 선택이나 수정의 정도 등이 개별적으로 검토된다. 따라서 항상 저작물이 되지 않는다는 이해도, 지시를 내린 자에게 항상 권리가 생긴다는 이해도 잘못이다. 참고로 저작권법과는 별도로 이용한 서비스의 이용 약관이 생성물의 취급을 정하고 있는 경우가 있으므로 둘 다 확인할 필요가 있다.
문제 17 | 직무발명
특허법에서 직무발명의 취급으로 옳은 것은 어느 것인가?
근무 규칙 등으로 정하면 사용자에게 귀속시킬 수 있고 종업원은 상당한 이익을 얻는다
직무로서 한 발명이라 하더라도 사용자에게 권리를 귀속시킬 여지는 없다
권리는 항상 사용자에게 귀속되며 근무 규칙 등으로 달리 정할 수 없다
사용자에게 권리가 귀속되는 경우에도 종업원에 대한 이익 지급은 필요 없다
정답A. 근무 규칙 등으로 정하면 사용자에게 귀속시킬 수 있고 종업원은 상당한 이익을 얻는다
직무발명이란 종업원이 직무로서 한 발명을 말한다. 특허를 받을 권리는 원칙적으로 발명자인 종업원에게 생기지만, 미리 근무 규칙 등으로 정해 두면 발생한 때부터 사용자에게 귀속시킬 수도 있다. 그 경우 종업원에게는 상당한 금전 기타 경제상의 이익을 받을 권리가 인정되므로 대가 없이 권리를 빼앗기는 제도가 아니다. 또한 항상 사용자에게 귀속되는 것도, 귀속시킬 여지가 없는 것도 아니며 정함의 유무에 따라 취급이 달라진다는 점이 요점이다.
문제 18 | 영업비밀
부정경쟁방지법에서 영업비밀로 보호받기 위한 요건의 조합은 어느 것인가?
비밀관리성, 유용성, 진보성
비밀관리성, 유용성, 비공지성
유용성, 신규성, 진보성
비밀관리성, 신규성, 비공지성
정답B. 비밀관리성, 유용성, 비공지성
영업비밀의 3요건은 비밀로서 관리되고 있을 것(비밀관리성), 사업활동에 유용한 기술상 또는 영업상의 정보일 것(유용성), 공공연히 알려져 있지 않을 것(비공지성)이며, 세 가지를 모두 충족해야 비로소 보호받는다. 신규성과 진보성은 특허를 받기 위한 요건으로 영업비밀의 요건이 아니다. 특허가 내용의 공개와 맞바꾸어 독점을 얻는 제도인 데 반해 영업비밀은 공개하지 않음으로써 지키는 제도이므로, 학습을 마친 모델의 가중치나 전처리의 고안처럼 공개하고 싶지 않은 정보는 이쪽으로 지키게 된다.
문제 19 | 한정제공데이터
부정경쟁방지법의 한정제공데이터에 대해 옳은 것은 어느 것인가?
특허를 출원했지만 등록에 이르지 못한 기술 정보를 대상으로 하는 구분이다
영업비밀의 3요건을 모두 충족한 뒤 추가로 등록한 정보가 대상이다
누구에게도 제공하지 않고 자사 내부에만 보관하고 있는 정보를 대상으로 하는 구분이다
업으로서 특정한 자에게 제공하는, 상당량 축적되고 관리된 전자적 기록이 대상이다
정답D. 업으로서 특정한 자에게 제공하는, 상당량 축적되고 관리된 전자적 기록이 대상이다
한정제공데이터는 업으로서 특정한 자에게 제공하는 정보로, 전자적 방법으로 상당량 축적되고 관리되고 있는 것을 가리킨다. 데이터를 매매하거나 공유하는 거래를 보호하기 위해 마련된 구분으로, 영업비밀의 3요건을 모두 충족하지 않아도 보호받을 수 있다는 점에 의미가 있다. 여러 상대에게 제공하는 이상 비공지성을 엄밀히 충족한다고는 할 수 없기 때문이다. 자사 내부에서만 비밀로 감싸 두는 정보는 영업비밀 쪽에서 지키는 이야기이며, 특허 출원이나 등록 여부와도 이 구분은 관계가 없다.
문제 20 | 개발 계약
AI 개발 위탁에서 도급계약과 준위임계약의 차이로 옳은 것은 어느 것인가?
도급계약은 일의 완성을 약속하고 준위임계약은 선관주의의무를 가지고 수행한다
도급계약은 선관주의의무를 지는 계약이고 준위임계약은 완성을 약속하는 계약이다
둘 다 성과물의 완성을 약속하는 계약이며 보증하는 정확도 수준만 다르다
둘 다 완성을 약속하지 않는 계약이며 보수를 지급하는 시기만 다르다
정답A. 도급계약은 일의 완성을 약속하고 준위임계약은 선관주의의무를 가지고 수행한다
도급계약은 일의 완성을 약속하는 계약으로, 완성하지 못하면 보수를 청구할 수 없고 계약에 적합하지 않은 성과물에는 책임을 진다. 준위임계약은 사무 처리를 위탁하는 계약으로, 약속하는 것은 완성이 아니라 선량한 관리자의 주의를 가지고 업무를 수행하는 것이다. AI 개발은 학습해 보기 전까지 도달할 정확도를 알 수 없으므로 탐색이나 PoC 단계는 준위임계약, 사양이 굳어진 구현 공정은 도급계약으로 나누는 방식이 자주 채택된다. 일본 경제산업성의 AI·데이터 이용에 관한 계약 가이드라인도 단계를 나누어 계약하는 형태를 제시하고 있다.
문제 21 | 하드로
하드로(hard law)와 소프트로(soft law)의 구별로 옳은 것은 어느 것인가?
하드로는 강제력이 있는 법령을 가리키고 소프트로는 구속력이 없는 규율을 가리킨다
하드로는 벌칙이 있는 법령을 가리키고 소프트로는 벌칙이 없는 법령을 가리킨다
하드로는 국제적인 합의를 가리키고 소프트로는 국내 법령을 가리킨다
하드로는 새로 만들어진 법령을 가리키고 소프트로는 오래된 관행을 가리킨다
정답A. 하드로는 강제력이 있는 법령을 가리키고 소프트로는 구속력이 없는 규율을 가리킨다
하드로는 국가가 정하고 위반에 강제력이 미치는 법령으로, 개인정보보호법이나 저작권법이 여기에 해당한다. 소프트로는 가이드라인·업계의 자율 규범·기업의 행동 지침처럼 법적 구속력을 갖지 않는 규율이다. 소프트로는 법령이 아니므로 벌칙이 있는 법령과 없는 법령이라는 구분은 맞지 않는다. 국내냐 국제냐의 구별도, 신구의 구별도 아니다. 기술 변화가 빠른 분야에서는 먼저 소프트로로 방향을 제시하고 필요한 부분만 법령으로 만드는 방식이 취해지며, 일본의 AI 정책은 기본적으로 소프트로 중심이다.
문제 22 | 리스크 대응
AI 규제나 사내 대응에서 말하는 리스크 기반 접근법(risk-based approach)의 사고방식은 어느 것인가?
리스크가 확인된 시점에서 그 용도의 서비스 제공을 일률적으로 중단한다
예상되는 리스크를 나열한 뒤 모든 용도에 같은 수준의 대책을 부과한다
리스크 평가는 이용자에게 맡기고 사업자는 정보 제공만을 수행한다
용도가 초래하는 리스크의 크기에 따라 대응이나 규제의 강도를 바꿔 나간다
정답D. 용도가 초래하는 리스크의 크기에 따라 대응이나 규제의 강도를 바꿔 나간다
리스크 기반 접근법은 AI 용도가 초래하는 리스크의 크기에 따라 규제나 대응의 강도를 바꾸는 사고방식이다. 같은 얼굴인식 기술이라도 단말기 화면 잠금 해제와 공공 공간에서의 상시 감시는 사람에게 미치는 영향이 전혀 다르다. 용도를 불문하고 일률적으로 강한 규제를 걸면 해가 작은 사용법까지 막게 되고, 일률적으로 완화하면 해가 큰 사용법을 방치하게 된다. 그래서 영향이 큰 용도에는 강한 의무를, 작은 용도에는 가벼운 취급을 배정한다. 사업자 쪽에서도 사내 AI 안건을 리스크의 크기로 구분해 고위험군만 엄격한 심사로 돌리는 형태로 같은 사고방식을 사용한다.
문제 23 | 설계 시의 배려
프라이버시 바이 디자인(Privacy by Design)의 사고방식으로 가장 적절한 것은 어느 것인가?
개인정보를 다루는 담당자를 한정해 권한이 있는 자만 열람할 수 있게 한다
기획이나 설계 단계부터 프라이버시 보호 구조를 넣어 둔다
수집한 데이터의 용도를 이용자의 요구에 따라 공개해 나간다
문제가 생긴 단계에서 원인을 조사해 필요한 대책을 나중에 추가해 나간다
정답B. 기획이나 설계 단계부터 프라이버시 보호 구조를 넣어 둔다
프라이버시 바이 디자인은 문제가 생긴 뒤에 대책을 추가하는 것이 아니라 기획이나 설계 단계부터 프라이버시 보호를 넣어 두는 사고방식이다. 데이터를 모으지 않는 설계로 한다, 필요한 기간에만 두고 지운다, 식별할 수 없는 형태로 처리한다와 같은 판단은 나중에 넣을수록 비용이 커진다. 용도 공개나 열람 권한 한정은 그 자체로는 옳은 노력이지만 언제 넣을지에 대한 관점이 빠져 있어 이 사고방식에 대한 설명이 되지 않는다. 설계 단계부터 보안 대책을 넣는 시큐리티 바이 디자인과는 짝을 이루는 개념이다.
문제 24 | 대리 변수
학습 데이터에서 민감 속성을 제거해도 불공정한 출력이 남는 경우가 있다. 그 주된 이유는 어느 것인가?
우편번호 등 다른 특징량이 제거한 속성을 대신하는 역할을 하기 때문에
속성을 제거해도 그 속성을 포함한 다른 데이터로 재학습되기 때문에
속성을 제거하면 데이터양이 줄어 모델의 정확도 자체가 떨어지기 때문에
속성을 제거하는 처리 자체가 데이터의 분포를 왜곡해 버리기 때문에
정답A. 우편번호 등 다른 특징량이 제거한 속성을 대신하는 역할을 하기 때문에
민감 속성을 대신하는 역할을 해 버리는 특징량을 대리 변수라 한다. 우편번호는 거주 지역을 통해 인종이나 소득과 강하게 상관관계를 가지며, 출신 학교나 동아리 활동 이력은 성별과 상관관계를 가지는 경우가 있다. 이런 특징량이 남아 있는 한, 성별란이나 인종란을 입력에서 제외해도 모델은 간접적으로 같은 차별을 학습한다. 따라서 공정성 확인은 입력 항목을 삭제하는 것이 아니라 출력을 속성별로 집계해 차이를 재는 방식으로 이루어진다. 게다가 공정성의 정의는 속성별 합격률을 맞추는 것, 오류율을 맞추는 것 등 여러 가지가 있고 일반적으로는 이것들을 동시에 모두 충족할 수 없으므로 용도에 비추어 어느 정의를 채택할지 골라 설명할 필요가 있다.
문제 25 | 적대적 입력
Adversarial Attack(Adversarial Examples)에 대한 설명으로 적절한 것은 어느 것인가?
사람은 알아채지 못하는 미세한 변화를 입력에 더해 잘못된 판정을 일으킨다
대량의 질의를 수행해 출력을 모아 동등하게 작동하는 모델을 손에 만든다
배포되어 있는 모델의 파라미터에 손을 대어 특정 거동을 심어 넣는다
학습용 데이터에 조작한 것을 섞어 넣어 학습 결과를 왜곡시켜 버린다
정답A. 사람은 알아채지 못하는 미세한 변화를 입력에 더해 잘못된 판정을 일으킨다
Adversarial Attack은 사람의 눈으로는 거의 알 수 없는 미세한 변화를 입력에 더해 운용 중인 모델이 잘못된 판정을 내리게 하는 공격이다. 노리는 것은 추론 단계이며 모델 자체를 고쳐 쓰지는 않는다. 학습용 데이터에 조작을 섞어 학습 결과를 왜곡시키는 것은 데이터 오염으로, 이쪽은 학습 단계를 노린다. 대량으로 질의해 동등한 모델을 재현하는 것은 모델 절취, 모델의 파라미터나 배포물에 손을 대는 것은 모델 오염으로, 각각 노리는 시점과 대상이 다르다. 어느 쪽에 대한 대비도 설계 단계부터 보안을 넣는 시큐리티 바이 디자인의 사고방식으로 진행한다.
문제 26 | 절취의 구별
AI에 대한 공격 중 모델 절취에 해당하는 것은 어느 것인가?
학습용 데이터에 조작한 것을 섞어 학습 결과를 왜곡시켜 버린다
출력을 단서로 학습 데이터에 포함되어 있던 정보를 추정해 꺼낸다
배포된 모델의 파라미터에 손을 대어 특정 입력에서 거동을 바꾼다
대량으로 질의해 출력을 모아 동등하게 작동하는 모델을 손에 재현해 낸다
정답D. 대량으로 질의해 출력을 모아 동등하게 작동하는 모델을 손에 재현해 낸다
모델 절취는 대상 모델에 대량의 입력을 주어 출력을 모아 동등하게 작동하는 모델을 손에 재현해 버리는 공격이다. 도둑맞는 것은 모델 그 자체로, 공개 API로 제공하고 있는 것만으로도 성립할 수 있다. 이에 반해 데이터 절취는 출력 관찰 등을 통해 학습 데이터에 포함되어 있던 정보를 꺼내는 공격으로, 도둑맞는 것은 데이터 쪽이다. 학습용 데이터에 조작을 섞는 것은 데이터 오염, 모델의 파라미터나 배포물에 손을 대는 것은 모델 오염으로, 전자는 학습 단계, 후자는 학습이나 배포 단계를 노린다. 무엇을 도둑맞는지, 어느 시점을 노리는지로 정리하면 헷갈리지 않는다.
문제 27 | 정보의 거품
추천 알고리즘에 의한 최적화가 원인이 되어 생긴다고 하는 현상은 어느 것인가?
판단의 근거가 내부에 숨어 사람이 이유를 추적할 수 없게 되어 간다
취향에 맞는 정보만 선별되어 보여지고 다른 정보는 닿지 않게 된다
같은 의견을 가진 사람들끼리 발신과 공감을 반복하며 그 의견을 강화해 나간다
생성된 가짜 영상이나 음성이 진짜로 널리 받아들여져 버린다
정답B. 취향에 맞는 정보만 선별되어 보여지고 다른 정보는 닿지 않게 된다
필터 버블(filter bubble)은 추천 알고리즘이 이용자의 취향에 맞춰 정보를 선별한 결과, 그 사람이 거품에 싸인 것처럼 자기 취향의 정보만 보이게 되는 현상으로, 원인은 알고리즘에 의한 최적화에 있다. 이용자는 선별되고 있다는 것 자체를 알아채지 못한다. 같은 의견을 가진 사람들끼리 닫힌 공간에서 발신과 공감을 반복하며 그 의견을 유일하게 옳은 것으로 믿게 되는 것은 에코 체임버(echo chamber)로, 원인은 사람이 비슷한 사람끼리 모인다는 성질에 있다. 가짜 영상이나 음성이 진짜로 받아들여지는 것은 딥페이크와 가짜 뉴스, 판단의 근거를 추적할 수 없는 것은 블랙박스 문제로, 모두 다른 중항목의 이야기이다.
문제 28 | 가짜 영상
딥페이크(deepfake)에 대한 설명으로 가장 적절한 것은 어느 것인가?
딥러닝을 이용해 대량의 문장에서 요점을 정리한 짧은 문장을 만들어 낸다
딥러닝을 이용해 판단의 근거가 된 이미지 상의 영역을 시각화해 보여 준다
딥러닝을 이용해 실존 인물이 말하고 있는 것처럼 보이는 영상이나 음성을 만든다
딥러닝을 이용해 실존하지 않는 인물의 얼굴 사진을 새롭게 생성해 나열한다
정답C. 딥러닝을 이용해 실존 인물이 말하고 있는 것처럼 보이는 영상이나 음성을 만든다
딥페이크는 딥러닝을 사용해 실존하는 인물이 말하지 않은 것을 말하고, 하지 않은 것을 하고 있는 것처럼 보이는 영상이나 음성을 만들어 내는 기술과 그 생성물을 가리킨다. 실존 인물을 사칭한다는 점이 핵심이며, 실존하지 않는 인물의 얼굴을 생성하는 것과는 목적이 다르다. 명예훼손이나 사기, 선거 개입에 사용되며 가짜 뉴스의 설득력을 크게 높인다. 대책으로는 검출 기술 연구와 함께 촬영 기기나 생성 시점에 출처 정보를 심어 두어 나중에 변조를 검증할 수 있게 하는 방향이 추진되고 있다. 문장 요약이나 판단 근거의 시각화는 모두 악용과는 관계없는 이야기이다.
문제 29 | 출처의 기록
AI의 투명성 확보와 관련해 데이터의 출처(provenance)를 남겨 두는 목적으로 가장 적절한 것은 어느 것인가?
학습에 쓰는 계산 자원의 소비량을 억제해 드는 비용을 줄이기 위해
취득처와 가공 과정을 추적할 수 있게 해 문제가 생긴 원인에 도달하기 위해
모델의 추론을 고속화해 응답이 돌아올 때까지의 시간을 줄이기 위해
학습에 쓸 수 있는 데이터의 양을 늘려 모델의 정확도를 높여 가기 위해
정답B. 취득처와 가공 과정을 추적할 수 있게 해 문제가 생긴 원인에 도달하기 위해
데이터의 출처란 어떤 데이터를 어디서 취득해 어떻게 가공해 학습에 사용했는지에 대한 기록이다. 이것이 남아 있지 않으면 출력에 문제가 생겼을 때 원인이 된 데이터까지 거슬러 올라갈 수 없어 수정도 설명도 할 수 없다. 투명성은 모델의 내부를 공개하는 것만을 의미하지 않으며, 무엇을 위해 쓰고 있는지, 어떤 데이터로 만들었는지, 어디에 한계가 있는지를 대상에 맞게 보여 주는 것까지 포함한다. 계산 자원 절감, 추론 고속화, 데이터양 증가는 모두 출처를 기록하는 목적이 아니다. 아울러 어떤 데이터에서 어떤 모델을 거쳐 어떤 판단이 나왔는지를 추적할 수 있게 해 두는 추적 가능성(traceability)도 함께 기억해 두어야 한다.
문제 30 | 윤리 점검
AI 거버넌스에서 말하는 윤리 평가(ethics assessment)에 대한 설명으로 적절한 것은 어느 것인가?
AI를 어떻게 다룰지에 대한 자사의 방침을 문서로 정리해 대외적으로 보여 주는 것
운용 개시 후 출력의 경향이나 불만을 지속적으로 지켜보는 절차
기획 단계에서 예상되는 영향이나 리스크를 도출해 평가하는 절차
담당 부서에서 독립된 입장에서 방침대로 운용되고 있는지 확인하는 구조
정답C. 기획 단계에서 예상되는 영향이나 리스크를 도출해 평가하는 절차
윤리 평가는 AI 기획 단계에서 예상되는 영향이나 리스크를 도출해 평가하는 절차로, 그 결과에 따라 심사의 엄격함을 바꾼다. 운용 개시 후 출력 경향이나 불만을 지켜보는 것은 모니터링, 담당 부서에서 독립된 입장에서 방침대로인지 확인하는 것은 AI에 대한 감사, 자사 방침을 문서로 정리해 보여 주는 것은 AI 정책으로, 모두 AI 거버넌스를 구성하는 다른 요소이다. 이것들에 더해 판단의 요소마다 인간의 관여를 남겨 두는 것, 나중에 모델을 다시 만들 수 있게 하는 재현성, 판단 경로를 추적할 수 있게 하는 추적 가능성이 나란히 놓인다.
연습: 이 페이지의 문제 풀기
무작위로 출제하는 연습 도구입니다(JavaScript가 활성화된 경우에 작동합니다). 위의 문제와 해설은 그대로 모두 읽을 수 있습니다.
※ 해설은 학습용 정보 제공입니다. 시험 출제 범위와 제도는 연도에 따라 바뀌므로, 반드시 시행 기관의 공식 발표를 확인하십시오.
이 페이지는 일본어 원문을 번역한 것입니다. 번역과 원문의 내용이 다를 경우 일본어판이 우선합니다. 일본어 원문 보기