Karinoya 学习室 资格考试 Cloud / AI / Python 合格实验室 AI的社会应用与法律、伦理
日本語 English Français Bahasa Indonesia 한국어 Română ไทย Tiếng Việt 简体中文 繁體中文
资格考试 · Cloud / AI / Python 合格实验室
AI的社会应用与法律、伦理 可以用简体中文阅读题目和解说。讲义(解说文章)仅有日文版。
查看日文版(含讲义) →
第1题 | CRISP-DM
在数据分析项目的标准流程CRISP-DM中,最先安排的阶段的内容是哪一项?
调查手头数据的质量与分布,把握其倾向 进行缺失值处理和特征量的构建,整理成可用于训练的形式 明确要解决的业务课题,以及可称为成功的标准 把构建好的模型嵌入业务系统并投入运营 正确答案 C. 明确要解决的业务课题,以及可称为成功的标准 CRISP-DM由业务理解、数据理解、数据准备、建模、评估、部署这6个阶段构成。最先是业务理解,确定要解决的业务课题,以及怎样才能称为成功的标准。调查数据质量与分布的是数据理解,缺失值处理与特征量构建是数据准备,嵌入业务系统则属于部署阶段。也要掌握这6个阶段并非单向流动,而是被描绘成会回到前面阶段、反复循环的一个环。
第2题 | PoC
关于AI项目中PoC的定位,最恰当的是哪一项?
在正式投入开发之前,先小规模试做以确认可行性与效果的工序 为训练数据打上正确答案标签的作业,按既定标准推进的工序 把完成的模型部署到生产环境,持续进行监控与再训练的工序 把业务流程本身追溯到目的重新设计,以提高生产率的工序 正确答案 A. 在正式投入开发之前,先小规模试做以确认可行性与效果的工序 PoC即概念验证,是在正式投入开发之前先做出小规模的东西加以试验,确认用手头数据能否达到所需精度、以及即便达到了业务能否顺利运转的工序。由于目的并非做出成品,如果不在开始前就定好推进和撤退的条件,就会不断重复没有成果的试验。部署后持续进行监控与再训练的是MLOps,打正确答案标签的作业是标注(Annotation),重新设计业务流程本身的是BPR,这些都是与PoC不同的工序。
第3题 | 标注
关于为机器学习进行数据准备时所做的标注,恰当的说明是哪一项?
从收集到的数据中去除缺失值和异常值,整理其分布 大量收集整理文章,制作成语言处理用的数据集合 把收集到的数据分为训练用和验证用,整理成能够衡量性能的形式 为收集到的数据人工附加作为训练正确答案的标签或区域信息 正确答案 D. 为收集到的数据人工附加作为训练正确答案的标签或区域信息 标注是给原始数据人工附加正确答案标签或区域信息的作业,是有监督学习不可或缺的一环。如果标注标准因作业者而异,模型性能的上限就会由此决定,因此作业指导书与质量检查的设计至关重要。大量收集整理文章而成的是语料库,划分为训练用与验证用、以及处理缺失值和异常值,都是数据准备中的其他作业,都不是标注这一行为本身。
第4题 | 数据泄漏
关于源于训练数据处理方式的数据泄漏(Data Leakage),最恰当的说明是哪一项?
验证数据过少,导致测得的精度本身变得不稳定的现象 预测时点本应无法获得的信息混入了训练,导致性能被不当地看高的现象 过度贴合训练数据的结果,对未知数据的性能下降的现象 特征量维度过多,导致所需数据量急剧膨胀的现象 正确答案 B. 预测时点本应无法获得的信息混入了训练,导致性能被不当地看高的现象 数据泄漏是指本应在做预测的时点无法获得的信息混入了训练数据,导致验证时的精度远高于实际能力的现象。它可能以这样的形式出现:把解约手续的受理日期放入解约预测的特征中;在做预处理时用包含验证数据在内的整体数据计算均值和标准差;把时间序列数据无视时间顺序随机切分等。过度贴合训练数据是过拟合,其原因不在于『用了不该用的信息』,而在于『贴合得太过头』。维度增多导致所需数据量膨胀属于维度诅咒,两者的原因都与数据泄漏不同。
第5题 | MLOps
关于AI系统运维中MLOps的思路,最恰当的是哪一项?
部署之后也持续监控数据与精度,持续地进行再训练和再部署 从云端租用训练所需的计算资源,把费用控制在实际使用的部分 把开发环境整合进容器,使生产环境也能重现相同的环境 在部署到生产环境之前,先确认一次模型精度满足要求 正确答案 A. 部署之后也持续监控数据与精度,持续地进行再训练和再部署 MLOps的思路是,不把模型部署完就当作结束,而是持续监控输入数据的分布、预测的倾向乃至业务指标,一旦出现偏差就更新训练数据重新构建模型,再次部署,把这一循环作为机制持续运转下去。随着外部环境变化,输入的倾向也会变化,精度会在不知不觉间下降,因此只做一次确认是不够的。租用计算资源属于云的使用,把执行环境整合起来加以重现是Docker的作用,两者虽都是支撑MLOps的工具,但本身并不是MLOps的定义。
第6题 | BPR
与引入AI一并被讨论的BPR,其内容恰当的是哪一项?
召集业务负责人,听取他们对AI的需求 收集业务数据,整理成AI可以学习的形式 追溯到目的,把业务流程本身重新设计 在保留既有业务流程的前提下,把部分工作替换为AI 正确答案 C. 追溯到目的,把业务流程本身重新设计 BPR即业务流程再造,指的不是对既有业务流程做局部改善,而是追溯到该业务是为了什么目的而存在,把流程本身重新设计的做法。如果在保留原有流程的情况下加载AI,有时只会增加人工把AI输出结果誊写的环节,得不到效果——AI引入能否成功,往往就取决于这里,而不只是精度。听取需求属于把握相关方需求,整理成可学习的形式属于数据准备,两者都不是业务流程本身的重新设计。
第7题 | 开发方式
AI开发被认为难以直接套用瀑布模型的原因,最恰当的是哪一项?
因为开发所用语言和库的选择很多,标准化尚未推进 因为参与开发的人员职种繁多,难以确定工序分工 因为在实际训练之前无法知道能达到的精度,难以事先固定需求 因为筹措训练所需计算资源需要时间,工序难以按计划推进 正确答案 C. 因为在实际训练之前无法知道能达到的精度,难以事先固定需求 瀑布模型是一种从需求定义开始依次固化各工序、并以不后退为前提推进的方式。然而AI开发具有这样的性质:不实际训练一下,就无法知道能达到怎样的精度,因此无法预先确定交付物和需求。于是探索和PoC阶段采取以短周期反复推进的敏捷形式,等精度可以预见之后,再固化正式开发的工序,这种组合方式常被采用。这一性质也会直接影响到把开发委托设计成承揽合同还是准委托合同这一合同设计。
第8题 | Docker
在AI开发中使用Docker的主要目的是哪一项?
把包含库在内的执行环境整合起来,使其能在别的环境中以相同状态运行 把训练好的模型公开为可供其他系统通过HTTP调用的形式 把训练的中间过程和执行结果连同说明文字一起保存为一份文档 按需要的时间租用大量计算资源,用完后就归还 正确答案 A. 把包含库在内的执行环境整合起来,使其能在别的环境中以相同状态运行 Docker是把包含库在内的应用执行环境整合为容器的技术。由于同一个容器无论在开发机还是生产环境都能运行,因版本差异而出现的『在我这里明明能跑』这类不一致会减少。把中间过程和结果连同说明文字保存为一份文档的是Jupyter Notebook,整理成可通过HTTP调用的形式的是Web API,按需要的时间租用计算资源属于云的使用,这些都是指AI开发中使用的其他工具。
第9题 | 语料库
关于自然语言处理领域所说的语料库,恰当的说明是哪一项?
为研究开发而广泛公开的图像或语音数据的集合 把文章切分为单词并判定词性的形态素分析处理的集合 为语言处理而收集、整理的大量文章数据的集合 为把单词表示为向量而训练出的权重参数的集合 正确答案 C. 为语言处理而收集、整理的大量文章数据的集合 语料库指的是为自然语言处理而收集整理的大量文章数据,根据用途有时还会附加词性或句法信息。为研究开发而公开的数据集合,泛指开放数据集,其中也包含图像和语音,并不限于文章。单词的向量表示是训练的成果物,而不是数据的集合;形态素分析是处理文章的一种方法,两者都与语料库的定义不同。此外,语料库也附带许可协议和使用条款,是否可用于商业用途或再分发需要逐一确认。
第10题 | 与外部的合作
在AI开发语境下所说的开放式创新,最恰当的说明是哪一项?
利用已公开的数据集,减少收集数据的工夫 把开发出的模型和源代码,以任何人都能使用的形式无偿公开 从公司内部各部门召集人员,组建跨部门的开发体制 积极引入外部的技术、知识和人才,创造新的价值 正确答案 D. 积极引入外部的技术、知识和人才,创造新的价值 开放式创新是这样一种思路:不把研发局限于本公司内部,而是积极引入外部的技术、知识和人才来创造价值。教学大纲把产学合作与跟其他企业、其他行业的合作并列在同一中项目中,与大学等研究机构的共同研究,以及与拥有本公司所没有的数据或销售渠道的对象组合,都是其手段。把成果无偿公开属于开源的思路,与引入外部资源方向相反。公司内部的跨部门体制和公开数据集的利用,都不是指与外部主体的合作本身。
第11题 | 两种加工信息之别
关于《个人信息保护法》中匿名加工信息与假名加工信息的区别,正确的是哪一项?
两者只要征得本人同意都可以提供给第三方,未经同意都不能提供 匿名加工信息未经本人同意不能提供给第三方,但假名加工信息可以提供 无论加工程度如何,两者一律都被禁止向第三方提供 匿名加工信息未经本人同意也可以提供给第三方,但假名加工信息原则上不可以 正确答案 D. 匿名加工信息未经本人同意也可以提供给第三方,但假名加工信息原则上不可以 匿名加工信息是经过加工使其无法识别特定个人、且原始个人信息也无法复原的信息。由于加工到了这种程度,只要履行既定手续,即使未经本人同意也可以提供给第三方。而假名加工信息是加工到只要不与其他信息比对就无法识别特定个人的程度,例如删去姓名,加工的工夫较轻、还能保留分析价值,但相应地原则上不能提供给第三方,是设想供事业者在内部进行分析利用的。可以这样记忆:加工得越轻,就越不能拿到外部去。
第12题 | 个人识别码
关于《个人信息保护法》中个人识别码的说明,正确的是哪一项?
护照号码或人脸识别数据等,单独一项就被视为个人信息 只有与姓名组合起来,才被视为能够识别特定个人的信息 只有在征得本人同意后取得的情况下,才被当作个人信息处理 在取得的时点并不属于对象,一旦建成数据库才成为个人信息 正确答案 A. 护照号码或人脸识别数据等,单独一项就被视为个人信息 个人识别码包括指纹数据、人脸识别数据、把DNA碱基序列转换而成的编码这类身体特征数据,以及个人编号(我的号码)、护照号码、驾驶证号码这类分配给个人的号码。这些单独一项就属于个人信息,因此『不含姓名就不是个人信息』这种理解是错误的。是否属于个人信息,也不是由取得时是否征得同意来决定的,更不是建成数据库后才成为个人信息。此外,经过系统整理、可以检索的状态被称为个人数据,会附加额外的义务。
第13题 | GDPR
关于GDPR的定位,正确的是哪一项?
是国际组织提出的指引,对各国不具有法律约束力 为在国际上扩展日本《个人信息保护法》而制定的规则 是欧盟的法规,只适用于在欧盟境内设有据点的经营者 是欧盟的法规,在某些情况下也适用于欧盟域外的经营者 正确答案 D. 是欧盟的法规,在某些情况下也适用于欧盟域外的经营者 GDPR是欧盟的《通用数据保护条例》,是与日本《个人信息保护法》不同的欧盟法规。其特点是具有域外适用效力:只要存在向欧盟境内人士提供商品或服务、或监控欧盟境内人士行为等情形,即使是在日本国内开发的经营者也可能适用。因此不能仅凭据点是否在欧盟来判断是否适用。它既不是日本法的扩展,也不是不具约束力的指引,这两点也需要掌握。
第14题 | 第30条之4
《著作权法》第30条之4规定,在什么情况下可以不经著作权人许可使用作品?
并非以自己享受或使他人享受作品所表达的思想或感情为目的的情况 所使用作品的分量仅占整体极小一部分的情况 所使用的作品在互联网上被免费公开的情况 使用目的并非营利、而仅限于学术研究的情况 正确答案 A. 并非以自己享受或使他人享受作品所表达的思想或感情为目的的情况 《著作权法》第30条之4规定,在并非以自己享受、或使他人享受作品所表达的思想或感情为目的的情况下,可以在被认为必要的限度内使用该作品。所谓『享受』,是指通过欣赏作品所表达的思想或感情来获得知性或精神上的满足,为机器学习而将其作为数据读入的行为被认定不属于此类。该条第2项明确列出了『信息解析』,训练用数据的制作与训练正是被定位于此。是否被免费公开、是否以营利为目的、分量是否较少,都不是这一条文所规定的要件。
第15题 | 但书
关于为AI训练而使用作品,对《著作权法》第30条之4的理解,正确的是哪一项?
只有在有偿购买了作品的情况下,才被允许为训练而使用 只要是为训练而使用,任何情况下都不会构成对著作权人利益的问题 如果会不当损害著作权人的利益,本规定就不适用 只要训练本身合法,即使生成物与既有作品相似,也不构成侵权 正确答案 C. 如果会不当损害著作权人的利益,本规定就不适用 第30条之4设有但书:根据该作品的种类及用途以及该使用的形态,如果会不当损害著作权人的利益,则不适用本规定。因此不能说『只要是为AI训练,任何使用都自由』。例如,若本应购买以供信息解析用途出售的数据库、却未经购买而复制用于训练,由于会损害该数据库的市场,被认为构成但书所指的情形。此外,即便训练这一输入阶段是合法的,如果生成物与既有作品相似,在生成或使用这一输出阶段仍可能另外产生著作权侵权问题。输入与输出是分别评价的。是否有偿购买,并不是决定本条文是否适用的判断标准。
第16题 | 生成物的著作权
关于AI生成物的作品属性,最接近目前已确立见解的是哪一项?
著作权当然归属于所使用服务的提供者 只要是AI输出的东西,就不可能被认定为作品 根据是否能认定存在人的创作性贡献,逐案判断 发出生成指示的人,总是被认定享有著作权 正确答案 C. 根据是否能认定存在人的创作性贡献,逐案判断 著作权是保护人类创作性表达的制度,因此仅由AI自动输出的东西不构成作品。另一方面,如果人的参与程度足以说是赋予了表达上本质性的特征,就有被认定具有作品属性的余地。判断的关键在于创作性贡献,具体会就指示与试错的具体程度、对生成物的取舍与修改程度等逐案考察。因此,『总是不构成作品』的理解,以及『发出指示的人总是产生权利』的理解,都是错误的。此外,除著作权法之外,所使用服务的使用条款有时也会规定生成物的处理方式,两者都需要确认。
第17题 | 职务发明
关于《专利法》中职务发明的处理,正确的是哪一项?
只要在工作规则等中作出规定,就可以归属于使用者,从业人员可获得相应利益 即便是作为职务所做的发明,也没有余地把权利归属于使用者 权利总是归属于使用者,不能通过工作规则另作规定 即使权利归属于使用者,也无需向从业人员支付利益 正确答案 A. 只要在工作规则等中作出规定,就可以归属于使用者,从业人员可获得相应利益 职务发明是指从业人员作为职务所完成的发明。获得专利的权利原则上产生于作为发明人的从业人员,但只要事先在工作规则等中作出规定,就可以从权利产生之时起归属于使用者。此时从业人员享有获得相应金钱及其他经济上利益的权利,因此这并非可以无偿剥夺权利的制度。此外,权利既非总是归属于使用者,也并非没有归属于使用者的余地,是否有相应规定会改变处理方式,这正是要点所在。
第18题 | 商业秘密
《不正竞争防止法》中作为商业秘密受到保护所需要件的组合是哪一项?
秘密管理性、有用性、进步性 秘密管理性、有用性、非公知性 有用性、新颖性、进步性 秘密管理性、新颖性、非公知性 正确答案 B. 秘密管理性、有用性、非公知性 商业秘密的3项要件是:作为秘密受到管理(秘密管理性)、是对事业活动有用的技术上或经营上的信息(有用性)、不为公众所知(非公知性),三者须全部满足才受到保护。新颖性与进步性是获得专利所需的要件,并非商业秘密的要件。专利是以公开内容为代价换取独占的制度,而商业秘密则是通过不公开来加以保护的制度,因此像已训练模型的权重或预处理方面的诀窍这类不想公开的信息,就要通过后者来保护。
第19题 | 限定提供数据
关于《不正竞争防止法》中的限定提供数据,正确的是哪一项?
指的是已申请专利但未能获得注册的技术信息这一类别 在完全满足商业秘密3项要件的基础上,进一步经过登记的信息为对象 指的是不向任何人提供、只在本公司内部保管的信息这一类别 以经营为目的向特定人提供的、以电磁方式相当量积累并受到管理的记录为对象 正确答案 D. 以经营为目的向特定人提供的、以电磁方式相当量积累并受到管理的记录为对象 限定提供数据是指以经营为目的向特定人提供的信息,且以电磁方式相当量积累并受到管理。这一类别的设立是为了保护数据买卖或共享这类交易,其意义在于即使未完全满足商业秘密的3项要件,也可能受到保护。因为要向多个对象提供,就未必能严格满足非公知性。只在公司内部作为秘密封闭起来的信息,属于用商业秘密来保护的话题,与是否申请或注册专利也没有关系。
第20题 | 开发合同
关于AI开发委托中承揽合同与准委托合同的区别,正确的是哪一项?
承揽合同承诺完成工作,准委托合同则以善良管理人的注意义务来履行 承揽合同是负有善良管理人注意义务的合同,准委托合同是承诺完成的合同 两者都是承诺交付物完成的合同,只是所保证的精度水准不同 两者都是不承诺完成的合同,只是支付报酬的时期不同 正确答案 A. 承揽合同承诺完成工作,准委托合同则以善良管理人的注意义务来履行 承揽合同是承诺完成工作的合同,若未完成则不能请求报酬,对不符合约定的成果物需承担责任。准委托合同是委托事务处理的合同,所承诺的不是完成,而是以善良管理人的注意义务来履行业务。由于AI开发不实际训练就无法知道能达到的精度,探索和PoC阶段常采用准委托合同,规格已确定的实现工序则常采用承揽合同,这种划分方式很常见。经济产业省的《AI・数据利用相关合同指引》也给出了按阶段分别签约的模式。
第21题 | 硬法
关于硬法与软法的区分,正确的是哪一项?
硬法指具有强制力的法令,软法指不具约束力的规范 硬法指带有罚则的法令,软法指不带罚则的法令 硬法指国际间的约定,软法指国内的法令 硬法指新制定的法令,软法指古老的惯例 正确答案 A. 硬法指具有强制力的法令,软法指不具约束力的规范 硬法是由国家制定、违反会受到强制力约束的法令,个人信息保护法和著作权法均属此类。软法则是指南、行业自律规范、企业行为准则这类不具有法律约束力的规范。软法本身并非法令,因此『有罚则的法令与无罚则的法令』这种区分并不适用。它也不是国内与国际的区分,也不是新旧的区分。在技术变化迅速的领域,通常先用软法指明方向,只把必要的部分制定为法令,日本的AI政策基本上就是以软法为中心。
第22题 | 风险应对
在AI监管和公司内部应对中所说的基于风险的方法(Risk-based Approach),其思路是哪一项?
一旦确认存在风险,就一律停止该用途的服务提供 列举可预见的风险后,对所有用途施加相同水平的对策 把风险评估交给使用者,经营者只负责提供信息 根据用途所带来风险的大小,改变应对或监管的强度 正确答案 D. 根据用途所带来风险的大小,改变应对或监管的强度 基于风险的方法是根据AI用途所带来风险的大小来改变监管或应对强度的思路。即使是同一种人脸识别技术,用于终端解锁屏幕与用于公共空间的持续监控,对人的影响完全不同。若不分用途一律施加严格监管,会连危害较小的用法也一并禁止;若一律放宽,又会放任危害较大的用法。因此对影响大的用途分配较重的义务,对影响小的用途给予较轻的处理。经营者一方也用同样的思路,把公司内部的AI项目按风险高低分类,只让高风险项目接受严格审查。
第23题 | 设计阶段的考量
关于隐私设计(Privacy by Design)的思路,最恰当的是哪一项?
限定处理个人信息的负责人,只让有权限者才能查阅 从企划和设计阶段起,就把隐私保护的机制纳入其中 根据使用者的要求,公开所收集数据的用途 在问题发生的阶段调查原因,事后再追加必要的对策 正确答案 B. 从企划和设计阶段起,就把隐私保护的机制纳入其中 隐私设计是这样一种思路:不是等问题发生后再追加对策,而是从企划和设计阶段起就把隐私保护纳入其中。把设计做成不收集数据、按需要的期限删除、以无法识别的形式处理,这类判断如果越晚加入,成本就越高。公开用途和限定查阅权限本身都是正确的做法,但缺少『何时纳入』这一视角,因此不能作为这一思路的说明。它与从设计阶段起就纳入安全对策的『安全设计』(Security by Design)是相对应的概念。
第24题 | 代理变量
即使从训练数据中去除敏感属性,输出仍可能残留不公平,其主要原因是哪一项?
因为邮政编码等其他特征量,起到了替代被去除属性的作用 因为即使去除该属性,之后仍会用含有该属性的其他数据重新训练 因为去除属性会减少数据量,导致模型精度本身下降 因为去除属性这一处理本身,会扭曲数据的分布 正确答案 A. 因为邮政编码等其他特征量,起到了替代被去除属性的作用 起到替代敏感属性作用的特征量被称为代理变量。邮政编码通过居住地区与种族、收入强相关,出身学校或社团活动经历有时也与性别相关。只要这类特征量还留着,即使把性别栏或种族栏从输入中剔除,模型仍会间接学到相同的歧视。因此公平性的确认,不应靠删减输入项目来做,而应按属性把输出汇总统计、衡量差异。此外,公平性的定义有多种,如让各属性组的通过率一致、让错误率一致等,一般无法同时全部满足,因此需要针对具体用途选择采用哪种定义并加以说明。
第25题 | 对抗性攻击
关于对抗性攻击(Adversarial Attack / Adversarial Examples)的说明,恰当的是哪一项?
在输入中加入人无法察觉的微小变化,引发错误判定 进行大量查询、收集输出,在自己手中重建出功能相当的模型 对已发布模型的参数动手脚,植入特定行为 在训练数据中混入被做了手脚的数据,扭曲训练结果 正确答案 A. 在输入中加入人无法察觉的微小变化,引发错误判定 对抗性攻击是在输入中加入人眼几乎无法察觉的微小变化,使运行中的模型作出错误判定的攻击。它针对的是推理阶段,模型本身并未被改写。在训练数据中混入被做手脚的数据、扭曲训练结果的是数据污染,针对的是训练阶段。大量查询以重建出同等模型的是模型窃取,对模型参数或发布物动手脚的是模型污染,二者所针对的时间点和对象各不相同。对这些攻击的防范,都要按从设计阶段起纳入安全性的『安全设计』思路来推进。
第26题 | 窃取的区分
在针对AI的攻击中,属于模型窃取的是哪一项?
在训练数据中混入被做了手脚的数据,扭曲训练结果 以输出为线索,推测并取出训练数据中所含的信息 对已发布模型的参数动手脚,使其在特定输入下改变行为 进行大量查询、收集输出,在自己手中重建出功能相当的模型 正确答案 D. 进行大量查询、收集输出,在自己手中重建出功能相当的模型 模型窃取是对目标模型给出大量输入、收集输出,从而在自己手中重现出功能相当的模型的攻击。被盗走的是模型本身,即使只是以公开API的形式提供服务,也可能因此得逞。与此相对,数据窃取是通过观察输出等手段取出训练数据中所含信息的攻击,被盗走的是数据一方。在训练数据中混入手脚的是数据污染,对模型参数或发布物动手脚的是模型污染,前者针对训练阶段,后者针对训练或发布阶段。按『被盗走的是什么』『针对哪个时间点』来梳理,就不容易混淆。
第27题 | 信息的泡沫
被认为由推荐算法的优化所导致的现象是哪一项?
判断依据隐藏在内部,使人无法追溯理由 只有符合喜好的信息被筛选出来呈现,其他信息无法送达 意见相同的人之间反复发表和共鸣,从而强化该意见 生成的虚假影像或声音被广泛当作真实内容接受 正确答案 B. 只有符合喜好的信息被筛选出来呈现,其他信息无法送达 过滤气泡是指推荐算法按使用者的喜好筛选信息的结果,使该人如同被包裹在气泡中一般,只能看到自己喜欢的信息,其原因在于算法的优化。使用者自己往往察觉不到正在被筛选这件事。意见相同的人在封闭的空间里反复发表和共鸣、从而深信自己的意见是唯一正确的,这是回声室效应,其原因在于人倾向于与相似的人聚在一起这一性质。虚假影像或声音被当作真实内容接受的是深度伪造与虚假新闻,判断依据无法追溯的是黑箱问题,都是属于其他中项目的话题。
第28题 | 虚假影像
关于深度伪造(Deepfake)的说明,最恰当的是哪一项?
利用深度学习,从大量文章中归纳要点、生成简短文章 利用深度学习,把作为判断依据的图像区域可视化展示出来 利用深度学习,制作出仿佛真实人物在说话的影像或声音 利用深度学习,新生成并排列出不存在人物的面部照片 正确答案 C. 利用深度学习,制作出仿佛真实人物在说话的影像或声音 深度伪造是指利用深度学习,制作出让真实存在的人物说出其未曾说过的话、做出其未曾做过的事的影像或声音,以及这类生成物本身的技术。其核心在于冒充真实存在的人物,与生成不存在人物面孔的目的不同。它被用于诽谤、诈骗、干预选举,并大幅增强了虚假新闻的说服力。在对策方面,除了研究检测技术外,也在推进从拍摄设备或生成环节就嵌入来历信息、使之后能够验证是否被篡改的方向。文章摘要和判断依据的可视化,都不是关于滥用的话题。
第29题 | 来历的记录
关于确保AI透明性时,保留数据来历的目的,最恰当的是哪一项?
为了抑制训练所用计算资源的消耗、降低所需费用 为了能够追溯获取来源与加工过程,找到问题发生的原因 为了让模型的推理更快,缩短返回响应所需的时间 为了增加可用于训练的数据量,提高模型的精度 正确答案 B. 为了能够追溯获取来源与加工过程,找到问题发生的原因 数据来历,是指哪些数据从何处获取、经过怎样的加工才用于训练的记录。若没有留下这些记录,一旦输出出现问题,就无法追溯到成为原因的数据,也就无法进行修正或说明。透明性并不只是指公开模型内部,还包括针对不同对象说明用于何种目的、用什么数据构建、局限在哪里等内容。削减计算资源、加快推理速度、增加数据量,都不是记录来历的目的。此外,还应掌握可追溯性(Traceability)这一概念,即能够追踪某个判断是经由哪些数据、哪个模型而得出的。
第30题 | 伦理审查
关于AI治理中伦理评估(Ethics Assessment)的说明,恰当的是哪一项?
把本公司如何对待AI的方针整理成文件、对外公示的文件 在运营开始后,持续监视输出的倾向和投诉的程序 在企划阶段,梳理并评估可预见的影响与风险的程序 以独立于负责部门的立场,确认运营是否符合方针的机制 正确答案 C. 在企划阶段,梳理并评估可预见的影响与风险的程序 伦理评估是在AI企划阶段梳理并评估可预见的影响与风险的程序,会根据评估结果调整审查的严格程度。运营开始后监视输出倾向与投诉的是监控,以独立于负责部门的立场确认是否按方针执行的是对AI的审计,把本公司方针整理成文件公示的是AI政策,这些都是构成AI治理的其他要素。除此之外,在判断的关键环节保留人的参与、使模型事后可以重建的可复现性、以及能追溯判断路径的可追溯性,也是并列的要素。
练习:做本页的题目 这是随机出题的练习工具(在启用 JavaScript 时运行)。即使不使用此工具,也可以阅读上方的全部题目和解说。
※ 解说是供学习用的信息。考试的出题范围和制度每年可能变化,请务必确认主办机构的官方公告。
本页面译自日文原文。如译文与原文内容不一致,以日文版为准。 查看日文原文