Dans CRISP-DM, la démarche standard pour un projet d'analyse de données, quel est le contenu de l'étape placée en premier ?
Examiner la qualité et la distribution des données disponibles, pour en saisir les tendances
Traiter les valeurs manquantes et créer des caractéristiques, pour préparer les données à l'apprentissage
Clarifier le problème métier à résoudre et les critères permettant de dire que c'est un succès
Intégrer le modèle créé dans un système métier et l'exploiter
RéponseC. Clarifier le problème métier à résoudre et les critères permettant de dire que c'est un succès
CRISP-DM se compose de six étapes : compréhension du métier, compréhension des données, préparation des données, modélisation, évaluation, déploiement. La première est la compréhension du métier, où l'on définit le problème métier à résoudre et les critères permettant de dire que c'est un succès. Examiner la qualité et la distribution des données relève de la compréhension des données, traiter les valeurs manquantes et créer des caractéristiques relève de la préparation des données, et l'intégration dans un système métier relève de l'étape de déploiement. Il faut aussi retenir que ces six étapes ne s'enchaînent pas dans un seul sens, mais sont représentées comme un cycle itératif où l'on peut revenir à des étapes précédentes.
Q2 | PoC
Quelle est la position la plus appropriée d'un PoC dans un projet d'IA ?
L'étape où, avant d'entrer dans un développement à grande échelle, on teste à petite échelle la faisabilité et l'effet
L'étape où l'on procède, selon des critères définis, au travail d'attribution des étiquettes de bonne réponse sur les données d'apprentissage
L'étape où l'on place le modèle achevé en environnement de production et où l'on assure en continu la surveillance et le réapprentissage
L'étape où l'on reconçoit le flux même du travail métier en remontant à son objectif, pour en augmenter la productivité
RéponseA. L'étape où, avant d'entrer dans un développement à grande échelle, on teste à petite échelle la faisabilité et l'effet
Le PoC (preuve de concept) est l'étape où, avant d'investir dans un développement à grande échelle, on construit une petite version pour tester si la précision requise peut être atteinte avec ces données, et si oui, si le métier peut fonctionner ainsi. L'objectif n'étant pas de créer un produit fini, il faut fixer avant de commencer les conditions pour poursuivre et les conditions pour se retirer, sinon on répète des essais sans résultat. Assurer surveillance et réapprentissage après le déploiement en production relève du MLOps, le travail d'attribution des étiquettes de bonne réponse est l'annotation, et reconcevoir le flux même du travail métier est le BPR ; ce sont là des étapes distinctes du PoC.
Q3 | Annotation
Quelle description de l'annotation, effectuée lors de la préparation des données pour l'apprentissage automatique, est appropriée ?
Retirer des données collectées les valeurs manquantes ou aberrantes, pour uniformiser la distribution
Rassembler et organiser un grand volume de textes collectés, pour en faire un ensemble de données de traitement du langage
Diviser les données collectées en un ensemble d'entraînement et un ensemble de validation, sous une forme permettant de mesurer la performance
Attacher manuellement, aux données collectées, des étiquettes de bonne réponse pour l'apprentissage ou des informations de région
RéponseD. Attacher manuellement, aux données collectées, des étiquettes de bonne réponse pour l'apprentissage ou des informations de région
L'annotation est le travail consistant à attacher manuellement, aux données brutes, des étiquettes de bonne réponse ou des informations de région, indispensable pour l'apprentissage supervisé. Si le critère d'attribution varie d'un opérateur à l'autre, cela fixe le plafond de la performance du modèle ; la conception d'un guide de travail et d'un contrôle de qualité est donc essentielle. Rassembler et organiser un grand volume de textes constitue un corpus, et la division en ensembles d'entraînement et de validation, ainsi que le traitement des valeurs manquantes ou aberrantes, sont d'autres tâches de la préparation des données ; aucune de ces deux n'est l'acte même d'attribuer des étiquettes.
Q4 | Fuite de données
Quelle est la description la plus appropriée de la fuite de données (data leakage), résultant du traitement des données d'apprentissage ?
Le phénomène où, les données de validation étant trop peu nombreuses, la précision mesurée elle-même devient instable
Le phénomène où une information qui ne serait normalement pas disponible au moment de la prédiction se mêle à l'apprentissage, faisant paraître la performance indûment élevée
Le phénomène où, à force de trop s'ajuster aux données d'entraînement, la performance sur des données inconnues se dégrade
Le phénomène où, la dimension des caractéristiques augmentant trop, le volume de données nécessaire enfle brusquement
RéponseB. Le phénomène où une information qui ne serait normalement pas disponible au moment de la prédiction se mêle à l'apprentissage, faisant paraître la performance indûment élevée
La fuite de données est le phénomène où une information qui ne serait normalement pas disponible au moment de la prédiction se mêle aux données d'apprentissage, faisant apparaître, lors de la validation, une précision bien plus élevée que la réalité. Cela se produit par exemple en incluant la date de la demande de résiliation dans une prédiction de résiliation, en calculant la moyenne ou l'écart-type d'un prétraitement sur l'ensemble incluant les données de validation, ou en divisant aléatoirement des données temporelles sans tenir compte du temps. Trop s'ajuster aux données d'entraînement est le surapprentissage, dont la cause n'est pas « avoir utilisé une information interdite » mais « s'être trop ajusté ». L'augmentation de la dimension et l'explosion du besoin en données relèvent du fléau de la dimension ; les causes diffèrent toutes de la fuite de données.
Q5 | MLOps
Quelle est l'idée la plus appropriée du MLOps dans l'exploitation d'un système d'IA ?
Continuer, même après le déploiement, à surveiller les données et la précision, et faire tourner en continu le cycle de réapprentissage et de redéploiement
Louer les ressources de calcul utilisées pour l'apprentissage auprès du cloud, en limitant les coûts à ce qui est utilisé
Regrouper l'environnement de développement dans un conteneur, pour pouvoir reproduire le même environnement en production
Vérifier une seule fois, avant le déploiement en production, que la précision du modèle satisfait les exigences
RéponseA. Continuer, même après le déploiement, à surveiller les données et la précision, et faire tourner en continu le cycle de réapprentissage et de redéploiement
Le MLOps est l'idée de ne pas s'arrêter au déploiement du modèle, mais de mettre en place un mécanisme faisant tourner en continu un cycle : surveiller la distribution des données d'entrée, les tendances de prédiction, jusqu'aux indicateurs métier, mettre à jour et reconstruire les données d'apprentissage lorsqu'un écart apparaît, puis redéployer. Le monde changeant, les tendances des entrées changent également, et la précision se dégrade silencieusement, si bien qu'une vérification unique ne suffit pas. Louer des ressources de calcul relève de l'usage du cloud, et regrouper l'environnement d'exécution pour le reproduire relève du rôle de Docker ; ce sont des outils qui soutiennent le MLOps, mais ne constituent pas en eux-mêmes sa définition.
Q6 | BPR
Quel est le contenu du BPR, souvent évoqué en lien avec l'adoption de l'IA ?
Réunir les responsables métier pour recueillir les exigences attendues de l'IA
Collecter les données métier et les mettre en forme pour que l'IA puisse les apprendre
Reconcevoir le flux même du travail métier, en remontant à son objectif
Remplacer une partie des tâches par l'IA, tout en conservant les procédures métier existantes
RéponseC. Reconcevoir le flux même du travail métier, en remontant à son objectif
Le BPR, ou réingénierie des processus métier, désigne non pas une amélioration partielle des procédures métier existantes, mais un effort visant à reconcevoir le flux même du travail en remontant à sa finalité. Si l'on ajoute l'IA tout en conservant les procédures telles quelles, on peut se retrouver simplement avec une étape supplémentaire où une personne retranscrit manuellement la sortie de l'IA, sans effet réel ; le succès ou l'échec de l'adoption de l'IA se joue souvent ici plus que sur la précision elle-même. Recueillir les exigences relève de la compréhension des besoins des parties prenantes, et la mise en forme pour l'apprentissage relève de la préparation des données ; aucun des deux n'est en lui-même la reconception du processus métier.
Q7 | Manière de mener le développement
Quelle est la raison la plus appropriée pour laquelle il est difficile d'appliquer directement la méthode en cascade (waterfall) au développement de l'IA ?
Parce que le choix des langages et des bibliothèques utilisés pour le développement est vaste et peu standardisé
Parce que les métiers des personnes impliquées dans le développement sont très divers, rendant difficile la répartition des étapes
Parce que la précision atteignable n'est connue qu'après avoir essayé l'apprentissage, empêchant de fixer les exigences à l'avance
Parce que l'acquisition des ressources de calcul nécessaires à l'apprentissage prend du temps, retardant le déroulement prévu des étapes
RéponseC. Parce que la précision atteignable n'est connue qu'après avoir essayé l'apprentissage, empêchant de fixer les exigences à l'avance
La méthode en cascade est une approche qui fige les étapes successivement à partir de la définition des exigences, en supposant qu'on ne revient pas en arrière. Or, le développement de l'IA a la particularité que l'on ne sait pas jusqu'à quelle précision on pourra parvenir avant d'avoir réellement essayé l'apprentissage, ce qui empêche de fixer à l'avance le livrable et les exigences. On adopte donc souvent une combinaison où l'étape d'exploration et de PoC se déroule en itérations courtes, sous une forme agile, et où l'on ne fige les étapes du développement principal qu'une fois la précision devenue prévisible. Cette particularité influence aussi directement la conception du contrat, selon qu'on opte pour un contrat d'entreprise ou un contrat de mandat sans obligation de résultat pour confier le développement.
Q8 | Docker
Quel est l'objectif principal de l'usage de Docker dans le développement de l'IA ?
Regrouper l'environnement d'exécution, bibliothèques comprises, pour le faire fonctionner à l'identique dans un autre environnement
Publier un modèle entraîné sous une forme que d'autres systèmes peuvent appeler via HTTP
Conserver le déroulement de l'apprentissage et ses résultats, avec un texte explicatif, sous forme d'un seul document
Louer un grand volume de ressources de calcul pour la durée nécessaire, puis les restituer une fois le travail terminé
RéponseA. Regrouper l'environnement d'exécution, bibliothèques comprises, pour le faire fonctionner à l'identique dans un autre environnement
Docker est une technologie qui regroupe, sous forme de conteneur, un environnement d'exécution comprenant l'application et ses bibliothèques. Le même conteneur pouvant fonctionner aussi bien sur une machine de développement qu'en production, cela réduit les écarts du type « ça marchait sur mon environnement » dus à des différences de version. Conserver le déroulement et les résultats avec un texte explicatif dans un seul document relève de Jupyter Notebook, rendre appelable via HTTP relève d'une API web, et louer des ressources de calcul pour la durée nécessaire relève de l'usage du cloud ; ce sont là d'autres outils utilisés dans le développement de l'IA.
Q9 | Corpus
Quelle description du terme corpus, dans le domaine du traitement du langage naturel, est appropriée ?
Un ensemble de données d'image ou audio, largement publié pour la recherche et le développement
Un ensemble de traitements d'analyse morphologique, qui découpe un texte en mots et détermine leur nature grammaticale
Un ensemble de grandes quantités de données textuelles, collectées et organisées pour le traitement du langage
Un ensemble de paramètres de poids, appris pour représenter les mots sous forme de vecteurs
RéponseC. Un ensemble de grandes quantités de données textuelles, collectées et organisées pour le traitement du langage
Un corpus désigne un grand volume de données textuelles, collectées et organisées pour le traitement du langage naturel. Selon l'usage, des informations de nature grammaticale ou syntaxique peuvent y être ajoutées. L'ensemble des données publiées pour la recherche et le développement en général constitue un jeu de données ouvert, qui inclut aussi bien les images que l'audio et ne se limite pas au texte. La représentation vectorielle des mots est un produit de l'apprentissage et non un ensemble de données, et l'analyse morphologique est une méthode de traitement du texte ; ni l'une ni l'autre ne correspond à la définition d'un corpus. Notons qu'un corpus est aussi soumis à une licence et à des conditions d'utilisation, dont il faut vérifier au cas par cas si elles autorisent l'usage commercial ou la redistribution.
Q10 | Coopération avec l'extérieur
Quelle est la description la plus appropriée de l'innovation ouverte, évoquée dans le contexte du développement de l'IA ?
Utiliser des jeux de données publiquement disponibles pour réduire l'effort de collecte
Publier gratuitement le modèle développé et le code source, sous une forme utilisable par tous
Rassembler des personnes de différents départements internes pour créer un dispositif de développement transversal
Intégrer activement des technologies, des connaissances et des talents externes pour créer une nouvelle valeur
RéponseD. Intégrer activement des technologies, des connaissances et des talents externes pour créer une nouvelle valeur
L'innovation ouverte est l'idée de ne pas se limiter à la recherche et au développement internes de l'entreprise, mais d'intégrer activement des technologies, des connaissances et des talents externes pour créer de la valeur. Le programme place dans la même sous-section la coopération université-industrie et la coopération avec d'autres entreprises ou d'autres secteurs ; la collaboration de recherche avec des institutions comme les universités, ou l'association avec un partenaire disposant de données ou de canaux de distribution que l'entreprise n'a pas, en sont des moyens. Publier gratuitement le résultat relève de l'idée de l'open source, une direction opposée à celle d'intégrer des ressources externes. Un dispositif transversal interne ou l'utilisation de jeux de données publics ne désignent pas en eux-mêmes une coopération avec des acteurs externes.
Q11 | Différence entre informations traitées
Quelle est la différence correcte, dans la loi japonaise sur la protection des informations personnelles, entre les informations anonymisées et les informations pseudonymisées ?
Les deux peuvent être fournies à un tiers avec le consentement de la personne, et ne le peuvent pas sans ce consentement
Les informations anonymisées ne peuvent pas être fournies à un tiers sans le consentement de la personne, mais les informations pseudonymisées le peuvent
Les deux sont uniformément interdites de fourniture à un tiers, quel que soit le degré de traitement
Les informations anonymisées peuvent être fournies à un tiers sans le consentement de la personne, mais les informations pseudonymisées ne le peuvent en principe pas
RéponseD. Les informations anonymisées peuvent être fournies à un tiers sans le consentement de la personne, mais les informations pseudonymisées ne le peuvent en principe pas
Les informations anonymisées sont des données traitées de manière à ne pas permettre d'identifier un individu précis, et de manière à ce que les informations personnelles d'origine ne puissent pas être reconstituées. Le traitement étant poussé à ce point, elles peuvent, en suivant les procédures prévues, être fournies à un tiers sans le consentement de la personne. Les informations pseudonymisées, en revanche, sont traitées au point de ne pas permettre d'identifier un individu précis sauf à les recouper avec d'autres informations ; le traitement, comme la suppression du nom, est plus léger et conserve une valeur analytique, mais en contrepartie, elles ne peuvent en principe pas être fournies à un tiers, leur usage étant envisagé pour une analyse interne à l'entreprise. Il est utile de retenir que plus le traitement est léger, moins la donnée peut sortir, pour éviter la confusion.
Q12 | Code d'identification personnelle
Quelle description concernant les codes d'identification personnelle de la loi sur la protection des informations personnelles est correcte ?
Un numéro de passeport ou des données de reconnaissance faciale, par exemple, sont traités comme des informations personnelles à eux seuls
Ils ne sont traités comme permettant d'identifier une personne que combinés avec un nom
Ils ne sont traités comme informations personnelles que s'ils ont été obtenus avec le consentement de la personne
Ils ne sont pas concernés au moment de la collecte, et deviennent des informations personnelles seulement lorsqu'ils sont mis en base de données
RéponseA. Un numéro de passeport ou des données de reconnaissance faciale, par exemple, sont traités comme des informations personnelles à eux seuls
Les codes d'identification personnelle comprennent des données de caractéristiques corporelles telles que les empreintes digitales, les données de reconnaissance faciale ou un code converti à partir d'une séquence d'ADN, ainsi que des numéros attribués à un individu tels que le numéro My Number, le numéro de passeport ou le numéro de permis de conduire. Ces éléments constituent à eux seuls des informations personnelles, si bien que penser qu'il n'y a pas d'information personnelle en l'absence de nom est erroné. Le fait de relever ou non des informations personnelles ne dépend pas non plus du consentement obtenu au moment de la collecte, ni du fait d'être ou non mis en base de données. Notons que ce qui est organisé systématiquement et rendu consultable est appelé donnée personnelle, ce qui entraîne des obligations supplémentaires.
Q13 | RGPD
Quelle est la position correcte du RGPD ?
Une orientation donnée par une organisation internationale, sans force contraignante juridique pour les pays
Un règlement établi pour étendre à l'international la loi japonaise sur la protection des informations personnelles
Un règlement de l'UE, ne concernant que les entreprises ayant leur siège dans l'UE
Un règlement de l'UE, pouvant s'appliquer aussi à des entreprises situées hors de l'UE
RéponseD. Un règlement de l'UE, pouvant s'appliquer aussi à des entreprises situées hors de l'UE
Le RGPD est le règlement général sur la protection des données de l'UE, une législation de l'UE distincte de la loi japonaise sur la protection des informations personnelles. Sa particularité est son application extraterritoriale : dès lors qu'une entreprise fournit des biens ou des services à des personnes situées dans l'UE, ou surveille le comportement de personnes situées dans l'UE, il peut s'appliquer même à une entreprise développant ses activités au Japon. On ne peut donc pas décider du champ d'application uniquement en fonction de la localisation du siège dans l'UE. Il ne s'agit pas non plus d'une extension de la loi japonaise, ni d'une orientation sans force contraignante.
Q14 | Article 30-4
Dans quel cas l'article 30-4 de la loi japonaise sur le droit d'auteur autorise-t-il l'utilisation d'une œuvre sans l'autorisation du titulaire des droits d'auteur ?
Lorsque le but n'est pas de faire percevoir, par soi-même ou par autrui, la pensée ou le sentiment exprimé dans l'œuvre
Lorsque la quantité de l'œuvre utilisée ne représente qu'une infime partie du tout
Lorsque l'œuvre utilisée est publiée gratuitement sur Internet
Lorsque le but de l'utilisation n'est pas lucratif et se limite à la recherche académique
RéponseA. Lorsque le but n'est pas de faire percevoir, par soi-même ou par autrui, la pensée ou le sentiment exprimé dans l'œuvre
L'article 30-4 de la loi sur le droit d'auteur prévoit qu'une œuvre peut être utilisée, dans la limite jugée nécessaire, lorsque le but n'est pas de faire percevoir, par soi-même ou par autrui, la pensée ou le sentiment exprimé dans l'œuvre. Percevoir désigne le fait d'apprécier la pensée ou le sentiment exprimé dans une œuvre pour en tirer une satisfaction intellectuelle ou spirituelle ; l'acte de la lire comme donnée pour l'apprentissage automatique n'est pas considéré comme relevant de cela. L'alinéa 2 de cet article mentionne explicitement l'analyse d'informations, où se situent la création de données d'apprentissage et l'apprentissage lui-même. La publication gratuite, l'absence de but lucratif, ou une quantité limitée ne sont en aucun cas des conditions posées par cet article.
Q15 | La clause restrictive
Concernant l'utilisation d'une œuvre pour l'apprentissage de l'IA, quelle compréhension de l'article 30-4 de la loi sur le droit d'auteur est correcte ?
L'utilisation pour l'apprentissage n'est admise que si l'œuvre a été achetée à titre onéreux
Si l'utilisation est destinée à l'apprentissage, les intérêts du titulaire des droits d'auteur ne posent jamais problème
Cette disposition ne s'applique pas lorsque cela porterait atteinte de façon injustifiée aux intérêts du titulaire des droits d'auteur
Si l'apprentissage est licite, même si l'œuvre générée ressemble à une œuvre existante, cela ne constitue pas une contrefaçon
RéponseC. Cette disposition ne s'applique pas lorsque cela porterait atteinte de façon injustifiée aux intérêts du titulaire des droits d'auteur
L'article 30-4 comporte une clause restrictive selon laquelle il ne s'applique pas lorsque, compte tenu de la nature et de l'usage de l'œuvre concernée ainsi que des modalités de cette utilisation, cela porterait atteinte de façon injustifiée aux intérêts du titulaire des droits d'auteur. On ne peut donc pas dire que « tout usage est libre du moment qu'il s'agit d'apprentissage de l'IA ». Par exemple, si l'on reproduit sans l'acheter une base de données vendue pour l'analyse d'informations, afin de l'utiliser pour l'apprentissage, cela est considéré comme relevant de la clause restrictive car cela nuit au marché de cette base de données. De plus, même si l'étape d'entrée, l'apprentissage, est licite, si l'œuvre générée ressemble à une œuvre existante, une atteinte au droit d'auteur peut être soulevée séparément au stade de la sortie, c'est-à-dire la génération ou l'utilisation. L'entrée et la sortie sont évaluées séparément. Le fait d'avoir acheté l'œuvre à titre onéreux n'est pas le critère déterminant l'application de cet article.
Q16 | Droit d'auteur sur une œuvre générée
Concernant le fait qu'une œuvre générée par l'IA relève ou non du droit d'auteur, quelle est la position la plus proche de la conception actuellement établie ?
Le droit d'auteur revient naturellement au fournisseur du service utilisé
Dès lors qu'il s'agit d'une sortie produite automatiquement par l'IA, elle ne peut jamais être reconnue comme une œuvre
Cela se juge au cas par cas, selon qu'une contribution créative humaine est reconnue ou non
Le droit d'auteur est toujours reconnu à la personne qui a donné l'instruction de génération
RéponseC. Cela se juge au cas par cas, selon qu'une contribution créative humaine est reconnue ou non
Le droit d'auteur étant un régime protégeant l'expression créative humaine, ce qui n'est que le résultat produit automatiquement par l'IA ne constitue pas une œuvre. En revanche, si l'humain est intervenu au point d'avoir donné les caractéristiques essentielles de l'expression, il existe une marge pour reconnaître un caractère d'œuvre. La clé du jugement est la contribution créative, examinée au cas par cas selon la précision des instructions et des essais successifs, ou le degré de sélection et de modification de l'œuvre produite. Il est donc erroné de considérer que cela ne constitue jamais une œuvre, comme il est erroné de considérer que la personne ayant donné l'instruction obtient toujours le droit. Notons que, indépendamment de la loi sur le droit d'auteur, les conditions d'utilisation du service employé peuvent définir le traitement de l'œuvre générée ; il faut vérifier les deux.
Q17 | Invention de mission
Quel est le traitement correct d'une invention de mission (invention réalisée dans le cadre d'un emploi) selon la loi sur les brevets ?
En le prévoyant par un règlement intérieur, le droit peut revenir à l'employeur, et le salarié obtient un avantage équitable
Même s'il s'agit d'une invention réalisée dans le cadre du travail, il n'y a aucune marge pour que le droit revienne à l'employeur
Le droit revient toujours à l'employeur, et il n'est pas possible de prévoir une disposition différente par règlement intérieur
Même lorsque le droit revient à l'employeur, il n'est pas nécessaire de verser un avantage au salarié
RéponseA. En le prévoyant par un règlement intérieur, le droit peut revenir à l'employeur, et le salarié obtient un avantage équitable
Une invention de mission désigne une invention réalisée par un salarié dans le cadre de son travail. Le droit d'obtenir un brevet naît en principe au profit du salarié, l'inventeur, mais si cela est prévu à l'avance par un règlement intérieur ou un document équivalent, ce droit peut revenir à l'employeur dès sa naissance. Dans ce cas, le salarié se voit reconnaître le droit de recevoir un avantage économique équitable, en argent ou autrement ; ce n'est donc pas un régime qui retire le droit sans contrepartie. Par ailleurs, le droit ne revient ni toujours à l'employeur, ni jamais à lui ; l'essentiel est que le traitement dépend de l'existence ou non d'une telle disposition.
Q18 | Secret d'affaires
Quelle combinaison correspond aux conditions requises, selon la loi sur la prévention de la concurrence déloyale, pour qu'une information soit protégée en tant que secret d'affaires ?
Les trois conditions du secret d'affaires sont : être géré comme un secret (gestion confidentielle), être une information technique ou commerciale utile à l'activité de l'entreprise (utilité), et ne pas être notoirement connu du public (non-notoriété publique) ; la protection n'est accordée que si les trois sont réunies. La nouveauté et l'activité inventive sont des conditions requises pour obtenir un brevet, et non des conditions du secret d'affaires. Alors que le brevet est un régime accordant un monopole en échange de la divulgation du contenu, le secret d'affaires protège en ne divulguant pas ; des informations que l'on ne souhaite pas rendre publiques, comme les poids d'un modèle entraîné ou les astuces de prétraitement, se protègent donc par cette voie.
Q19 | Données à fourniture limitée
Concernant les données à fourniture limitée de la loi sur la prévention de la concurrence déloyale, quelle affirmation est correcte ?
C'est une catégorie visant les informations techniques ayant fait l'objet d'une demande de brevet mais n'ayant pas abouti à un enregistrement
Sont concernées les informations remplissant les trois conditions du secret d'affaires, et ayant en plus fait l'objet d'un enregistrement
C'est une catégorie visant les informations conservées uniquement en interne, sans être fournies à personne
Sont concernés les enregistrements électromagnétiques accumulés en quantité substantielle et gérés, fournis dans le cadre d'une activité à des personnes déterminées
RéponseD. Sont concernés les enregistrements électromagnétiques accumulés en quantité substantielle et gérés, fournis dans le cadre d'une activité à des personnes déterminées
Les données à fourniture limitée désignent des informations fournies dans le cadre d'une activité à des personnes déterminées, accumulées en quantité substantielle par des moyens électromagnétiques et gérées comme telles. Cette catégorie a été instaurée pour protéger les transactions consistant à vendre ou partager des données, et son intérêt réside dans le fait qu'elle peut être protégée même sans remplir les trois conditions du secret d'affaires. En effet, dès lors que l'information est fournie à plusieurs destinataires, elle ne satisfait pas nécessairement strictement la condition de non-notoriété publique. Une information conservée en secret uniquement en interne relève plutôt du secret d'affaires, et cette catégorie n'a pas de rapport avec le dépôt ou l'enregistrement d'un brevet.
Q20 | Contrat de développement
Quelle est la différence correcte, dans la sous-traitance d'un développement d'IA, entre un contrat d'entreprise (ukeoi) et un contrat de mandat sans obligation de résultat (junishin-i) ?
Le contrat d'entreprise promet l'achèvement du travail, le contrat de mandat s'exécute avec une obligation de diligence raisonnable
Le contrat d'entreprise impose une obligation de diligence raisonnable, le contrat de mandat promet l'achèvement
Les deux sont des contrats promettant l'achèvement du livrable, seul le niveau de précision garanti diffère
Les deux sont des contrats ne promettant pas d'achèvement, seul le moment du paiement de la rémunération diffère
RéponseA. Le contrat d'entreprise promet l'achèvement du travail, le contrat de mandat s'exécute avec une obligation de diligence raisonnable
Le contrat d'entreprise (ukeoi) est un contrat promettant l'achèvement d'un travail : sans achèvement, aucune rémunération ne peut être réclamée, et une responsabilité est engagée pour un livrable non conforme au contrat. Le contrat de mandat sans obligation de résultat (junishin-i) est un contrat confiant le traitement d'une affaire, où ce qui est promis n'est pas l'achèvement, mais l'exécution du travail avec la diligence d'un bon gestionnaire. Le développement de l'IA ayant la particularité que la précision atteignable n'est connue qu'après avoir essayé l'apprentissage, on adopte souvent une répartition où l'étape d'exploration et de PoC relève d'un contrat de mandat, et l'étape de mise en œuvre une fois les spécifications figées relève d'un contrat d'entreprise. Les lignes directrices contractuelles sur l'utilisation de l'IA et des données du ministère de l'Économie, du Commerce et de l'Industrie présentent également ce type de contractualisation par étapes.
Q21 | Droit dur
Quelle est la distinction correcte entre droit dur (hard law) et droit souple (soft law) ?
Le droit dur désigne les textes ayant force contraignante, le droit souple les règles sans force obligatoire
Le droit dur désigne les textes assortis de sanctions, le droit souple les textes sans sanction
Le droit dur désigne les accords internationaux, le droit souple les lois nationales
Le droit dur désigne les textes nouvellement créés, le droit souple les pratiques anciennes
RéponseA. Le droit dur désigne les textes ayant force contraignante, le droit souple les règles sans force obligatoire
Le droit dur désigne les textes établis par l'État, dont la violation entraîne une force contraignante, comme la loi sur la protection des informations personnelles ou la loi sur le droit d'auteur. Le droit souple désigne des règles sans force juridique contraignante, telles que des lignes directrices, des normes d'autorégulation sectorielles ou des codes de conduite d'entreprise. Le droit souple n'étant pas un texte de loi, la distinction entre textes avec et sans sanction ne s'y applique pas. Ce n'est ni une distinction national/international, ni une distinction ancien/nouveau. Dans les domaines où la technologie évolue vite, on indique d'abord une direction par le droit souple, avant de légiférer uniquement là où c'est nécessaire ; la politique japonaise en matière d'IA repose fondamentalement sur le droit souple.
Q22 | Réponse au risque
Quelle est l'idée de l'approche fondée sur le risque (risk-based approach), évoquée dans la régulation de l'IA ou les réponses internes des entreprises ?
Dès qu'un risque est constaté, arrêter uniformément la fourniture du service correspondant à cet usage
Énumérer les risques envisagés, puis imposer le même niveau de mesures à tous les usages
Confier l'évaluation du risque à l'utilisateur, l'entreprise se contentant de fournir l'information
Faire varier l'intensité de la réponse ou de la régulation selon l'ampleur du risque que présente l'usage
RéponseD. Faire varier l'intensité de la réponse ou de la régulation selon l'ampleur du risque que présente l'usage
L'approche fondée sur le risque est l'idée de faire varier l'intensité de la régulation ou de la réponse selon l'ampleur du risque que présente un usage de l'IA. Une même technologie de reconnaissance faciale n'a pas du tout le même impact selon qu'elle déverrouille l'écran d'un appareil ou qu'elle assure une surveillance permanente dans un espace public. Imposer une régulation uniformément stricte à tous les usages arrêterait même les usages à faible risque, et l'assouplir uniformément laisserait perdurer les usages à fort risque. On attribue donc des obligations strictes aux usages à fort impact et un traitement léger aux usages à faible impact. Du côté des entreprises également, on applique la même idée en classant les projets d'IA internes selon leur niveau de risque, et en ne soumettant à un examen strict que ceux à haut risque.
Q23 | Précaution dès la conception
Quelle est l'idée la plus appropriée du concept de protection de la vie privée dès la conception (privacy by design) ?
Limiter les personnes traitant les informations personnelles, pour que seules les personnes autorisées puissent les consulter
Intégrer un mécanisme de protection de la vie privée dès l'étape de planification ou de conception
Divulguer l'usage des données collectées à la demande de l'utilisateur
Rechercher la cause une fois qu'un problème est survenu, et ajouter les mesures nécessaires après coup
RéponseB. Intégrer un mécanisme de protection de la vie privée dès l'étape de planification ou de conception
La protection de la vie privée dès la conception est l'idée d'intégrer la protection de la vie privée dès l'étape de planification ou de conception, plutôt que d'ajouter des mesures après la survenue d'un problème. Concevoir un système qui ne collecte pas de données, les supprime après la durée nécessaire, ou les traite sous une forme non identifiable, coûte d'autant plus cher que ces décisions sont prises tard. La divulgation de l'usage ou la limitation des droits de consultation sont, en elles-mêmes, des démarches correctes, mais elles ne prennent pas en compte le moment où l'on intègre la mesure, et ne correspondent donc pas à cette idée. La sécurité dès la conception (security by design), qui intègre les mesures de sécurité dès l'étape de conception, en est le concept jumeau.
Q24 | Variable de substitution
Même en retirant les attributs sensibles des données d'apprentissage, une sortie inéquitable peut subsister. Quelle en est la principale raison ?
Parce que d'autres caractéristiques, comme le code postal, jouent le rôle de substitut à l'attribut retiré
Parce que, même retiré, l'attribut est réintroduit lors d'un réapprentissage sur d'autres données qui le contiennent
Parce que retirer l'attribut réduit le volume de données, ce qui fait baisser la précision même du modèle
Parce que le traitement de retrait de l'attribut lui-même déforme la distribution des données
RéponseA. Parce que d'autres caractéristiques, comme le code postal, jouent le rôle de substitut à l'attribut retiré
Une caractéristique qui finit par jouer le rôle de substitut à un attribut sensible est appelée variable de substitution. Le code postal est fortement corrélé, via la zone de résidence, à l'origine ethnique ou au revenu, et l'établissement d'origine ou l'historique d'activités extrascolaires peuvent être corrélés au genre. Tant que de telles caractéristiques subsistent, même en retirant de l'entrée les champs genre ou origine ethnique, le modèle apprend indirectement la même discrimination. La vérification de l'équité doit donc se faire non pas en supprimant des colonnes d'entrée, mais en agrégeant la sortie par attribut pour en mesurer les écarts. De plus, il existe plusieurs définitions de l'équité — égaliser le taux d'acceptation par attribut, égaliser le taux d'erreur, etc. — qui, en général, ne peuvent pas être toutes satisfaites simultanément ; il faut donc choisir et justifier laquelle est retenue selon l'usage.
Q25 | Entrée adverse
Quelle description de l'attaque adverse (Adversarial Attack / Adversarial Examples) est appropriée ?
Ajouter à l'entrée une modification infime, imperceptible pour l'humain, pour provoquer une décision erronée
Effectuer un grand nombre de requêtes pour collecter les sorties et reconstruire un modèle équivalent
Modifier les paramètres d'un modèle distribué, pour y implanter un comportement particulier
Mélanger aux données d'apprentissage des données trafiquées, pour déformer le résultat de l'apprentissage
RéponseA. Ajouter à l'entrée une modification infime, imperceptible pour l'humain, pour provoquer une décision erronée
Une attaque adverse ajoute à l'entrée une modification infime, presque imperceptible à l'œil humain, pour faire prendre au modèle en exploitation une décision erronée. Elle vise l'étape d'inférence et ne modifie pas le modèle lui-même. Mélanger des données trafiquées aux données d'apprentissage pour déformer le résultat est l'empoisonnement des données, qui vise l'étape d'apprentissage. Reconstruire un modèle équivalent à partir d'un grand nombre de requêtes est le vol de modèle, et modifier les paramètres ou le fichier distribué d'un modèle est l'empoisonnement de modèle ; chacun vise un moment et une cible différents. Se prémunir contre ces attaques relève, dans tous les cas, de l'idée de la sécurité dès la conception, qui intègre la sécurité dès l'étape de conception.
Q26 | Distinction du vol
Parmi les attaques visant l'IA, laquelle correspond au vol de modèle ?
Mélanger aux données d'apprentissage des données trafiquées, pour déformer le résultat de l'apprentissage
Estimer et extraire, à partir de la sortie, une information contenue dans les données d'apprentissage
Modifier les paramètres d'un modèle distribué, pour en changer le comportement pour une entrée particulière
Effectuer un grand nombre de requêtes pour collecter les sorties et reconstruire chez soi un modèle équivalent
RéponseD. Effectuer un grand nombre de requêtes pour collecter les sorties et reconstruire chez soi un modèle équivalent
Le vol de modèle est une attaque qui fournit un grand nombre d'entrées à un modèle cible pour en collecter les sorties, et reconstitue chez soi un modèle fonctionnant de manière équivalente. Ce qui est volé est le modèle lui-même, et cela peut réussir même si le modèle n'est fourni que comme API publique. À l'inverse, le vol de données est une attaque qui extrait, par exemple en observant la sortie, une information contenue dans les données d'apprentissage ; ce qui est volé est alors du côté des données. Mélanger des données trafiquées aux données d'apprentissage est l'empoisonnement des données, et modifier les paramètres ou le fichier distribué d'un modèle est l'empoisonnement de modèle ; le premier vise l'étape d'apprentissage, le second l'étape d'apprentissage ou de distribution. Organiser sa réflexion autour de « ce qui est volé » et « quel moment est visé » évite les confusions.
Q27 | Bulle d'information
Quel phénomène est considéré comme résultant de l'optimisation par un algorithme de recommandation ?
Le fondement d'une décision reste dissimulé à l'intérieur, empêchant l'humain d'en suivre la raison
Seules les informations correspondant aux goûts sont sélectionnées et présentées, empêchant les autres informations d'atteindre la personne
Des personnes partageant la même opinion répètent diffusion et approbation mutuelle, renforçant cette opinion
Des images ou des sons truqués générés sont largement perçus comme authentiques
RéponseB. Seules les informations correspondant aux goûts sont sélectionnées et présentées, empêchant les autres informations d'atteindre la personne
La bulle de filtre est le phénomène où, à la suite de la sélection d'informations opérée par un algorithme de recommandation selon les goûts de l'utilisateur, celui-ci se retrouve comme enveloppé dans une bulle, ne voyant plus que les informations conformes à ses goûts ; la cause en est l'optimisation par l'algorithme. L'utilisateur ne se rend pas compte lui-même qu'il fait l'objet d'une sélection. Le fait que des personnes partageant la même opinion répètent, dans un espace clos, diffusion et approbation mutuelle, jusqu'à croire que cette opinion est la seule juste, est la chambre d'écho, dont la cause tient à la propension humaine à se rassembler entre personnes similaires. Le fait que des images ou des sons truqués soient perçus comme authentiques relève des deepfakes et des fake news, et l'impossibilité de suivre le fondement d'une décision relève du problème de la boîte noire ; ce sont là des sujets relevant d'autres sous-sections.
Q28 | Vidéo truquée
Quelle est la description la plus appropriée du deepfake ?
Produire, par apprentissage profond, un texte court résumant les points essentiels d'un grand volume de texte
Visualiser, par apprentissage profond, la région d'une image qui a servi de fondement à une décision
Fabriquer, par apprentissage profond, une vidéo ou un son donnant l'impression qu'une personne réelle parle
Générer et afficher, par apprentissage profond, de nouveaux visages de personnes qui n'existent pas
RéponseC. Fabriquer, par apprentissage profond, une vidéo ou un son donnant l'impression qu'une personne réelle parle
Le deepfake désigne la technologie, ainsi que le produit qui en résulte, permettant de fabriquer par apprentissage profond une vidéo ou un son donnant l'impression qu'une personne réelle dit des choses qu'elle n'a pas dites, ou fait des choses qu'elle n'a pas faites. L'usurpation d'une personne réelle en est le point central, ce qui diffère de la génération d'un visage de personne n'existant pas. Il est utilisé pour la diffamation, la fraude ou l'ingérence électorale, et renforce considérablement le pouvoir de conviction des fake news. En guise de parade, en plus de la recherche sur les techniques de détection, on avance vers l'intégration d'informations de provenance dès la prise de vue ou la génération, permettant de vérifier a posteriori toute modification. Le résumé de texte ou la visualisation du fondement d'une décision ne concernent pas un usage malveillant.
Q29 | Enregistrement de la provenance
Concernant l'assurance de la transparence de l'IA, quel est l'objectif le plus approprié de la conservation de la provenance des données ?
Pour limiter la consommation de ressources de calcul utilisées pour l'apprentissage et réduire les coûts engagés
Pour pouvoir retracer la source et le processus de traitement, et remonter à la cause d'un problème survenu
Pour accélérer l'inférence du modèle et raccourcir le temps avant l'obtention d'une réponse
Pour augmenter le volume de données utilisables pour l'apprentissage et améliorer la précision du modèle
RéponseB. Pour pouvoir retracer la source et le processus de traitement, et remonter à la cause d'un problème survenu
La provenance des données est l'enregistrement de quelles données ont été obtenues d'où, et comment elles ont été traitées avant d'être utilisées pour l'apprentissage. Sans cet enregistrement, lorsqu'un problème survient dans la sortie, il devient impossible de remonter jusqu'aux données en cause, et donc de corriger ou d'expliquer. La transparence ne signifie pas seulement rendre public l'intérieur du modèle, mais inclut aussi le fait de montrer, selon la cible, à quoi il sert, avec quelles données il a été construit, et où se situent ses limites. Réduire les ressources de calcul, accélérer l'inférence, ou augmenter le volume de données ne sont en aucun cas l'objectif de l'enregistrement de la provenance. Il faut aussi retenir la traçabilité, qui permet de suivre de quelles données, via quel modèle, quelle décision est issue.
Q30 | Contrôle éthique
Quelle description de l'évaluation éthique (ethics assessment) en gouvernance de l'IA est appropriée ?
Un document rassemblant la politique de l'entreprise sur la manière de traiter l'IA, présenté à l'extérieur
Une procédure surveillant en continu, après le début de l'exploitation, les tendances de sortie et les réclamations
Une procédure qui, à l'étape de planification, identifie et évalue les impacts et les risques envisagés
Un mécanisme vérifiant, depuis une position indépendante du service concerné, la conformité de l'exploitation à la politique
RéponseC. Une procédure qui, à l'étape de planification, identifie et évalue les impacts et les risques envisagés
L'évaluation éthique est une procédure qui, à l'étape de planification de l'IA, identifie et évalue les impacts et les risques envisagés, l'intensité de l'examen variant selon le résultat. Surveiller après le début de l'exploitation les tendances de sortie et les réclamations est le monitoring, vérifier depuis une position indépendante du service concerné la conformité à la politique est l'audit de l'IA, et rassembler la politique de l'entreprise dans un document présenté à l'extérieur est la politique IA ; ce sont là d'autres éléments constitutifs de la gouvernance de l'IA. À cela s'ajoutent le maintien d'une implication humaine aux moments clés de la décision, la reproductibilité permettant de reconstruire le modèle ultérieurement, et la traçabilité permettant de suivre le cheminement d'une décision.
Entraînement : répondez aux questions de cette page
Cet outil d'entraînement pose les questions dans un ordre aléatoire (il fonctionne lorsque JavaScript est activé). Vous pouvez de toute façon lire toutes les questions et explications ci-dessus.
* Les explications sont fournies à titre d'information pour l'étude. Le programme et le système des examens changent selon les années : vérifiez toujours les annonces officielles de l'organisme qui organise l'examen.
Cette page est une traduction du texte original japonais. En cas de différence entre la traduction et l'original, la version japonaise fait foi. Voir l'original en japonais