Salle d'étude Karinoya

Qualifications · Labo réussite Cloud / AI / Python

Méthodes et évaluation en apprentissage automatique

Les questions et les explications sont disponibles en Français. Les cours (articles explicatifs) n'existent qu'en japonais.

Voir la version japonaise (avec les cours) →

Q1 | Usage de la régression logistique

Quelle description de la régression logistique est appropriée ?

  1. Elle sert à améliorer le choix des actions en se basant sur une récompense
  2. Comme son nom l'indique, elle sert aux problèmes de régression et produit directement une valeur continue
  3. Contrairement à ce que son nom suggère, elle sert aux problèmes de classification et produit une probabilité d'appartenance à une classe
  4. Elle sert, sans données d'apprentissage supervisé, à trouver des groupements dans les données
RéponseC. Contrairement à ce que son nom suggère, elle sert aux problèmes de classification et produit une probabilité d'appartenance à une classe

La régression logistique porte le mot « régression » dans son nom, mais c'est une méthode de classification qui transforme un calcul linéaire en une forme probabiliste pour déterminer une classe. Ce qui prédit directement une valeur continue relève des méthodes de problèmes de régression telles que la régression linéaire ; se laisser guider par le nom pour choisir cette dernière est une erreur classique. Trouver des groupements sans données d'apprentissage supervisé relève du clustering et de l'apprentissage non supervisé, et améliorer le choix des actions à partir d'une récompense relève de l'apprentissage par renforcement ; ce sont là d'autres sous-sections.

Q2 | Régression et classification

Quelle est la différence, en apprentissage supervisé, entre un problème de régression et un problème de classification ?

  1. Le problème de régression utilise des données supervisées, le problème de classification apprend uniquement à partir d'une récompense
  2. Le problème de régression prédit des classes discrètes, le problème de classification prédit une valeur continue
  3. Le problème de régression prédit une valeur continue, le problème de classification prédit des classes discrètes
  4. Le problème de régression n'utilise que des variables explicatives, le problème de classification utilise variables explicatives et données supervisées
RéponseC. Le problème de régression prédit une valeur continue, le problème de classification prédit des classes discrètes

Le problème de régression prédit une valeur continue comme le chiffre d'affaires ou la température, tandis que le problème de classification prédit une classe discrète comme « courrier indésirable ou non ». Inverser ces deux notions est l'erreur la plus fréquente. L'apprentissage supervisé nécessite, dans les deux types de problèmes, des paires de variables explicatives et de données supervisées ; il n'est donc pas exact que l'un des deux se contente de variables explicatives seules. Apprendre uniquement à partir d'une récompense relève de l'apprentissage par renforcement, et ne décrit pas l'apprentissage supervisé.

Q3 | Régression simple et multiple

Quelle différence entre la régression simple et la régression multiple est appropriée ?

  1. La régression simple ne nécessite pas de données supervisées, la régression multiple en nécessite
  2. La régression simple a plusieurs variables explicatives, la régression multiple en a une seule
  3. La régression simple a une seule variable explicative, la régression multiple en a plusieurs
  4. La régression simple sert à la classification, la régression multiple à la prédiction de valeurs continues
RéponseC. La régression simple a une seule variable explicative, la régression multiple en a plusieurs

La régression simple a une seule variable explicative, la régression multiple en a deux ou plus. Le mot « simple » et le mot « multiple » désignent directement le nombre de variables explicatives, si bien qu'inverser les deux est manifestement erroné. Les deux sont des méthodes de régression prédisant une valeur continue, donc dire que l'une sert à la classification n'est pas exact non plus. De plus, l'analyse de régression relève de l'apprentissage supervisé et nécessite des données supervisées, quel que soit le nombre de variables.

Q4 | Maximisation de la marge

Selon quel principe la machine à vecteurs de support (SVM) détermine-t-elle sa frontière ?

  1. Elle retrace la frontière en augmentant le poids des données mal classées
  2. Elle trace la frontière au point milieu du segment reliant les centres de gravité des classes
  3. Elle trace la frontière à l'endroit où l'intervalle avec le point de données le plus proche est maximal
  4. Elle trace la frontière dans la direction où la variance des variables explicatives est maximale
RéponseC. Elle trace la frontière à l'endroit où l'intervalle avec le point de données le plus proche est maximal

La SVM applique le principe de maximisation de la marge : elle trace la frontière à l'endroit où l'intervalle avec le point de données le plus proche est maximal. Ce point le plus proche est appelé vecteur de support. Ajouter des apprenants faibles en augmentant le poids des données mal classées relève de l'idée du boosting, et chercher la direction où la variance est maximale relève de l'idée de l'analyse en composantes principales (ACP) ; ni l'une ni l'autre ne décrit la SVM. La méthode consistant à passer par le point milieu des centres de gravité ne considère pas du tout la marge.

Q5 | Astuce du noyau

Qu'est-ce que l'astuce du noyau (kernel trick) rend possible ?

  1. Effectuer une séparation non linéaire sans calculer réellement les coordonnées après projection dans un espace de haute dimension
  2. Calculer réellement une à une les caractéristiques de haute dimension avant d'effectuer une séparation linéaire
  3. Diviser automatiquement les données en plusieurs groupes sans utiliser de données supervisées
  4. Réduire fortement le nombre même d'exemples de données utilisés pour l'apprentissage afin d'accélérer le calcul
RéponseA. Effectuer une séparation non linéaire sans calculer réellement les coordonnées après projection dans un espace de haute dimension

L'astuce du noyau consiste à calculer directement, au moyen d'une fonction noyau, le produit scalaire après projection dans un espace de haute dimension, ce qui permet une séparation non linéaire sans avoir à calculer réellement les coordonnées dans cet espace projeté. Le fait de ne pas avoir à calculer les coordonnées une à une est précisément la raison pour laquelle on parle d'« astuce » ; affirmer qu'on les calcule réellement avant de séparer inverse donc le sens. La division sans données supervisées relève du clustering, et ce n'est pas non plus un mécanisme réduisant le nombre d'exemples d'apprentissage.

Q6 | Parallèle et séquentiel

Quelle est la différence, en apprentissage d'ensemble, entre le bagging et le boosting ?

  1. Le bagging ne s'applique qu'aux arbres de décision, le boosting ne s'applique qu'à la régression linéaire
  2. Le bagging apprend les apprenants faibles séquentiellement, le boosting les apprend en parallèle
  3. Le bagging apprend les apprenants faibles en parallèle, le boosting les apprend séquentiellement
  4. Le bagging n'utilise pas de données supervisées, le boosting en utilise
RéponseC. Le bagging apprend les apprenants faibles en parallèle, le boosting les apprend séquentiellement

Le bagging crée des apprenants en parallèle et de manière indépendante les uns des autres, à partir de données d'entraînement obtenues par échantillonnage bootstrap, puis prend un vote majoritaire ou une moyenne. Le boosting ajoute les apprenants séquentiellement, en accordant plus de poids aux exemples que l'apprenant précédent a mal traités, ce qui rend le processus dépendant de l'ordre et impossible à paralléliser. Inverser parallèle et séquentiel est l'erreur la plus fréquente. Les deux relèvent de l'apprentissage supervisé et utilisent des données supervisées, et les types d'apprenants faibles utilisables ne se limitent ni à l'arbre de décision ni à la régression linéaire.

Q7 | Forêt aléatoire

Quelle manière d'apprendre correspond correctement à la forêt aléatoire (random forest) ?

  1. Faire croître le plus profondément possible un seul arbre de décision, puis égaliser le nombre de branches à la fin
  2. Ajouter les arbres de décision un par un, en accordant plus de poids aux exemples mal traités par l'arbre précédent
  3. Apprendre en parallèle un grand nombre d'arbres de décision créés par échantillonnage bootstrap
  4. Ne pas utiliser d'arbre de décision, mais faire la moyenne des prédictions de plusieurs régressions linéaires
RéponseC. Apprendre en parallèle un grand nombre d'arbres de décision créés par échantillonnage bootstrap

La forêt aléatoire est un exemple représentatif de bagging : elle crée, par échantillonnage bootstrap (tirage avec remise), des données d'entraînement légèrement différentes, à partir desquelles elle fait croître en parallèle et de manière indépendante un grand nombre d'arbres de décision, puis prend un vote majoritaire ou une moyenne. Ajouter les arbres un par un en accordant plus de poids aux erreurs de l'arbre précédent décrit le boosting, comme le gradient boosting ; inverser les deux est une erreur classique. Ce n'est pas un seul arbre mais un grand nombre qui est utilisé, et ce qui est combiné, ce sont des arbres de décision et non des régressions linéaires.

Q8 | Faiblesse de l'arbre de décision

Quelle description des propriétés de l'arbre de décision est appropriée ?

  1. Plus les bifurcations sont profondes, plus l'ajustement aux données d'entraînement se dégrade nécessairement
  2. Comme il ne nécessite pas de données supervisées, il ne peut être utilisé ni pour la classification ni pour la régression
  3. Les conditions de bifurcation ne peuvent pas être lues par un humain, mais le surapprentissage est peu fréquent
  4. Les conditions de bifurcation peuvent être lues par un humain, mais l'arbre seul est sujet au surapprentissage
RéponseD. Les conditions de bifurcation peuvent être lues par un humain, mais l'arbre seul est sujet au surapprentissage

L'arbre de décision est une méthode qui aligne sous forme d'arbre des bifurcations conditionnelles sur les caractéristiques, ce qui a pour force de permettre à un humain de lire quelle condition a mené vers quelle branche. En revanche, plus l'arbre est développé en profondeur, plus il mémorise les particularités fines des données d'entraînement, ce qui le rend, seul, sujet au surapprentissage. Approfondir l'arbre améliore plutôt l'ajustement aux données d'entraînement, et c'est justement le fait que la performance chute sur de nouvelles données qui pose problème ; dire que l'ajustement se dégrade nécessairement est donc erroné. L'arbre de décision relève de l'apprentissage supervisé et peut servir à la fois à la classification et à la régression.

Q9 | AR et VAR

Quelle est la relation entre le modèle autorégressif (AR) et le modèle autorégressif vectoriel (VAR) ?

  1. AR extrait des caractéristiques locales d'une image, VAR extrait des composantes fréquentielles d'un signal audio
  2. AR traite simultanément plusieurs séries temporelles, VAR n'explique qu'une seule série temporelle par ses valeurs passées
  3. AR ne nécessite pas de données supervisées, VAR en nécessite
  4. AR explique une seule série temporelle par ses propres valeurs passées, VAR explique plusieurs séries temporelles par leurs valeurs passées mutuelles
RéponseD. AR explique une seule série temporelle par ses propres valeurs passées, VAR explique plusieurs séries temporelles par leurs valeurs passées mutuelles

Le modèle AR explique la valeur actuelle d'une seule série temporelle par les valeurs passées de cette série elle-même. Le modèle VAR étend cette idée à plusieurs séries temporelles, en les expliquant mutuellement par leurs valeurs passées respectives. La différence tient donc au fait de traiter une seule ou plusieurs séries ; inverser cela est erroné. Les deux sont des modèles traitant des séries temporelles, et non des outils pour extraire des caractéristiques locales d'image ou des composantes fréquentielles audio. Ce n'est pas non plus une distinction fondée sur la nécessité de données supervisées.

Q10 | Classification multiclasse

Parmi les cas suivants, lequel relève de la classification multiclasse ?

  1. Attribuer à une image de chiffre manuscrit l'un des chiffres de 0 à 9
  2. Choisir à nouveau, à partir de l'état du plateau, le prochain coup en se basant sur une récompense
  3. Trouver des groupements de clients semblables à partir de leur historique d'achat
  4. Prédire la valeur de la température maximale de demain à partir de la température et de l'humidité
RéponseA. Attribuer à une image de chiffre manuscrit l'un des chiffres de 0 à 9

La classification multiclasse est un problème de classification consistant à déterminer à laquelle de trois classes ou plus appartient un élément ; attribuer à un chiffre manuscrit l'un des chiffres de 0 à 9 en est un exemple typique. Prédire une valeur continue comme la température maximale relève d'un problème de régression, et non de classification. Trouver des groupements de clients semblables relève du clustering et de l'apprentissage non supervisé, et choisir un coup en se basant sur une récompense relève de l'apprentissage par renforcement ; aucun des deux n'est en premier lieu un problème de classification en apprentissage supervisé.

Q11 | Entrée de l'apprentissage non supervisé

Quelle description de l'apprentissage non supervisé est appropriée ?

  1. Fournir uniquement des variables explicatives, et trouver la structure ou les régularités propres aux données elles-mêmes
  2. Fournir des paires de variables explicatives et de données supervisées, et réduire l'écart avec la bonne réponse
  3. N'utiliser qu'un petit nombre de données étiquetées, en écartant le reste pour poursuivre l'apprentissage
  4. Améliorer le choix des actions en se basant sur la récompense reçue de l'environnement
RéponseA. Fournir uniquement des variables explicatives, et trouver la structure ou les régularités propres aux données elles-mêmes

Le programme cite comme objectif de « comprendre que l'apprentissage non supervisé ne nécessite que des variables explicatives ». Sans étiquette de bonne réponse, l'apprentissage non supervisé trouve la structure propre aux données elles-mêmes par le clustering ou la réduction de dimension. Supposer des paires de variables explicatives et de données supervisées relève de l'apprentissage supervisé, et se baser sur une récompense relève de l'apprentissage par renforcement ; ce sont là des sous-sections distinctes. Écarter le reste des données n'est pas non plus une description de l'apprentissage non supervisé.

Q12 | Méthode k-means

Quel déroulement correspond correctement à la méthode k-means ?

  1. Fixer d'abord le nombre de clusters, puis répéter la mise à jour des centres de gravité et l'affectation
  2. Fournir des étiquettes de bonne réponse et maximiser la marge de la frontière
  3. Sans fixer le nombre de clusters, répéter la fusion des éléments les plus proches
  4. Estimer, à partir de la fréquence d'apparition des mots, la proportion des thèmes cachés dans un document
RéponseA. Fixer d'abord le nombre de clusters, puis répéter la mise à jour des centres de gravité et l'affectation

La méthode k-means est un clustering non hiérarchique qui fixe à l'avance le nombre de clusters k, puis répète l'opération consistant à affecter chaque point au centre de gravité le plus proche et à recalculer les centres de gravité. Fusionner successivement les éléments les plus proches sans fixer le nombre de clusters relève d'un clustering hiérarchique tel que la méthode de Ward, qui permet de tracer un dendrogramme (diagramme en arbre). Maximiser la marge relève de la SVM en apprentissage supervisé, et estimer les thèmes à partir de la fréquence des mots relève des modèles de sujets tels que l'allocation de Dirichlet latente (LDA).

Q13 | Méthode de Ward

Quelle est la relation entre la méthode de Ward et le dendrogramme (diagramme en arbre) ?

  1. Une méthode de réduction de dimension, où les deux axes obtenus après réduction sont tracés comme un dendrogramme
  2. Une méthode de clustering hiérarchique, dont le processus de fusion peut être tracé sous forme de dendrogramme
  3. Une méthode d'apprentissage supervisé, où la frontière de classification est tracée comme un dendrogramme
  4. Une méthode de clustering non hiérarchique, pour laquelle un dendrogramme ne peut en principe pas être tracé
RéponseB. Une méthode de clustering hiérarchique, dont le processus de fusion peut être tracé sous forme de dendrogramme

La méthode de Ward est un clustering hiérarchique qui fusionne successivement les éléments les plus proches, et son processus de fusion peut être tracé sous forme de dendrogramme (diagramme en arbre). L'avantage est de pouvoir décider a posteriori du nombre de clusters, en observant à quelle hauteur couper l'arbre. C'est plutôt la méthode k-means qui est non hiérarchique et fixe d'abord le nombre de clusters ; elle ne produit pas de dendrogramme. La méthode de Ward n'est ni une méthode de réduction de dimension, ni une méthode d'apprentissage supervisé, et n'utilise pas d'étiquette de bonne réponse.

Q14 | PCA et t-SNE

Quelle différence entre l'analyse en composantes principales (ACP) et t-SNE est appropriée ?

  1. L'ACP est une réduction de dimension linéaire, t-SNE est non linéaire et adaptée à la visualisation
  2. L'ACP nécessite des données supervisées, t-SNE fonctionne uniquement avec des variables explicatives
  3. L'ACP est une réduction de dimension non linéaire, t-SNE est linéaire et adaptée à la visualisation
  4. L'ACP estime les thèmes d'un document, t-SNE est une méthode de décomposition matricielle
RéponseA. L'ACP est une réduction de dimension linéaire, t-SNE est non linéaire et adaptée à la visualisation

L'ACP est une réduction de dimension linéaire qui redéfinit les axes dans la direction où la variance est maximale, tandis que t-SNE est une méthode non linéaire qui projette vers un espace de basse dimension en préservant la proximité entre points proches, souvent utilisée pour la visualisation en 2D ou 3D. Inverser linéaire et non linéaire est une erreur classique. Estimer les thèmes d'un document relève des modèles de sujets tels que l'allocation de Dirichlet latente (LDA), et la décomposition matricielle relève de la décomposition en valeurs singulières (SVD). L'ACP comme t-SNE relèvent de l'apprentissage non supervisé, et ne nécessitent donc pas de données supervisées.

Q15 | Démarrage à froid

Quel est le problème de démarrage à froid (cold start) dans le filtrage collaboratif ?

  1. Le fait qu'un produit recommandé soit en rupture de stock, ce qui empêche de le livrer à l'utilisateur
  2. Le fait qu'en se basant uniquement sur le texte descriptif d'un produit, les recommandations deviennent biaisées
  3. Le fait que, pour un utilisateur ayant trop d'historique, le calcul de recommandation ne se termine plus
  4. Le fait qu'il soit difficile de proposer une bonne recommandation à un utilisateur ou un produit n'ayant pas encore d'historique
RéponseD. Le fait qu'il soit difficile de proposer une bonne recommandation à un utilisateur ou un produit n'ayant pas encore d'historique

Le filtrage collaboratif recommande en se basant sur la ressemblance des évaluations entre utilisateurs, ou entre produits ; il devient donc difficile de trouver un indice pour un nouvel utilisateur ou un nouveau produit sans encore d'historique d'évaluation, rendant la recommandation difficile à produire. C'est le problème de démarrage à froid. Le filtrage basé sur le contenu, qui s'appuie sur le texte descriptif ou les attributs mêmes du produit, est présenté comme une approche complémentaire visant à pallier cette faiblesse. Ce n'est ni une question de temps de calcul, ni une question de stock.

Q16 | Signal de l'apprentissage par renforcement

Sur quoi l'apprentissage par renforcement se base-t-il pour apprendre ?

  1. Le signal de récompense reçu de l'environnement
  2. Le nombre d'occurrences des mots contenus dans un document
  3. Une étiquette de bonne réponse fournie par un humain pour chaque exemple
  4. Uniquement la proximité de distance entre variables explicatives
RéponseA. Le signal de récompense reçu de l'environnement

L'apprentissage par renforcement interagit par essais et erreurs avec l'environnement, et apprend une politique qui maximise le cumul des récompenses reçues. Le signal utilisé n'est pas une étiquette de bonne réponse à chaque coup, mais une récompense ; ce n'est donc pas une forme d'apprentissage supervisé. Se baser uniquement sur la proximité de distance relève de l'idée du clustering et de l'apprentissage non supervisé, et le nombre d'occurrences des mots relève des représentations de caractéristiques du traitement du langage naturel ; aucun des deux n'est le signal d'apprentissage de l'apprentissage par renforcement. Le fait d'évaluer le futur à l'aide d'un taux d'actualisation, pour le cas où la récompense n'est pas retournée immédiatement, est également une caractéristique de ce cadre.

Q17 | Valeur et politique

Quelle description des deux approches représentatives de l'apprentissage par renforcement est appropriée ?

  1. Il n'existe qu'une méthode apprenant la fonction de valeur, la politique étant déterminée de manière unique à partir de celle-ci
  2. Il existe une méthode apprenant la fonction de valeur et une méthode apprenant directement la politique, et Actor-Critic combine les deux
  3. Il n'existe qu'une méthode apprenant directement la politique, la fonction de valeur ne pouvant être utilisée en cours d'apprentissage
  4. La fonction de valeur comme la politique sont toutes deux conçues manuellement par l'humain, et ne font jamais l'objet d'un apprentissage
RéponseB. Il existe une méthode apprenant la fonction de valeur et une méthode apprenant directement la politique, et Actor-Critic combine les deux

Le programme cite comme objectif de « comprendre les deux approches représentatives que sont l'apprentissage de la fonction de valeur et l'apprentissage de la politique ». La première consiste à estimer une fonction de valeur d'état ou d'action avant de choisir une action, dont le Q-learning et SARSA sont des exemples représentatifs. La seconde représente directement la politique par des paramètres et la met à jour directement, dont la méthode du gradient de politique et REINFORCE sont des exemples représentatifs. Actor-Critic combine un Actor chargé de la politique et un Critic chargé de la valeur, réunissant les deux approches. Affirmer qu'il n'existe que l'une des deux, ou qu'aucune ne fait l'objet d'apprentissage, est erroné.

Q18 | Q-learning et SARSA

Quelle différence entre le Q-learning et SARSA est appropriée ?

  1. Le Q-learning utilise la valeur de l'action réellement choisie, SARSA utilise la valeur d'action maximale de l'état suivant
  2. Le Q-learning nécessite des données supervisées, SARSA se met à jour sans données supervisées
  3. Le Q-learning n'utilise pas de fonction de valeur d'action, seul SARSA met à jour une fonction de valeur d'action
  4. Le Q-learning utilise la valeur d'action maximale de l'état suivant, SARSA utilise la valeur de l'action réellement choisie
RéponseD. Le Q-learning utilise la valeur d'action maximale de l'état suivant, SARSA utilise la valeur de l'action réellement choisie

Les deux sont des méthodes d'apprentissage par renforcement qui mettent à jour une fonction de valeur d'action, la différence portant sur ce qui est utilisé pour la mise à jour. Le Q-learning utilise la valeur maximale parmi les actions possibles dans l'état suivant, tandis que SARSA utilise la valeur de l'action suivante réellement choisie pour sa mise à jour. Inverser les deux est une erreur classique. Le Q-learning met lui aussi à jour une fonction de valeur d'action, donc dire qu'un seul des deux l'utilise n'est pas exact. Les deux relevant d'un cadre d'apprentissage par renforcement fondé sur la récompense, dire qu'ils nécessitent des données supervisées est également erroné.

Q19 | ε-greedy

Dans un problème de bandit à 4 bras, on utilise une politique ε-greedy : avec probabilité ε, on choisit uniformément au hasard l'un des 4 bras, et avec probabilité 1-ε, on choisit le bras dont la valeur estimée est maximale. Pour ε = 0,1, quelle est la probabilité que le bras choisi soit, au final, celui de valeur estimée maximale ?

  1. 0,900
  2. 0,100
  3. 0,250
  4. 0,925
RéponseD. 0,925

Le bras de valeur estimée maximale est choisi dans deux cas : lorsqu'on choisit de façon avide, et lorsqu'un choix aléatoire tombe par hasard sur ce bras. Le premier cas donne 1 moins 0,1, soit 0,900, le second donne 0,1 divisé par 4, soit 0,025, et la somme des deux vaut 0,925. 0,900 est la valeur oubliant la part obtenue par choix aléatoire, 0,250 est la probabilité de choisir uniformément l'un des 4 bras, et 0,100 est ε lui-même. Plus ε est grand, plus l'exploration augmente, et plus cette probabilité diminue.

Q20 | Calcul du taux d'actualisation

À partir d'un instant donné, on reçoit une récompense de 4 après 1 pas, de 12 après 2 pas, et de 8 après 3 pas. En multipliant la récompense à 1 pas par 0,5, celle à 2 pas par 0,5 au carré, et celle à 3 pas par 0,5 au cube, puis en additionnant, quelle est la valeur obtenue ?

  1. 24,0
  2. 6,0
  3. 7,5
  4. 12,0
RéponseB. 6,0

4 multiplié par 0,5 donne 2, 12 multiplié par 0,5 au carré, soit 0,25, donne 3, et 8 multiplié par 0,5 au cube, soit 0,125, donne 1 ; la somme est donc 6,0. 24,0 est la somme de 4, 12 et 8 sans aucune actualisation, 12,0 est cette valeur de 24 multipliée une seule fois par 0,5, et 7,5 correspond à l'ordre inversé des multiplications, avec 4 multiplié par 0,125, 12 par 0,25 et 8 par 0,5 ; ce sont là des confusions fréquentes. Le rôle du taux d'actualisation étant d'accorder une valeur plus faible aux récompenses plus lointaines, un poids plus important est attribué aux récompenses les plus proches.

Q21 | Calcul de la précision

Les résultats de prédiction d'un modèle sont : 40 vrais positifs, 10 faux positifs, 20 faux négatifs, 130 vrais négatifs. Quelle est la précision (precision) ?

  1. 0,85
  2. 0,80
  3. 0,73
  4. 0,67
RéponseB. 0,80

La précision prend au dénominateur ce qui a été prédit comme positif ; on divise donc 40 vrais positifs par la somme de 40 vrais positifs et 10 faux positifs, soit 50, ce qui donne 0,80. 0,67 est le rappel, qui prend au dénominateur ce qui est réellement positif : 40 divisé par la somme de 40 vrais positifs et 20 faux négatifs, soit 60. 0,85 est l'exactitude (accuracy), soit la proportion de 170 bonnes prédictions sur un total de 200, et 0,73 est le score F, moyenne harmonique de la précision 0,80 et du rappel 0,67 ; ce sont là d'autres indicateurs calculés par erreur.

Q22 | Différence de dénominateur

Quelle différence entre les dénominateurs de la précision et du rappel est appropriée ?

  1. La précision prend au dénominateur le nombre réellement positif, le rappel prend le nombre prédit positif
  2. La précision prend au dénominateur uniquement le nombre de vrais négatifs, le rappel uniquement le nombre de faux négatifs
  3. La précision et le rappel prennent tous deux directement au dénominateur le nombre total de données
  4. La précision prend au dénominateur le nombre prédit positif, le rappel prend le nombre réellement positif
RéponseD. La précision prend au dénominateur le nombre prédit positif, le rappel prend le nombre réellement positif

La précision est « la proportion, parmi ce qui a été prédit positif, de ce qui l'était réellement », donc son dénominateur se trouve du côté de la prédiction. Le rappel est « la proportion, parmi ce qui est réellement positif, de ce qui a été correctement repéré », donc son dénominateur se trouve du côté du réel. Inverser ces deux notions est l'erreur la plus fréquente ; il est utile de s'en souvenir en se demandant si le dénominateur est du côté de la prédiction ou du réel. Prendre l'ensemble des données comme dénominateur correspond à l'exactitude, et un indicateur ne prenant que les vrais négatifs ou les faux négatifs comme dénominateur ne correspond à aucun des deux. Pour réduire les fausses détections, on privilégie la précision ; pour réduire les oublis, on privilégie le rappel.

Q23 | Calcul du score F

Si la précision est de 0,6 et le rappel de 0,9, quel est le score F ?

  1. 1,50
  2. 0,54
  3. 0,75
  4. 0,72
RéponseD. 0,72

Le score F étant la moyenne harmonique de la précision et du rappel, on multiplie 2 par le produit de 0,6 et 0,9, soit 0,54, ce qui donne 1,08, puis on divise par la somme de 0,6 et 0,9, soit 1,5, ce qui donne 0,72. 0,75 est la valeur obtenue en calculant par erreur la moyenne arithmétique au lieu de la moyenne harmonique, 0,54 est simplement le produit des deux valeurs, et 1,50 est simplement leur somme. La moyenne harmonique étant attirée vers la valeur la plus faible, il convient de vérifier qu'elle est bien inférieure à la moyenne arithmétique de 0,75.

Q24 | Données déséquilibrées

Sur un ensemble de données où les positifs ne représentent que 1 % du total, on construit un modèle qui prédit toujours négatif. Quelle description de cette situation est appropriée ?

  1. L'exactitude s'élève à 50 %, ce qui montre une performance équivalente à un tirage au hasard
  2. L'exactitude est élevée, à 99 %, mais le rappel est de 0 %, n'ayant repéré aucun cas positif
  3. L'exactitude est basse, à 1 %, et le rappel est aussi de 0 % : les deux indicateurs révèlent un problème
  4. L'exactitude est élevée, à 99 %, et le rappel l'est aussi, à 99 %, ce qui permet de dire que le modèle est utilisable en pratique
RéponseB. L'exactitude est élevée, à 99 %, mais le rappel est de 0 %, n'ayant repéré aucun cas positif

Comme les positifs ne représentent que 1 %, répondre toujours négatif suffit à obtenir 99 % de bonnes réponses, si bien que l'exactitude atteint 99 %. Cependant, comme aucun cas positif réel n'a été repéré, le rappel est de 0 %, ce qui rend ce modèle inutile. Lorsque les classes sont déséquilibrées, se fier uniquement à l'exactitude conduit à un jugement erroné ; il faut donc aussi observer le rappel, le score F, ainsi que la courbe ROC et l'AUC. Dans cette configuration, l'exactitude ne peut être ni de 1 % ni de 50 %.

Q25 | Axes de la courbe ROC

Quelle combinaison des axes vertical et horizontal de la courbe ROC est appropriée ?

  1. L'axe vertical est l'ampleur de l'erreur, l'axe horizontal le nombre de répétitions de l'apprentissage
  2. L'axe vertical est l'exactitude, l'axe horizontal le nombre de données utilisées pour l'apprentissage
  3. L'axe vertical est le taux de vrais positifs, l'axe horizontal le taux de faux positifs, et l'aire sous la courbe est l'AUC
  4. L'axe vertical est la précision, l'axe horizontal le rappel, et l'aire sous la courbe est l'AUC
RéponseC. L'axe vertical est le taux de vrais positifs, l'axe horizontal le taux de faux positifs, et l'aire sous la courbe est l'AUC

La courbe ROC est tracée en faisant varier le seuil de décision, avec le taux de vrais positifs en axe vertical et le taux de faux positifs en axe horizontal, l'aire sous cette courbe étant l'AUC. Plus l'AUC est proche de 1, meilleure est la performance, et 0,5 correspond à un niveau équivalent à une décision au hasard. Placer la précision en axe vertical et le rappel en axe horizontal donne une tout autre courbe ; c'est une confusion classique. Les combinaisons exactitude/nombre de données ou erreur/nombre d'itérations correspondent à d'autres graphiques observant le déroulement de l'apprentissage.

Q26 | AIC et BIC

Comment utilise-t-on le critère d'information d'Akaike (AIC) et le critère d'information bayésien (BIC) ?

  1. En observant l'équilibre entre l'ajustement et le nombre de paramètres, on choisit le modèle ayant la valeur la plus grande
  2. En ne regardant que le nombre de paramètres, on choisit le modèle en ayant le plus
  3. En ne regardant que l'ajustement aux données d'entraînement, on choisit le modèle dont l'erreur est la plus faible
  4. En observant l'équilibre entre l'ajustement et le nombre de paramètres, on choisit le modèle ayant la valeur la plus petite
RéponseD. En observant l'équilibre entre l'ajustement et le nombre de paramètres, on choisit le modèle ayant la valeur la plus petite

L'AIC comme le BIC sont des indicateurs additionnant la qualité de l'ajustement aux données et une pénalité pour l'augmentation du nombre de paramètres ; plus la valeur est petite, meilleur est le modèle considéré. Affirmer que plus la valeur est grande, mieux c'est, est erroné, et c'est précisément le piège le plus fréquent. Choisir uniquement en fonction de l'ajustement aux données d'entraînement conduirait à privilégier systématiquement les modèles avec de nombreux paramètres, menant au surapprentissage ; c'est pourquoi une pénalité est introduite pour rétablir l'équilibre. Cela va dans le même sens que le rasoir d'Occam, qui recommande de ne pas complexifier au-delà du nécessaire.

Q27 | Nombre de répétitions en 5 plis

Lorsqu'on soumet 200 exemples de données à une validation croisée à 5 plis, quelle combinaison correspond au nombre d'exemples de validation par tour et au nombre de répétitions d'apprentissage et d'évaluation ?

  1. 160 exemples de validation, apprentissage et évaluation répétés 5 fois
  2. 40 exemples de validation, apprentissage et évaluation répétés 5 fois
  3. 40 exemples de validation, apprentissage et évaluation effectués une seule fois
  4. 100 exemples de validation, apprentissage et évaluation répétés 2 fois
RéponseB. 40 exemples de validation, apprentissage et évaluation répétés 5 fois

La validation croisée à k plis divise les données en k parties, utilise l'une d'elles pour la validation et les autres pour l'apprentissage, répète cette procédure k fois, puis fait la moyenne des résultats. En divisant 200 exemples en 5 parties, chaque partie compte 40 exemples ; la validation utilise donc 40 exemples à chaque fois, l'apprentissage les 160 restants, le tout répété 5 fois. Diviser une seule fois et s'arrêter là est la validation par méthode de retenue (holdout), plus légère en calcul mais dont le résultat dépend fortement de la façon dont la division a été faite. Utiliser 160 exemples pour la validation confond l'apprentissage et la validation.

Q28 | Calcul du RMSE

Pour 4 prédictions, les erreurs (valeur réelle moins valeur prédite) sont successivement 2, 4, -4 et 0. Quelle est la racine carrée de l'erreur quadratique moyenne (RMSE) ?

  1. 6,0
  2. 9,0
  3. 2,5
  4. 3,0
RéponseD. 3,0

Les carrés des erreurs sont 4, 16, 16 et 0, soit une somme de 36. En divisant cette somme par le nombre d'exemples, soit 4, on obtient 9, l'erreur quadratique moyenne (MSE), dont la racine carrée, 3,0, est le RMSE. 9,0 est la valeur restée au stade du MSE, 2,5 est l'erreur absolue moyenne (MAE), moyenne des valeurs absolues des erreurs 2, 4, 4 et 0, et 6,0 est la racine carrée de la somme des carrés 36 sans avoir divisé par le nombre d'exemples. Le RMSE partage la même unité que l'erreur d'origine, ce qui le rend facile à interpréter.

Q29 | Moyenne et médiane

Pour 7 données valant 2, 4, 4, 6, 8, 10, 50, quelle combinaison correspond à la moyenne, la médiane et le mode ?

  1. Moyenne 12, médiane 4, mode 6
  2. Moyenne 12, médiane 6, mode 4
  3. Moyenne 6, médiane 12, mode 4
  4. Moyenne 6, médiane 4, mode 10
RéponseB. Moyenne 12, médiane 6, mode 4

La somme 84 divisée par le nombre d'exemples 7 donne une moyenne de 12 ; le 4e élément en les classant par ordre croissant est 6, ce qui est donc la médiane ; et 4, qui apparaît deux fois, est le mode. L'essentiel est que seule la moyenne est fortement tirée vers le haut par la valeur aberrante 50, tandis que la médiane et le mode bougent à peine ; c'est un exemple montrant qu'il ne faut pas juger en observant une seule valeur représentative. Inverser moyenne et médiane, ou confondre médiane et mode, sont des erreurs fréquentes.

Q30 | Corrélation fallacieuse

Quelle description de la corrélation fallacieuse est appropriée ?

  1. Si le coefficient de corrélation est nul, on peut affirmer avec certitude qu'il n'existe aucune relation entre les deux
  2. La règle selon laquelle il faudrait obligatoirement retirer les valeurs aberrantes lors du calcul du coefficient de corrélation
  3. Le fait qu'une corrélation apparaisse entre deux éléments sans lien de causalité, en raison d'un facteur commun
  4. Si le coefficient de corrélation est positif, cela signifie nécessairement que l'un est la cause de l'autre
RéponseC. Le fait qu'une corrélation apparaisse entre deux éléments sans lien de causalité, en raison d'un facteur commun

La corrélation fallacieuse est le phénomène par lequel, comme la température étant un facteur commun fait varier ensemble les ventes de glaces et le nombre de noyades, une corrélation apparaît entre deux éléments sans lien de causalité directe. La leçon ici est qu'une corrélation n'implique pas nécessairement une causalité ; on ne peut donc pas dire qu'un coefficient de corrélation positif signifie cause et effet. De plus, même avec un coefficient de corrélation nul, une relation non linéaire peut être cachée, donc on ne peut pas affirmer avec certitude l'absence de relation. Le traitement des valeurs aberrantes est un point distinct de celui-ci.

Entraînement : répondez aux questions de cette page

Cet outil d'entraînement pose les questions dans un ordre aléatoire (il fonctionne lorsque JavaScript est activé). Vous pouvez de toute façon lire toutes les questions et explications ci-dessus.

* Les explications sont fournies à titre d'information pour l'étude. Le programme et le système des examens changent selon les années : vérifiez toujours les annonces officielles de l'organisme qui organise l'examen.

Cette page est une traduction du texte original japonais. En cas de différence entre la traduction et l'original, la version japonaise fait foi. Voir l'original en japonais