Le seul examinateur TCF Canada qui publie sa marge d'erreur
Voici les chiffres sur lesquels repose cette promesse : à quelle fréquence la note de l'examinateur IA tombe au bon niveau, mesurée sur des productions de niveau connu, avec la méthode et les limites. Les chiffres viennent avant les arguments.
Dernière mise à jour : · Journal des modifications
Petits échantillons (24 écrits, 36 oraux) et niveaux de référence connus, pas des résultats officiels du TCF. Lisez les intervalles, pas seulement les pourcentages.
Nos chiffres
Expression écrite N = 24 échantillons
Expression orale N = 36 échantillons
Les chiffres des cartes sont hors échantillon : chaque échantillon est noté avec une courbe ajustée sans lui. Avant et après la courbe :
| Expression écrite | Sans courbe | Courbe, hors échantillon | Courbe, mêmes données |
|---|---|---|---|
| Niveau exact | 42 % | 54 % | 50 % |
| À un niveau près | 88 % | 100 % | 100 % |
| Kappa pondéré | 0,76 | 0,90 | 0,88 |
| Corrélation de rang | 0,95 | 0,94 | 0,95 |
| Faux « prêt » | 0/14 | 0/14 | 0/14 |
| Expression orale | Sans courbe | Courbe, hors échantillon | Courbe, mêmes données |
|---|---|---|---|
| Niveau exact | 31 % | 44 % | 44 % |
| À un niveau près | 81 % | 94 % | 94 % |
| Kappa pondéré | 0,63 | 0,80 | 0,80 |
| Corrélation de rang | 0,92 | 0,89 | 0,92 |
| Faux « prêt » | 0/16 | 0/16 | 0/16 |
Comment lire ces chiffres
Pour situer l'ordre de grandeur : dans une étude publiée sur la notation de l'expression orale au CECRL, deux évaluateurs formés étaient d'accord exactement dans environ 39 à 44 % des cas, et à moins d'une sous-bande près dans environ 88 à 93 % des cas (Huang, 2018, Language Testing in Asia). Chiffres d'après l'extrait publié, à confirmer : le texte intégral est payant et nous ne l'avons pas lu.
Ce n'est ni un seuil à atteindre ni une comparaison directe, pour trois raisons :
- les échelles diffèrent : cette étude compte des sous-bandes, plus fines que nos six niveaux du CECRL. « À un niveau près » chez nous est une tolérance plus large que « à une sous-bande près », et l'accord exact est plus facile à obtenir sur une grille plus grossière ;
- les populations diffèrent : notre échantillon couvre tous les niveaux, de A1 à C2, ce qui facilite l'accord et la corrélation ;
- la cible diffère : à terme, nous voulons coller aux résultats officiels du TCF Canada, une référence plus dure que la note d'un second évaluateur sur le même enregistrement. Pour l'instant, nous ne la mesurons pas encore (voir plus bas).
Autre repère du secteur : pour le TOEFL Junior, ETS publie une corrélation de 0,81 entre la machine et les évaluateurs humains, contre 0,89 entre deux humains, à l'oral ; 0,83 contre 0,90 à l'écrit (ETS, rapport RR-15). Nous publions de la même façon deux mesures, le kappa pondéré et la corrélation de rang, mais sur un autre test et d'autres données : ne comparez pas les nombres un à un.
Nous ne disons pas que l'examinateur est aussi bon qu'un évaluateur humain, ni meilleur. Nous publions où il se trompe pour que vous jugiez par vous-même.
Méthode
- Échantillons de niveau connu, pas des résultats officiels. 24 textes (19 productions écrites et 5 productions orales fournies en transcription) et 36 extraits oraux : productions publiques dont la source indique le niveau CECRL (échantillons calibrés du CIEP et de France Éducation international, enregistrements d'experts, examens blancs corrigés par des tuteurs). Aucun n'est un résultat officiel du TCF Canada : il n'en existe pas de publiés. Quelques niveaux viennent de sites de préparation (labels plus faibles).
- Les niveaux. Les notes sur 20 sont lues sur la grille de France Éducation international (A1 1, A2 2–5, B1 6–9, B2 10–13, C1 14–17, C2 18–20), puis en NCLC (le NCLC 7 commence à 10 sur 20). « Exact » : le niveau de l'examinateur est le niveau connu (un intervalle connu comme C1/C2 compte comme exact à l'intérieur). « À un niveau près » : au plus un niveau CECRL d'écart, par exemple B1 au lieu de B2. Un niveau d'écart peut franchir la barre du NCLC 7 ; c'est pourquoi le faux « prêt » est mesuré à part.
- Ce que fait la courbe. Le modèle classe bien les candidats mais comprime les notes au-dessus de B1 : un B2 reçoit souvent 6 à 10 sur 20. La courbe est une table qui remonte ces notes (une note brute de 8 devient 10, 9 devient 11, 10 devient 12). Elle est ajustée par régression isotone sur les 60 échantillons, limitée à 40 % de la correction complète pour ne pas fabriquer de faux « prêt », et ne touche pas aux notes de 0 à 5.
- Validation croisée. Les chiffres des cartes plus haut sont « hors échantillon » : chaque échantillon est noté avec une courbe ajustée sur les 59 autres. Le tableau ci-dessus donne aussi les notes sans courbe et la courbe sur ses propres données (optimiste), pour que vous voyiez l'écart.
- Le kappa pondéré mesure l'accord en pénalisant plus les gros écarts (1 = accord parfait, 0 = hasard). La corrélation de rang (Spearman) dit si l'examinateur range les candidats dans le bon ordre.
Dans quel sens l'examinateur se trompe
Répartition des erreurs selon le niveau connu (grandeur lue au milieu de la bande du niveau connu), après la courbe et hors échantillon :
| Expression écrite | N | Sous-estimé | Bon niveau | Surestimé |
|---|---|---|---|---|
| NCLC 6 et moins | 14 | 1 | 10 | 3 |
| NCLC 7–8 | 4 | 2 | 2 | 0 |
| NCLC 9 et plus | 6 | 5 | 1 | 0 |
| Expression orale | N | Sous-estimé | Bon niveau | Surestimé |
|---|---|---|---|---|
| NCLC 6 et moins | 16 | 5 | 10 | 1 |
| NCLC 7–8 | 6 | 3 | 3 | 0 |
| NCLC 9 et plus | 14 | 11 | 3 | 0 |
Aux niveaux élevés, l'erreur va presque toujours vers le bas : l'examinateur sous-estime plutôt qu'il ne surestime. Le risque pour vous est donc plutôt de vous croire en dessous de la barre alors que vous l'avez atteinte. Les échantillons de niveau C sont peu nombreux et en partie étiquetés par des sites de préparation : prenez cette tendance comme un signal, pas comme une mesure précise.
Même réponse, notée trois fois
Un examinateur qui change d'avis d'un essai à l'autre ne vaut rien, qu'il ait raison en moyenne ou non. Nous avons donc envoyé trois fois, sans rien changer, les mêmes 6 réponses écrites au vrai modèle, puis comparé les notes brutes sur 20 (avant la courbe).
Sur la note affichée (après la courbe) : 83 % à un point près, écart maximal 2 points. La courbe remonte les notes par paliers à partir de 6/20 (une note brute de 6 s'affiche 7 depuis le 2026-10-11, contre 8 avant, ce qui a ramené l'écart maximal affiché de 3 à 2 points) : un point d’écart avant elle peut encore en faire deux après.
Aux niveaux élevés, l'erreur va presque toujours vers le bas : l'examinateur sous-estime plutôt qu'il ne surestime. Voir « Dans quel sens l'examinateur se trompe » plus haut.
6 réponses seulement, de niveaux connus et publiques : lisez ce chiffre comme un ordre de grandeur. Modèle claude-opus-5-5.
Le faux « prêt » : se croire au NCLC 7 sans l'être
C'est l'erreur qui coûte le plus cher : réserver un examen payant en se croyant prêt. Sur les productions dont le niveau connu est sous B2 (sous le NCLC 7), l'examinateur en a classé 0 sur 14 à l'écrit et 0 sur 16 à l'oral au niveau B2 ou plus.
Avec si peu de cas, zéro n'exclut pas un taux réel allant jusqu'à 22 % (intervalle à 95 %). Seuls 5 cas écrits et 9 cas oraux sont au niveau B1, juste sous la barre ; les autres sont plus faciles à distinguer. L'erreur inverse existe aussi : 2 productions sur 10 (écrit) et 4 sur 20 (oral), de niveau B2 ou plus, ont reçu un niveau inférieur.
Les notes proches du NCLC 6/7
Quand une estimation tombe à un point d'une limite de niveau, nous n'affichons pas un chiffre unique mais une fourchette, par exemple « 9–10/20, limite NCLC 6/7 », car le résultat officiel peut tomber de l'un ou l'autre côté. La barre du NCLC 7 est à 10 sur 20 ; une note affichée de 10 ne promet donc pas le NCLC 7.
Résultats officiels reçus
Résultats officiels reçus : 0 — dont 0 avec une estimation préalable
0 à l'écrit, 0 à l'oral. Saisis par des candidats qui ont passé le vrai test, jamais affichés individuellement.
Ces résultats remplaceront les échantillons publics comme référence au fur et à mesure qu'ils arrivent. Les chiffres de cette page ne les utilisent pas encore. Ils arrivent de 15 jours ouvrables à 5 semaines environ après l'examen : le compteur progresse lentement.
Notre engagement : cette page est mise à jour à chaque changement de modèle ou de courbe. Chiffres actuels calculés le 10 octobre 2026.
Compréhension orale et écrite : indicatif
Pour l'écoute et la lecture, aucune IA ne note : l'estimation des séries de dix questions est une règle fixe. Le niveau estimé est le plus haut niveau L tel qu'au moins les deux tiers des questions jusqu'au niveau L, et au moins la moitié de celles du niveau L, soient justes. Ce niveau est converti en fourchette NCLC avec la table d'IRCC.
Cette règle n'a pas encore été calibrée sur des résultats officiels : nous ne publions donc aucun taux d'exactitude pour ces deux compétences, et leur estimation reste indicative, tirée de dix questions seulement.
Journal des modifications
- 2026-10-11 · Courbe adoucie
La note brute 6 s'affiche maintenant 7 (8 avant) : cela supprime un écart de 3 points vu dans l'étude test-retest (même réponse affichée 8, 5, 5). Précision par niveau inchangée : 7 et 8 sont dans la même bande NCLC 6 et CECRL B1. - 2026-10-10 · Courbe 2026-10-10-iso-s0.4
Courbe isotone réduite à 40 % activée. Écrit : exact 42 % → 54 %, à un niveau près 88 % → 100 %. Oral : exact 31 % → 44 %, à un niveau près 81 % → 94 %. Aucun faux « prêt » dans les validations croisées. - 2026-10-10 · Avant la courbe
Notes brutes du modèle claude-opus-5-5. Écrit : exact 42 %, à un niveau près 88 %, kappa 0,76. Oral : exact 31 %, à un niveau près 81 %, kappa 0,63. Le modèle compressait les notes au-dessus de B1.
Ce que ces chiffres ne disent pas
- Petits échantillons : 24 à l'écrit, 36 à l'oral. Les intervalles à 95 % sont larges ; un seul échantillon de plus peut déplacer le chiffre de plusieurs points.
- Niveaux connus venant des sources des échantillons, pas de résultats officiels. Une part des niveaux vient de sites de préparation ou de tuteurs.
- La courbe a été conçue sur ces mêmes 60 échantillons. La validation croisée les retire un à un, mais le réglage de la courbe a été choisi en regardant ces contrôles : un peu d'optimisme subsiste.
- À l'oral, l'examinateur lit une transcription automatique : la prononciation n'est pas notée, et une note orale peut surestimer votre résultat officiel.
- Peu d'exemples aux niveaux C1 et C2 : la direction de l'erreur à NCLC 9 et plus repose sur très peu de cas.
- Ces chiffres valent pour le modèle claude-opus-5-5 et la courbe 2026-10-11-iso-s0.4-smooth, pas pour un modèle ultérieur : c'est pourquoi la page est mise à jour à chaque changement.
Question
Les tâches sur lesquelles je suis noté sont-elles originales ?
Oui. Chaque tâche est écrite pour ce produit et nous ne reproduisons pas de questions d'examen : votre note est celle que vous auriez sur des sujets inédits. À propos de l'IA
Essayez vous-même
Votre première tâche d'oral et votre première tâche d'écrit sont gratuites, avec la correction complète. Sans carte bancaire.
Les notes sont une estimation faite par une IA, pas un résultat officiel.
NCLC 7 est un outil d'entraînement indépendant. Il n'est ni affilié à France Éducation international ni au gouvernement du Canada, et aucun des deux ne l'approuve. « TCF » et « TCF Canada » appartiennent à leurs propriétaires et ne servent ici qu'à indiquer le test préparé.
À propos de l'IA · Évaluation des épreuves du TCF (France Éducation international)