Mis à l'épreuve sur des textes dont on connaît l'origine
Pour savoir si un détecteur est fiable, il faut le confronter à des textes dont l'origine est certaine. Voici les résultats de ScribeTrace sur notre corpus de contrôle, publiés tels quels.
Avant sa mise en service, ScribeTrace a été éprouvé sur un corpus de contrôle constitué à cet effet. Une vingtaine d'œuvres humaines de formes très diverses, du roman à la poésie, du théâtre au journal intime, ont toutes obtenu un indice de 0 sur 100, sans aucune zone signalée. Des textes entièrement générés par trois intelligences artificielles différentes ont obtenu 89 et 90 sur 100. Et dans un texte de Maupassant où l'on avait inséré 10 % de passages générés par une autre IA, les cinq passages ont été localisés.
Les résultats en un coup d'œil
Chaque point est un texte analysé, placé selon son indice IA. Sa couleur indique son origine réelle, connue à l'avance.
Le détail de chaque essai
Comment nous testons
Le corpus réunit trois familles de textes. Des œuvres du domaine public, écrites bien avant l'apparition de l'IA générative : leur origine humaine ne fait aucun doute. Des textes générés intégralement par IA pour l'occasion, fictions et essais. Et des textes hybrides, composés en insérant des passages IA dans une écriture humaine, dans une proportion connue.
Chaque texte est analysé exactement comme un manuscrit client, avec la même version du moteur, sans réglage particulier.
Comment lire ces résultats
L'indice ScribeTrace mesure l'intensité des signaux compatibles avec une rédaction assistée par IA. Ce n'est pas un pourcentage de texte généré : un texte hybride contenant 10 % de passages IA n'obtient pas 10/100 : il obtient ici 26, parce que l'indice tient compte à la fois de l'étendue et de l'intensité des signaux.
Ce qui compte, c'est l'ordre : les textes humains doivent rester bas, les textes générés doivent monter, et les hybrides doivent se situer entre les deux, avec leurs passages IA repérés dans le rapport.
Ce que ces essais ne prouvent pas
Aucun détecteur n'est infaillible, et quelques essais ne font pas une statistique. Les grands classiques posent aussi une limite connue : les modèles d'IA les ont souvent déjà lus, ce qui peut les aider à les reconnaître. C'est pourquoi le corpus comprend aussi des textes générés par plusieurs modèles d'IA différents, dont un modèle extérieur à ceux qu'utilise ScribeTrace, et s'élargira à des textes humains inédits, confiés par leurs auteurs avec leur accord.
Le corpus s'enrichit à chaque nouvelle version du moteur. Les résultats ci-dessus ont été obtenus avec la version ST-0.13.1 du moteur.