Chaque juge IA du Baromètre reçoit deux textes anonymes et choisit le meilleur. Anonymes pour le juge, s’entend. Nous, nous savons qui a écrit quoi, et nous pouvons donc poser une question que le juge ne peut pas se poser : quand l’un des deux textes vient de son propre modèle, le verdict change-t-il ?

Oui, pour certains juges. Le tableau ci-dessous compare, pour chaque juge, la part des points que son propre modèle obtient quand ce juge tranche, avec la part que le même modèle obtient sous tous les autres juges. Une victoire vaut un point, une égalité un demi-point. Données : tous les duels publiés au 19 septembre 2026, environ 63 000 verdicts par langue.

Sol et Opus 5 se favorisent, Fable non

Juge (son modèle) Anglais Français Allemand Espagnol
GPT-5.6 Sol 87,9 % contre 69,0 % 90,1 % contre 74,6 % 93,4 % contre 78,3 % 92,8 % contre 72,1 %
Claude Opus 5 94,0 % contre 82,6 % 99,6 % contre 96,4 % 98,0 % contre 90,5 % 96,9 % contre 92,0 %
Muse Spark 1.3 82,6 % contre 73,5 % 88,2 % contre 84,4 % 84,1 % contre 79,0 % 79,3 % contre 80,4 %
Claude Fable 5 88,1 % contre 89,8 % 90,7 % contre 96,0 % 91,3 % contre 92,8 % 91,0 % contre 93,8 %
Claude Fable 5.1 84,4 % contre 87,8 % 90,2 % contre 95,6 % 90,7 % contre 93,0 % 90,6 % contre 96,5 %

Lisez chaque case comme « sous son propre juge contre sous les autres juges ». GPT-5.6 Sol est le cas le plus net : ses textes récoltent entre 15 et 21 points de plus quand Sol est le juge, dans chaque langue, sur environ 1 000 duels auto-jugés par langue. Claude Opus 5 va dans le même sens avec un écart plus faible, de 3 à 11 points. Muse Spark 1.3 penche du même côté dans trois langues sur quatre, sur un petit échantillon de 135 à 172 duels.

Claude Fable 5 et Claude Fable 5.1 font l’inverse. Sous leurs propres verdicts, leurs textes obtiennent 2 à 6 points de moins que sous les autres juges, dans les quatre langues. Quelle qu’en soit la raison, ils ne se flattent pas.

Ce que cela fait aux classements

Chaque juge publie aussi son propre tableau, classé par victoires. Dans ce tableau, GPT-5.6 Sol place son modèle deuxième dans les quatre langues. Dans le classement principal, qui réunit tous les juges, le même modèle est neuvième en anglais, dixième en français, sixième en allemand et neuvième en espagnol. Claude Opus 5 est premier ou deuxième partout, dans son propre tableau comme dans le classement principal : son bonus change peu la tête du classement, mais gonfle quand même son score.

C’est dans le classement commun que le bonus compte. Claude Opus 5 et GPT-5.6 Sol fournissent ensemble environ 85 % des verdicts ; leurs duels auto-jugés ne sont donc pas une note de bas de page : environ 800 duels Opus-sur-Opus et 1 000 duels Sol-sur-Sol par langue entrent dans l’ajustement Bradley–Terry avec tous les autres.

Pourquoi nous ne parlons pas encore de biais

Deux réserves empêchent d’en faire un verdict. D’abord, les duels ne sont pas les mêmes. Le modèle d’un juge rencontre sous ce juge un mélange d’adversaires différent de celui qu’il rencontre sous les autres, et ce mélange change la part attendue. Les écarts de Sol sont trop grands pour que l’adversité explique tout, mais elle peut en expliquer une partie. Ensuite, « les autres juges » n’est pas un instrument neutre : c’est surtout Opus 5 quand on regarde Sol, et surtout Sol quand on regarde Opus 5. Si l’un est sévère avec l’autre, cette sévérité apparaît sur la même ligne.

Le test propre est un échantillon contrôlé : les mêmes paires jugées par chaque juge. Nous avons commencé à le constituer.

Ce qui change sur le site

Trois choses. Le tableau de chaque juge permet déjà de lire ses verdicts séparément, et vous savez maintenant lesquels lire avec un sourcil levé. Nous publierons une variante du classement principal qui exclut tout duel où le juge et l’un des candidats ont le même éditeur, pour la comparer à l’actuelle. Et quand un nouveau juge sera ajouté, son auto-préférence sera mesurée avant que ses verdicts ne rejoignent les autres.