Les juges IA sont-ils d’accord entre eux ?
Claude Opus 5 et GPT-5.6 Sol, qui fournissent la plupart des verdicts, penchent du même côté pour environ neuf paires de modèles sur dix. Les désaccords sont ailleurs : Sol ne déclare presque jamais d’égalité, Claude Fable 5.1 le fait jusqu’à une fois sur six, et Claude Opus 4.8 ne rejoint les autres que deux fois sur trois.
Le classement réunit les verdicts de cinq juges IA. Cela n’a de sens que s’ils sont le plus souvent d’accord. Le sont-ils ?
Nous l’avons mesuré comme le ferait un lecteur : pour chaque paire de modèles que deux juges ont vue au moins quatre fois chacun, les deux juges donnent-ils la majorité des points au même modèle ? Les paires à égalité parfaite sous l’un des juges sont écartées. Données au 19 septembre 2026.
Les deux grands juges s’accordent neuf fois sur dix
Claude Opus 5 et GPT-5.6 Sol ont jugé environ 2 750 paires de modèles en commun par langue. Ils désignent le même modèle dans 88,5 % des cas en anglais, 91,6 % en français, 91,6 % en allemand et 91,1 % en espagnol.
Deux juges conçus par des entreprises différentes, sur des données différentes, qui aboutissent au même verdict sur neuf paires sur dix : c’est la meilleure preuve dont dispose le Baromètre que son classement mesure quelque chose de réel dans l’écriture, et non le goût d’un seul modèle. La dixième paire est celle où vivent les questions intéressantes, et nous publierons ces désaccords sous forme de liste.
Les juges plus petits
| Paire de juges | Anglais | Français | Allemand | Espagnol |
|---|---|---|---|---|
| Claude Fable 5.1 × Claude Opus 5 | 91,3 % (69) | 95,8 % (71) | 92,4 % (79) | 88,6 % (70) |
| Claude Fable 5.1 × GPT-5.6 Sol | 76,1 % (71) | 82,2 % (73) | 85,4 % (82) | 76,4 % (72) |
| Claude Fable 5 × Claude Opus 5 | 75,5 % (49) | 91,8 % (49) | 91,5 % (47) | 95,0 % (40) |
| Claude Fable 5 × GPT-5.6 Sol | 86,0 % (50) | 90,2 % (51) | 91,3 % (46) | 94,9 % (39) |
| Claude Opus 4.8 × Claude Opus 5 | 72,4 % (87) | 66,7 % (24) | 72,1 % (68) | 81,1 % (95) |
| Claude Opus 4.8 × GPT-5.6 Sol | 66,3 % (83) | 71,4 % (21) | 71,0 % (69) | 75,0 % (96) |
| Muse Spark 1.3 × Claude Opus 5 | 93,5 % (108) | 100 % (33) | 90,8 % (65) | — |
| Muse Spark 1.3 × GPT-5.6 Sol | 75,7 % (136) | 92,1 % (38) | 94,9 % (79) | — |
Le nombre entre parenthèses est celui des paires communes ; en dessous de cent, lisez les pourcentages comme des indications. Deux choses ressortent. Claude Opus 4.8, la génération précédente d’Opus, ne s’accorde avec les juges actuels que deux fois sur trois : ses verdicts ressemblent à un goût d’avant, et c’est pourquoi il est aujourd’hui un juge retiré, avec une petite part du total. Et Claude Fable 5.1 s’accorde davantage avec Claude Opus 5 qu’avec GPT-5.6 Sol, un air de famille qu’un bon benchmark doit garder à l’œil.
Tous les juges n’entendent pas « meilleur » de la même façon
Les juges diffèrent aussi par la fréquence à laquelle ils refusent de choisir :
| Juge | Verdicts par langue | Taux d’égalité (EN / FR / DE / ES) |
|---|---|---|
| GPT-5.6 Sol | ≈ 25 000 | 0,5 % / 0,1 % / 0,1 % / 0,2 % |
| Claude Opus 5 | ≈ 28 000 | 5,4 % / 2,4 % / 3,3 % / 3,3 % |
| Claude Opus 4.8 | 400 – 1 100 | 3,7 % / 0,5 % / 1,5 % / 5,4 % |
| Muse Spark 1.3 | ≈ 6 000 | 9,7 % / 6,9 % / 9,6 % / 9,7 % |
| Claude Fable 5 | ≈ 1 000 | 10,2 % / 5,4 % / 4,0 % / 7,7 % |
| Claude Fable 5.1 | ≈ 1 800 | 15,6 % / 6,6 % / 12,0 % / 9,5 % |
GPT-5.6 Sol désigne presque toujours un vainqueur. Claude Fable 5.1 déclare une égalité pour un duel anglais sur six. Aucun des deux n’a tort : l’égalité est une réponse légitime quand deux textes se valent, et les duels anglais entre modèles de tête se valent souvent. Mais cela signifie qu’une « victoire » sous Sol est une affirmation plus faible qu’une « victoire » sous Fable 5.1. C’est l’une des raisons pour lesquelles le classement principal repose sur un ajustement de Bradley–Terry sur les verdicts, où l’égalité vaut une demi-victoire pour chaque camp, plutôt que sur une moyenne des notes sur 100 des juges.
Ce que nous en ferons
Publier la liste des paires sur lesquelles Opus 5 et Sol se contredisent, avec les textes, pour que les lecteurs soient le troisième juge. Laisser Claude Opus 4.8 hors des nouveaux verdicts. Et pondérer les futurs juges selon leur accord avec le reste du jury avant que leurs verdicts ne modifient le classement, pas après.