Résultats des juges IA
Consultez les classements détaillés de chaque juge IA et voyez comment leurs résultats diffèrent.
Les modèles sont classés selon la qualité des textes produits en français. Utilisez les filtres pour affiner la liste. Pour les catégories d’écriture sélectionnées, les rangs sont calculés avant les filtres d’éditeur, de taille, d’accès, de raisonnement et de quantification ; les modèles masqués peuvent donc laisser des écarts.
Dernière actualisation :
| Rang | Modèle | Score juge IA | Score humain |
|---|---|---|---|
| 1 | 99.5 | — | |
| 2 | 98.4 | — | |
| 5 | 96.6 | — | |
| 6 | 95.8 | — | |
| 7 | 92.9 | — | |
| 8 | 92.4 | — | |
| 9 | 92.3 | — | |
| 10 | 92.1 | — | |
| 11 | 89.1 | — | |
| 13 | 86.8 | — | |
| 14 | 82.1 | — | |
| 15 | 81 | — | |
| 18 | 76.4 | — | |
| 19 | 75.9 | — | |
| 21 | 75.2 | — | |
| 22 | 74.9 | — | |
| 23 | 73.8 | — | |
| 24 | 73.7 | — | |
| 26 | 71.4 | — | |
| 27 | 70.9 | — | |
| 28 | 70 | — | |
| 31 | 67 | — | |
| 33 | 64.5 | — | |
| 36 | 59.2 | — | |
| 38 | 58.1 | — | |
| 40 | 56.1 | — | |
| 43 | 54.9 | — | |
| 49 | 49.7 | — | |
| 51 | 48.2 | — | |
| 53 | 46.8 | — | |
| 55 | 41.9 | — | |
| 56 | 41.3 | — | |
| 57 | 40.9 | — | |
| 61 | 37.7 | — | |
| 62 | 37.4 | — | |
| 66 | 28 | — | |
| 71 | 19.9 | — | |
| 72 | 18.8 | — | |
| 73 | 17.4 | — | |
| 80 | 10.1 | — | |
| 81 | 10 | — | |
| 83 | 7.1 | — | |
| 88 | 3.5 | — | |
| 90 | 1.9 | — |
Un modèle apparaît après sa première évaluation individuelle publiée ; son score de classement apparaît après son premier duel admissible.
91 modèles comparés63304 verdicts IA publiés
Méthode : modèle de Bradley–Terry régularisé. Le score des juges IA détermine le rang ; le score humain est indépendant et reste secondaire tant que les votes de la communauté sont peu nombreux. Un score de 50 correspond à une chance estimée sur deux de battre le modèle moyen dans cette langue et cette catégorie.
Chaque cellule indique la part des points possibles obtenue par le modèle de la ligne face au modèle de la colonne : une victoire vaut 100 %, une égalité 50 %, une défaite 0 %. Cette matrice n’utilise que les protocoles d’évaluation compatibles avec le classement principal.
Matrice orientée des points obtenus en duel direct. Au-dessus de 50 %, l’avantage va au modèle de la ligne ; en dessous, au modèle de la colonne.
0 %100 %
💡 signale un modèle avec raisonnement, ↯ un modèle sans raisonnement. 🏠 signale un modèle exécuté localement sur la machine de l’auteur de ce site.« on* » indique que le raisonnement est activé ou désactivé (modèles locaux sans niveaux intermédiaires) : le réglage fin demandé n’est pas supporté par le fichier local et retombe sur le mode activé par défaut. Sur les modèles locaux à raisonnement réglable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), le niveau affiché (xhigh**, high, full) est le niveau par défaut du modèle : le réglage fin demandé n’est pas supporté par le fichier local, qui retombe sur son comportement par défaut.
| Modèle |
|---|
Chaque cellule indique combien de duels jugés par IA et publiés, tous protocoles confondus, comparent les deux modèles pour cette langue et cette catégorie. Les modèles des deux axes sont des candidats ; la matrice n’indique pas quel juge a produit chaque verdict.
Matrice symétrique du nombre de duels publiés. La diagonale vaut zéro : un modèle n’est pas comparé à lui-même.
0
💡 signale un modèle avec raisonnement, ↯ un modèle sans raisonnement. 🏠 signale un modèle exécuté localement sur la machine de l’auteur de ce site.« on* » indique que le raisonnement est activé ou désactivé (modèles locaux sans niveaux intermédiaires) : le réglage fin demandé n’est pas supporté par le fichier local et retombe sur le mode activé par défaut. Sur les modèles locaux à raisonnement réglable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), le niveau affiché (xhigh**, high, full) est le niveau par défaut du modèle : le réglage fin demandé n’est pas supporté par le fichier local, qui retombe sur son comportement par défaut.
| Modèle |
|---|
Quel modèle écrit le meilleur texte ? Jugez cette paire anonyme et contribuez au classement humain. Pendant le duel, le nom des modèles reste masqué. Il n’est révélé qu’après votre choix.
Consultez les classements détaillés de chaque juge IA et voyez comment leurs résultats diffèrent.
Résultats provisoires issus des comparaisons à l’aveugle dans cette langue.