Dernière actualisation :

Classement des modèles d’écriture fondé sur les résultats par paires
RangModèleScore juge IAScore humain
1Claude Opus 5 💡 adaptive high99.5
2Claude Fable 5.1 💡 adaptive high98.4
5Kimi K3 💡 enabled96.6
6GPT-6 Astra 💡 high95.8
7Muse Spark 1.3 💡 high92.9
8GLM 5.3 💡 max92.4
9Claude Sonnet 5 💡 adaptive high92.3
10GPT-5.6 Sol 💡 high92.1
11Gemini 3.8 Flash 💡 high89.1
13DeepSeek V4.1 Flash 💡 high86.8
14GPT-5.6 Luna 💡 high82.1
15GPT-5.6 Terra 💡 high81
18MiniMax M3 💡 enabled76.4
19Qwen3.8 Max 💡 xhigh75.9
21Qwen3.8 27B Q8_0 💡 xhigh** 🏠75.2
22DeepSeek V4 Pro 💡 enabled74.9
23Qwen3.8 Flash 💡 high73.8
24Qwen3.7 Plus 💡 enabled73.7
26Hy4 Preview 💡 high71.4
27GLM 5.3 Flash 💡 high70.9
28Seed 2.1 Turbo70
31MiMo V2.5 Pro 💡 enabled67
33Inkling 💡 high64.5
36Aion 3.0 💡 mandatory59.2
38Gemma 4 26B A4B Q8_0 🏠58.1
40Gemma 4 26B A4B Q8_0 💡 on* 🏠56.1
43Hy3 💡 high54.9
49Gemma 4 31B Q8_0 💡 on* 🏠49.7
51Gemma 4 12B Q8_0 💡 on* 🏠48.2
53MiMo V2.5 💡 enabled46.8
55Gemma 4 31B Q8_0 🏠41.9
56Gemma 4 12B Q8_0 🏠41.3
57Qwen3.6 35B A3B Q8_0 💡 on* 🏠40.9
61Grok 4.6 💡 high37.7
62Mistral Medium 3.5 💡 high37.4
66Qwen3.8 27B Q8_0 🏠28
71Gemma 4 E4B Q8_0 🏠19.9
72Qwen3.6 35B A3B Q8_0 🏠18.8
73Gemma 4 E4B Q8_0 💡 on* 🏠17.4
80Gemma 4 E2B Q8_0 🏠10.1
81Gemma 4 E2B Q8_0 💡 on* 🏠10
83Granite 4.2 30B Q8_0 💡 full 🏠7.1
88Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠3.5
90Granite 4.2 8B Q8_0 💡 full 🏠1.9

91 modèles comparés63304 verdicts IA publiés

Méthode : modèle de Bradley–Terry régularisé. Le score des juges IA détermine le rang ; le score humain est indépendant et reste secondaire tant que les votes de la communauté sont peu nombreux. Un score de 50 correspond à une chance estimée sur deux de battre le modèle moyen dans cette langue et cette catégorie.

Résultats des duels directs

Chaque cellule indique la part des points possibles obtenue par le modèle de la ligne face au modèle de la colonne : une victoire vaut 100 %, une égalité 50 %, une défaite 0 %. Cette matrice n’utilise que les protocoles d’évaluation compatibles avec le classement principal.

Matrice orientée des points obtenus en duel direct. Au-dessus de 50 %, l’avantage va au modèle de la ligne ; en dessous, au modèle de la colonne.

0 %100 %

💡 signale un modèle avec raisonnement, ↯ un modèle sans raisonnement. 🏠 signale un modèle exécuté localement sur la machine de l’auteur de ce site.« on* » indique que le raisonnement est activé ou désactivé (modèles locaux sans niveaux intermédiaires) : le réglage fin demandé n’est pas supporté par le fichier local et retombe sur le mode activé par défaut. Sur les modèles locaux à raisonnement réglable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), le niveau affiché (xhigh**, high, full) est le niveau par défaut du modèle : le réglage fin demandé n’est pas supporté par le fichier local, qui retombe sur son comportement par défaut.

Afficher sous forme de tableau
Points obtenus en duel direct par paire de modèles
Modèle

Couverture des duels publiés

Chaque cellule indique combien de duels jugés par IA et publiés, tous protocoles confondus, comparent les deux modèles pour cette langue et cette catégorie. Les modèles des deux axes sont des candidats ; la matrice n’indique pas quel juge a produit chaque verdict.

Matrice symétrique du nombre de duels publiés. La diagonale vaut zéro : un modèle n’est pas comparé à lui-même.

0

💡 signale un modèle avec raisonnement, ↯ un modèle sans raisonnement. 🏠 signale un modèle exécuté localement sur la machine de l’auteur de ce site.« on* » indique que le raisonnement est activé ou désactivé (modèles locaux sans niveaux intermédiaires) : le réglage fin demandé n’est pas supporté par le fichier local et retombe sur le mode activé par défaut. Sur les modèles locaux à raisonnement réglable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), le niveau affiché (xhigh**, high, full) est le niveau par défaut du modèle : le réglage fin demandé n’est pas supporté par le fichier local, qui retombe sur son comportement par défaut.

Afficher sous forme de tableau
Nombre de duels publiés par paire de modèles
Modèle

Lancez un duel

Quel modèle écrit le meilleur texte ? Jugez cette paire anonyme et contribuez au classement humain. Pendant le duel, le nom des modèles reste masqué. Il n’est révélé qu’après votre choix.

Le Duel

Résultats des juges IA

Consultez les classements détaillés de chaque juge IA et voyez comment leurs résultats diffèrent.

Classement humain

Résultats provisoires issus des comparaisons à l’aveugle dans cette langue.