Un modèle, quatre langues, quatre rangs différents
Quatre-vingt-onze modèles sont classés dans les quatre langues. Le trio de tête bouge à peine : Claude Opus 5, Claude Fable 5 et Claude Fable 5.1 sont partout dans les quatre premiers. En dessous, GLM 5.3 Flash est 10e en anglais et 53e en allemand, Grok 4.6 25e en anglais et 61e en français.
Les quatre éditions du Baromètre partagent les mêmes modèles, les mêmes juges et le même protocole. Seules les consignes changent : 240 par langue, rédigées nativement. Quand un modèle est 10e en anglais et 53e en allemand, la différence ne vient donc pas de la méthode. Elle vient du modèle.
Quatre-vingt-onze variantes ont un score publié dans les quatre langues (données au 19 septembre 2026). Voici jusqu’où elles voyagent.
La tête ne bouge pas
| Modèle | Anglais | Français | Allemand | Espagnol |
|---|---|---|---|---|
| Claude Fable 5 | 3 | 3 | 3 | 3 |
| Claude Opus 5 | 2 | 1 | 1 | 2 |
| Claude Fable 5.1 | 4 | 2 | 2 | 1 |
| GPT-6 Astra | 5 | 6 | 4 | 7 |
| Kimi K3 | 1 | 5 | 5 | 4 |
| Claude Opus 4.8 | 7 | 4 | 8 | 5 |
Six modèles ne quittent jamais les huit premiers. Kimi K3 est le seul modèle à poids ouverts parmi eux : premier en anglais, quatrième ou cinquième ailleurs. Les scores racontent la même histoire avec plus de nuance : Claude Opus 5 obtient 93,7 en anglais et 99,5 en français, ce qui signifie que le peloton français est plus facile à dominer pour lui, pas qu’il écrit mieux le français que l’anglais. Les scores ne se comparent qu’au sein d’une même langue.
C’est au milieu que les langues se contredisent
| Modèle | Anglais | Français | Allemand | Espagnol | Écart |
|---|---|---|---|---|---|
| GLM 5.3 Flash | 10 | 27 | 53 | 44 | 43 |
| Qwen3.8 27B Q4_K_M 🏠 | 27 | 17 | 58 | 54 | 41 |
| Ling 3.0 Flash Q4_K_M 🏠 | 66 | 35 | 76 | 66 | 41 |
| Grok 4.6 | 25 | 61 | 53 | 21 | 40 |
| Hy3 | 14 | 43 | 24 | 49 | 35 |
| Seed 2.1 Turbo ↯ | 57 | 28 | 61 | 43 | 33 |
| Laguna S 2.1 UD Q4_K_M 🏠 | 58 | 87 | 91 | 87 | 33 |
GLM 5.3 Flash est un modèle du top dix en anglais et de la seconde moitié en allemand. Grok 4.6 est fort en anglais et en espagnol, faible en français et en allemand. Hy3 est bon en anglais, médiocre partout ailleurs. Ce ne sont pas des accidents d’échantillonnage : chaque modèle compte entre 1 000 et 1 800 duels classants par langue, et les intervalles de confiance font quelques points de large.
Les modèles locaux suivent le même schéma, avec une subtilité. Qwen3.8 27B en Q4_K_M est le meilleur modèle local en français (17e du classement général) et l’un des plus faibles en allemand (58e). Le même fichier, sur la même machine, avec le même réglage de raisonnement. Ce que Qwen a appris du français, il ne l’a pas appris de l’allemand.
Les langues ne sont pas également difficiles
L’écart entre le meilleur modèle cloud et le meilleur modèle local est le plus large en allemand et en espagnol :
| Édition | Meilleur modèle | Meilleur modèle local | Rang du local |
|---|---|---|---|
| Anglais | Kimi K3, 93,8 | Muse Glimmer 30B K-Quant Dynamic, 77,6 | 18 |
| Français | Claude Opus 5, 99,5 | Qwen3.8 27B Q4_K_M, 76,5 | 17 |
| Allemand | Claude Opus 5, 98,2 | Gemma 4 31B Q8_0, 71,8 | 26 |
| Espagnol | Claude Fable 5.1, 98,5 | Qwen3.8 27B Q8_0, 70,7 | 23 |
Et le meilleur modèle local est un modèle différent dans chaque langue. Muse Glimmer gagne l’anglais, Qwen3.8 le français et l’espagnol, Gemma 4 31B l’allemand. Personne qui ne lit qu’un seul classement ne le devinerait.
Ce qu’il faut en retenir
Lire un classement anglophone pour choisir un modèle qui écrira en français est une erreur pour environ un tiers des modèles. Les modèles fermés de tête sont sûrs dans toutes les langues que nous testons. En dessous, consultez l’édition de votre langue, et si vous faites tourner des modèles chez vous, vérifiez la quantification précise : le fichier qui gagne dans une langue peut perdre dans la suivante.