Le Baromètre mesure la qualité d’écriture des principaux modèles d’IA à partir d’un corpus de consignes conçu directement en français. Les réponses à une même consigne sont comparées à l’aveugle, sans le nom des modèles, puis les verdicts sont agrégés dans un classement propre au français.
En tête, toutes catégories confondues
Les 10 meilleurs modèles
Les dix meilleurs modèles pour écrire en français
#
Modèle
Score
1
Claude Opus 5 💡 adaptive high
99.5
2
Claude Fable 5.1 💡 adaptive high
98.4
3
Claude Fable 5 💡 adaptive high
98.1
4
Claude Opus 4.8 💡 adaptive high
96.7
5
Kimi K3 💡 enabled
96.6
6
GPT-6 Astra 💡 high
95.8
7
Muse Spark 1.3 💡 high
92.9
8
GLM 5.3 💡 max
92.4
9
Claude Sonnet 5 💡 adaptive high
92.3
10
GPT-5.6 Sol 💡 high
92.1
Ce score n’est pas une note en pourcentage : 50 correspond à une chance estimée sur deux de battre le modèle moyen en français.
La VRAM indiquée est une estimation arrondie de la mémoire graphique nécessaire pour charger le modèle entier.
Les dix meilleures variantes exécutées localement
#
Modèle
Score
VRAM estimée
1
Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠
76.5
≈ 24 Go
2
Qwen3.8 27B Q8_0 💡 xhigh** 🏠
75.2
≈ 48 Go
3
Muse Glimmer 30B K-Quant 17GB 💡 high 🏠
73.3
≈ 24 Go
4
Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠
69
≈ 32 Go
5
Gemma 4 31B Q6_K 💡 on* 🏠
65.3
≈ 32 Go
6
Qwen3.8 27B Q6_K 💡 xhigh** 🏠
63.6
≈ 32 Go
7
Ling 3.0 Flash Q4_K_M 💡 high 🏠
62
≈ 80 Go
8
Qwen3.6 27B Q8_0 💡 on* 🏠
58.6
≈ 32 Go
9
Gemma 4 26B A4B Q8_0 ↯ 🏠
58.1
≈ 32 Go
10
Gemma 4 31B QAT-Q4_0 💡 on* 🏠
56.9
≈ 24 Go
Selon le logiciel utilisé, une partie du modèle peut être conservée dans la mémoire vive de l’ordinateur. Cette configuration réduit les besoins en VRAM, mais ralentit généralement l’exécution.
Le classement porte uniquement sur la qualité d’écriture. Les consignes sont conçues dans la langue évaluée et les noms des modèles restent masqués jusqu’au verdict, afin que leur réputation n’influence pas l’évaluation. Ce site est un projet personnel. Je ne suis payé par aucun éditeur de modèles et je n’ai aucun intérêt à en favoriser un.
Même fichier, mêmes consignes, un seul interrupteur. Sur 21 modèles locaux, le raisonnement apporte en moyenne 31,0 points à la famille Qwen et 6,7 aux grands Gemma 4 ; les petits Gemma E2B et E4B n’y gagnent rien et y perdent parfois.
Parfois rien, parfois vingt points. Sur les consignes françaises, Qwen3.8 27B écrit aussi bien en Q4_K_M qu’en Q8_0 avec un fichier deux fois plus petit ; Gemma 4 31B est meilleur en Q6_K qu’en Q8_0 ; Granite 4.2 30B s’effondre à tous les niveaux. La règle générale : il n’y a pas de règle générale.
Mise à jour avec 1 500 duels classants par fichier et par langue. Le fichier K-Quant Dynamic est le meilleur modèle local pour écrire en anglais, à 77,6 points ; en français, en allemand et en espagnol, c’est le fichier 17GB, plus petit, qu’il faut télécharger.
Deux de nos cinq juges accordent un net bonus à leur propre modèle : GPT-5.6 Sol donne à ses textes jusqu’à 21 points de plus que les autres juges, Claude Opus 5 jusqu’à 11. Les deux juges Fable font l’inverse et se notent plus sévèrement.
Claude Opus 5 et GPT-5.6 Sol, qui fournissent la plupart des verdicts, penchent du même côté pour environ neuf paires de modèles sur dix. Les désaccords sont ailleurs : Sol ne déclare presque jamais d’égalité, Claude Fable 5.1 le fait jusqu’à une fois sur six, et Claude Opus 4.8 ne rejoint les autres que deux fois sur trois.
Quatre-vingt-onze modèles sont classés dans les quatre langues. Le trio de tête bouge à peine : Claude Opus 5, Claude Fable 5 et Claude Fable 5.1 sont partout dans les quatre premiers. En dessous, GLM 5.3 Flash est 10e en anglais et 53e en allemand, Grok 4.6 25e en anglais et 61e en français.