Les modèles qui écrivent le mieux en français

Le Baromètre mesure la qualité d’écriture des principaux modèles d’IA à partir d’un corpus de consignes conçu directement en français. Les réponses à une même consigne sont comparées à l’aveugle, sans le nom des modèles, puis les verdicts sont agrégés dans un classement propre au français.

En tête, toutes catégories confondues

Les 10 meilleurs modèles

Les dix meilleurs modèles pour écrire en français
#ModèleScore
1Claude Opus 5 💡 adaptive high99.5
2Claude Fable 5.1 💡 adaptive high98.4
3Claude Fable 5 💡 adaptive high98.1
4Claude Opus 4.8 💡 adaptive high96.7
5Kimi K3 💡 enabled96.6
6GPT-6 Astra 💡 high95.8
7Muse Spark 1.3 💡 high92.9
8GLM 5.3 💡 max92.4
9Claude Sonnet 5 💡 adaptive high92.3
10GPT-5.6 Sol 💡 high92.1

Ce score n’est pas une note en pourcentage : 50 correspond à une chance estimée sur deux de battre le modèle moyen en français.

Dernière actualisation : Voir le classement complet

Les 10 meilleures variantes locales

La VRAM indiquée est une estimation arrondie de la mémoire graphique nécessaire pour charger le modèle entier.

Les dix meilleures variantes exécutées localement
#ModèleScoreVRAM estimée
1Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠76.5≈ 24 Go
2Qwen3.8 27B Q8_0 💡 xhigh** 🏠75.2≈ 48 Go
3Muse Glimmer 30B K-Quant 17GB 💡 high 🏠73.3≈ 24 Go
4Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠69≈ 32 Go
5Gemma 4 31B Q6_K 💡 on* 🏠65.3≈ 32 Go
6Qwen3.8 27B Q6_K 💡 xhigh** 🏠63.6≈ 32 Go
7Ling 3.0 Flash Q4_K_M 💡 high 🏠62≈ 80 Go
8Qwen3.6 27B Q8_0 💡 on* 🏠58.6≈ 32 Go
9Gemma 4 26B A4B Q8_0 🏠58.1≈ 32 Go
10Gemma 4 31B QAT-Q4_0 💡 on* 🏠56.9≈ 24 Go

Selon le logiciel utilisé, une partie du modèle peut être conservée dans la mémoire vive de l’ordinateur. Cette configuration réduit les besoins en VRAM, mais ralentit généralement l’exécution.

IA locale →

91modèles comparés
63 304verdicts IA publiés

Le classement porte uniquement sur la qualité d’écriture. Les consignes sont conçues dans la langue évaluée et les noms des modèles restent masqués jusqu’au verdict, afin que leur réputation n’influence pas l’évaluation. Ce site est un projet personnel. Je ne suis payé par aucun éditeur de modèles et je n’ai aucun intérêt à en favoriser un.

Pour aller plus loin

L’IA écrit-elle mieux en français avec ou sans raisonnement ?

Même fichier, mêmes consignes, un seul interrupteur. Sur 21 modèles locaux, le raisonnement apporte en moyenne 31,0 points à la famille Qwen et 6,7 aux grands Gemma 4 ; les petits Gemma E2B et E4B n’y gagnent rien et y perdent parfois.

Q4, Q6 ou Q8 : ce que la quantification fait à la qualité d’écriture

Parfois rien, parfois vingt points. Sur les consignes françaises, Qwen3.8 27B écrit aussi bien en Q4_K_M qu’en Q8_0 avec un fichier deux fois plus petit ; Gemma 4 31B est meilleur en Q6_K qu’en Q8_0 ; Granite 4.2 30B s’effondre à tous les niveaux. La règle générale : il n’y a pas de règle générale.

Muse Glimmer 30B à l’écrit : comparaison avec ses rivaux locaux

Mise à jour avec 1 500 duels classants par fichier et par langue. Le fichier K-Quant Dynamic est le meilleur modèle local pour écrire en anglais, à 77,6 points ; en français, en allemand et en espagnol, c’est le fichier 17GB, plus petit, qu’il faut télécharger.

Les juges IA préfèrent-ils leur propre modèle ?

Deux de nos cinq juges accordent un net bonus à leur propre modèle : GPT-5.6 Sol donne à ses textes jusqu’à 21 points de plus que les autres juges, Claude Opus 5 jusqu’à 11. Les deux juges Fable font l’inverse et se notent plus sévèrement.

Les juges IA sont-ils d’accord entre eux ?

Claude Opus 5 et GPT-5.6 Sol, qui fournissent la plupart des verdicts, penchent du même côté pour environ neuf paires de modèles sur dix. Les désaccords sont ailleurs : Sol ne déclare presque jamais d’égalité, Claude Fable 5.1 le fait jusqu’à une fois sur six, et Claude Opus 4.8 ne rejoint les autres que deux fois sur trois.

Un modèle, quatre langues, quatre rangs différents

Quatre-vingt-onze modèles sont classés dans les quatre langues. Le trio de tête bouge à peine : Claude Opus 5, Claude Fable 5 et Claude Fable 5.1 sont partout dans les quatre premiers. En dessous, GLM 5.3 Flash est 10e en anglais et 53e en allemand, Grok 4.6 25e en anglais et 61e en français.