Le classement des IA locales

Scores du classement général français. Les rangs sont calculés entre toutes les variantes locales admissibles avant l’application des filtres d’affichage ; la numérotation peut donc présenter des sauts.

Dernière actualisation :

Classement des modèles locaux selon leur qualité d’écriture
RangModèleNote juge IAFichier+128K+256K
1Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠76.515.7 Go47.7 Go79.7 Go
2Qwen3.8 27B Q8_0 💡 xhigh** 🏠75.227.1 Go59.1 Go91.1 Go
3Muse Glimmer 30B K-Quant 17GB 💡 high 🏠73.315.6 Go22.1 Go22.1 Go
4Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠6918.3 Go24.8 Go24.8 Go
7Ling 3.0 Flash Q4_K_M 💡 high 🏠6271.7 Go155.7 Go239.7 Go
9Gemma 4 26B A4B Q8_0 🏠58.125 Go55 Go85 Go
10Gemma 4 31B QAT-Q4_0 💡 on* 🏠56.916.4 Go64.4 Go112.4 Go
11Gemma 4 26B A4B Q8_0 💡 on* 🏠56.125 Go55 Go85 Go
12Gemma 4 26B A4B QAT-Q4_0 💡 on* 🏠55.613.4 Go43.4 Go73.4 Go
13Gemma 4 12B QAT-Q4_0 💡 on* 🏠51.86.5 Go30.5 Go54.5 Go
17Gemma 4 31B Q8_0 💡 on* 🏠49.730.4 Go78.4 Go126.4 Go
19Gemma 4 12B Q8_0 💡 on* 🏠48.211.8 Go35.8 Go59.8 Go
20Gemma 4 26B A4B QAT-Q4_0 🏠46.913.4 Go43.4 Go73.4 Go
21Gemma 4 12B QAT-Q4_0 🏠46.16.5 Go30.5 Go54.5 Go
22Gemma 4 31B Q8_0 🏠41.930.4 Go78.4 Go126.4 Go
23Gemma 4 12B Q8_0 🏠41.311.8 Go35.8 Go59.8 Go
24Qwen3.6 35B A3B Q8_0 💡 on* 🏠40.934.4 Go50.4 Go66.4 Go
27Gemma 4 31B QAT-Q4_0 🏠38.416.4 Go64.4 Go112.4 Go
28Nemotron 3 Super 120B A12B Q4_K_M 💡 full 🏠36.280.1 Go81.1 Go82.1 Go
29Qwen3.6 35B A3B Q4_K_M 💡 on* 🏠34.819.7 Go35.7 Go51.7 Go
30Qwen3.8 27B Q4_K_M 🏠34.315.7 Go47.7 Go79.7 Go
31Qwen3.8 27B Q8_0 🏠2827.1 Go59.1 Go91.1 Go
34Ling 3.0 Flash Q4_K_M 🏠22.871.7 Go155.7 Go239.7 Go
36Gemma 4 E4B Q8_0 🏠19.97.5 Go18 Go18 Go
37Qwen3.6 35B A3B Q8_0 🏠18.834.4 Go50.4 Go66.4 Go
38Gemma 4 E4B Q8_0 💡 on* 🏠17.47.5 Go18 Go18 Go
39Gemma 4 E4B Q4_K_M 🏠16.95 Go15.5 Go15.5 Go
43Qwen3.6 35B A3B Q4_K_M 🏠10.619.7 Go35.7 Go51.7 Go
45Gemma 4 E2B Q8_0 🏠10.14.6 Go13.6 Go13.6 Go
46Gemma 4 E2B Q8_0 💡 on* 🏠104.6 Go13.6 Go13.6 Go
47Gemma 4 E2B Q4_K_M 💡 on* 🏠7.73.2 Go12.2 Go12.2 Go
48Granite 4.2 30B Q8_0 💡 full 🏠7.129 Go61 Go61 Go
49Gemma 4 E4B Q4_K_M 💡 on* 🏠6.75 Go15.5 Go15.5 Go
50Gemma 4 E2B Q4_K_M 🏠6.33.2 Go12.2 Go12.2 Go
51Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 on* 🏠6.322.8 Go23.6 Go24.3 Go
52Laguna S 2.1 UD Q4_K_M 💡 on* 🏠4.568.1 Go92.1 Go116.1 Go
53Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠3.531.3 Go32 Go32.8 Go
54Granite 4.2 30B Q4_K_M 💡 full 🏠3.416.5 Go48.5 Go48.5 Go
55Granite 4.2 8B Q8_0 💡 full 🏠1.98.7 Go28.7 Go28.7 Go
56Granite 4.2 8B Q4_K_M 💡 full 🏠15 Go25 Go25 Go

Ce score reprend l’échelle du classement général, et non une note en pourcentage : pour la sélection de catégories active, 50 correspond à une chance estimée sur deux de battre le modèle moyen en français.

56 variantes locales classées63304 verdicts IA publiés dans le classement général

Résultats des duels directs

Chaque cellule indique la part des points possibles obtenue par le modèle de la ligne face au modèle de la colonne : une victoire vaut 100 %, une égalité 50 %, une défaite 0 %. Cette matrice n’utilise que les protocoles d’évaluation compatibles avec le classement principal.

Matrice orientée des points obtenus en duel direct. Au-dessus de 50 %, l’avantage va au modèle de la ligne ; en dessous, au modèle de la colonne.

0 %100 %

💡 signale un modèle avec raisonnement, ↯ un modèle sans raisonnement. 🏠 signale un modèle exécuté localement sur la machine de l’auteur de ce site.« on* » indique que le raisonnement est activé ou désactivé (modèles locaux sans niveaux intermédiaires) : le réglage fin demandé n’est pas supporté par le fichier local et retombe sur le mode activé par défaut. Sur les modèles locaux à raisonnement réglable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), le niveau affiché (xhigh**, high, full) est le niveau par défaut du modèle : le réglage fin demandé n’est pas supporté par le fichier local, qui retombe sur son comportement par défaut.

Afficher sous forme de tableau
Points obtenus en duel direct par paire de modèles
Modèle

Couverture des duels publiés

Chaque cellule indique combien de duels jugés par IA et publiés, tous protocoles confondus, comparent les deux modèles pour cette langue et cette catégorie. Les modèles des deux axes sont des candidats ; la matrice n’indique pas quel juge a produit chaque verdict.

Matrice symétrique du nombre de duels publiés. La diagonale vaut zéro : un modèle n’est pas comparé à lui-même.

0

💡 signale un modèle avec raisonnement, ↯ un modèle sans raisonnement. 🏠 signale un modèle exécuté localement sur la machine de l’auteur de ce site.« on* » indique que le raisonnement est activé ou désactivé (modèles locaux sans niveaux intermédiaires) : le réglage fin demandé n’est pas supporté par le fichier local et retombe sur le mode activé par défaut. Sur les modèles locaux à raisonnement réglable (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash), le niveau affiché (xhigh**, high, full) est le niveau par défaut du modèle : le réglage fin demandé n’est pas supporté par le fichier local, qui retombe sur son comportement par défaut.

Afficher sous forme de tableau
Nombre de duels publiés par paire de modèles
Modèle

Quelle IA locale choisir ?

La meilleure IA locale pour écrire en français, selon nos comparaisons en aveugle, est la variante placée en tête du tableau ci-dessus.

D’où viennent ces scores

Le Baromètre compare des textes deux à deux, en aveugle, sur des consignes rédigées nativement en français. Les scores affichés ici sont exactement ceux du classement général français : nous ne recalculons pas un classement isolé entre modèles locaux, nous filtrons le classement existant pour ne garder que les variantes exécutables localement, puis nous renumérotons les rangs.

Cela signifie qu’une variante locale a pu être comparée à des modèles cloud, et que ces duels comptent dans son score. C’est volontaire, pour deux raisons simples : l’échelle reste commune entre toutes les pages du site, et chaque modèle conserve davantage de données derrière son score. Le rang, lui, est bien un rang local : le numéro 1 de cette page est le meilleur modèle exécutable chez vous, pas le meilleur modèle tous accès confondus.

Précision utile : ces scores mesurent la qualité d’écriture en français, jugée sur des textes consultables. Ce n’est pas un classement d’intelligence générale, ni un indicateur de performance en code ou en mathématiques. Un modèle excellent ici peut être médiocre ailleurs, et l’inverse est vrai aussi. Précisons également qu’un modèle conçu en France ou en Europe n’écrit pas mieux en français par principe : cela se mesure, et parfois le résultat surprend.

Qu’est-ce que la quantification, concrètement

Un modèle est un très grand ensemble de nombres. La quantification consiste à stocker ces nombres avec moins de bits : au lieu de seize bits par poids, huit, six ou quatre. Le fichier rétrécit, l’empreinte mémoire aussi. Sur une inférence limitée par la bande passante mémoire — ce qui est le cas courant en génération de texte sur une machine personnelle — lire moins d’octets à chaque jeton peut également accélérer la génération.

Le compromis est qu’on perd de l’information. Une quantification peut modifier la qualité du texte, et l’ampleur de cet effet dépend du modèle, de la méthode employée, de la tâche, de la langue, de la longueur du contexte et du niveau de compression. C’est pourquoi nous ne reprendrons jamais à notre compte les formules du type « la Q4 conserve 98 % de la qualité » : ce chiffre n’existe pas de façon universelle, et il est particulièrement fragile pour l’écriture dans une langue autre que l’anglais.

Les formats que vous verrez ici :

Les deux K-Quant de Muse Glimmer

Meta publie Muse Glimmer 30B dans deux fichiers GGUF inhabituels, à environ quatre bits par poids en moyenne. K-Quant Dynamic conserve certains tenseurs avec une précision supérieure et vise 32 Go de VRAM ; K-Quant 17GB compresse davantage et vise 24 Go. Ce ne sont pas des fichiers Q4_K_M : nous gardons donc leurs noms exacts et les évaluons comme deux variantes distinctes. Les deux figurent sous le filtre large Q4, qui regroupe les téléchargements de la classe quatre bits sans prétendre que leur encodage est identique.

Meta annonce une dégradation moyenne respective de 0,2 % et 1,0 % sur quinze benchmarks courants. Il s’agit de mesures de l’éditeur, et non de scores d’écriture AIWB ni de garanties pour la prose française, anglaise, allemande ou espagnole. Nos classements et notre comparaison directe mesurent séparément les deux fichiers sur des consignes rédigées nativement.

Recommandations par machine

8 Go

Gemma 4 E2B Q8_0 🏠

10.1 · rang local 45

Gemma 4 E2B Q4_K_M 💡 on* 🏠

39.4 tok/s · mesure AIWB sur Strix Halo

16 Go

Gemma 4 12B QAT-Q4_0 💡 on* 🏠

51.8 · rang local 13

Gemma 4 E2B Q4_K_M 💡 on* 🏠

39.4 tok/s · mesure AIWB sur Strix Halo

32 Go

Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠

76.5 · rang local 1

Gemma 4 26B A4B Q8_0 🏠

39.8 tok/s · mesure AIWB sur Strix Halo

Repères de chargement, pas garanties : contexte, cache KV, batch et moteur changent l’empreinte. Les vitesses AIWB ont été mesurées sur la machine Strix Halo décrite dans À propos ; elles ne prédisent pas la vitesse d’une autre plateforme.

Pourquoi choisir une IA locale

Les raisons sont moins spectaculaires que les arguments publicitaires, et plus solides.

La confidentialité. Lorsque le moteur et ses intégrations fonctionnent entièrement en local, vos brouillons, vos notes et vos manuscrits n’ont pas à quitter la machine. Pour un texte sous contrat, un document interne ou un travail non publié, c’est déterminant.

Le fonctionnement hors ligne. Pas de connexion requise, pas de coupure de service, pas de file d’attente aux heures de pointe.

Le contrôle. Le modèle que vous avez téléchargé reste celui que vous avez téléchargé. Il n’est pas remplacé sans préavis par une version au comportement différent, et vous pouvez revenir à un checkpoint antérieur si le nouveau vous convient moins.

L’absence de dépendance. Ni quota, ni facturation à l’usage, ni changement de conditions au milieu d’un projet.

En contrepartie, il faut accepter que les meilleurs modèles locaux ne sont pas toujours au niveau des meilleurs modèles cloud, que la vitesse dépend de votre matériel, et qu’il y a un peu de bricolage initial. Le classement général du site vous dira où se situe précisément l’écart en français, sans avoir à nous croire sur parole.

Open source ou open-weight ?

Les deux termes circulent, souvent comme synonymes. Ils ne le sont pas. Poids ouverts signifie que les fichiers du modèle sont téléchargeables et exécutables ; open source décrit un statut de licence plus large, dont l’application exacte aux modèles d’IA reste débattue. Beaucoup de modèles très diffusés sont à poids ouverts sous licence restrictive, sans être open source au sens strict.

Le critère d’admission de cette page est technique : les poids sont disponibles et le modèle tourne réellement hors ligne. C’est ce qui détermine si vous pouvez l’utiliser chez vous. La licence, elle, détermine ce que vous avez le droit d’en faire — vérifiez-la avant tout usage commercial, elle ne dit rien de la qualité d’écriture.

Un point de méthode : un modèle est admissible même si les réponses évaluées ont été générées sur une infrastructure distante. Ce qui compte est la disponibilité des poids et la possibilité d’une exécution locale, pas le lieu où le texte a été produit lors de nos campagnes.

Questions fréquentes

Quelle est la meilleure IA locale pour écrire en français ? Celle qui occupe la première ligne du classement ci-dessus, à l’instant où vous le consultez. Le tableau est mis à jour à mesure que de nouveaux duels sont joués, et le nom en tête peut changer. Si votre matériel est limité, filtrez par quantification et consultez les onglets matériel : la meilleure variante pour vous est la mieux classée qui tient confortablement dans votre mémoire.

Combien de VRAM faut-il pour faire tourner un LLM local ? Cela dépend entièrement de la variante et de la longueur de contexte souhaitée. L’onglet GPU dédié indique, pour 8, 16 et 32 Go, si une variante classée tient avec la marge retenue ; lorsqu’aucune n’y tient, la carte le dit au lieu d’inventer une recommandation.

La quantification dégrade-t-elle la qualité du texte ? Elle peut la modifier, dans une mesure qui dépend du modèle, de la méthode, de la langue et de la tâche. Nous ne publions un écart chiffré que lorsque nous disposons de comparaisons appariées sur le même modèle et le même mode de raisonnement. Méfiez-vous des pourcentages universels annoncés sans protocole.

Quelle différence entre Q4 QAT et Q4_K_M ? La Q4 QAT est un checkpoint préparé ou entraîné en tenant compte d’une exécution en quatre bits. Le Q4_K_M est une quantification GGUF appliquée après l’entraînement, avec des précisions mixtes selon les couches. Même nombre de bits, origines différentes — et c’est pourquoi elles occupent deux lignes distinctes.

Que signifient les icônes 💡 et ↯ ? 💡 indique que le mode de raisonnement était activé, ↯ qu’il était désactivé. Un troisième état, inconnu, signale les cas où le moteur d’exécution n’a rapporté aucun jeton de réflexion malgré la configuration demandée : nous préférons l’indiquer plutôt que de supposer.

Pourquoi les scores incluent-ils des duels contre des modèles cloud ? Pour garder une échelle commune avec le classement général français et davantage de données derrière chaque score. Le rang affiché ici, en revanche, est bien un rang entre modèles locaux uniquement.

Un modèle « européen » écrit-il mieux en français ? Pas par principe. L’origine d’un modèle ne présume pas de sa qualité en français : c’est précisément ce que le classement mesure, et les résultats ne suivent pas toujours l’intuition.

Est-ce que « ça tient en mémoire » veut dire « ça sera rapide » ? Non. Un modèle peut se charger et rester lent, notamment si une partie des couches est déléguée au processeur. L’offload CPU permet d’exécuter des modèles plus gros que la mémoire de l’accélérateur, mais la pénalité de vitesse est réelle et parfois importante.