Je m’appelle Johannes Eva et je crée des sites web depuis 27 ans. Le Baromètre est né d’un manque : aucun classement existant ne mesurait ce qui m’intéressait, la qualité d’écriture des modèles d’IA en français.

Les benchmarks publics privilégient le code, les mathématiques et le raisonnement. Le peu qu’ils consacrent à l’écriture est presque toujours jugé en anglais. Ici, seule compte la qualité des textes générés. Les consignes sont pensées directement en français et les réponses sont comparées à l’aveugle.

Une place particulière revient aux modèles qu’on peut faire tourner chez soi. Les familles Gemma 4, Qwen 3.6 et 3.8, Ling 3.0 Flash, Muse Glimmer ou Granite 4.2, entre autres, sont signalées par 🏠. Elles ont été exécutées localement, dans plusieurs quantifications, raisonnement activé et désactivé.

Ce site est un projet personnel. Je ne suis payé par aucun éditeur de modèles et je n’ai aucun intérêt à en favoriser un.

Les machines utilisées pour les modèles locaux

Framework Desktop utilisé pour exécuter les modèles de langage locaux du Baromètre
Ordinateur
Framework Desktop, AMD Ryzen AI Max série 300, révision A6
Processeur
AMD Ryzen AI Max+ 395, 16 cœurs et 32 threads, jusqu’à 5,19 GHz
Partie graphique
AMD Radeon 8060S intégrée
Mémoire
128 Go de mémoire unifiée, partagée entre le processeur et la partie graphique

Les modèles locaux sont exécutés sur un Framework Desktop équipé d’un AMD Ryzen AI Max+ 395. Ses 128 Go de mémoire unifiée sont accessibles au processeur comme à la partie graphique, ce qui permet de charger des modèles plus volumineux que sur la plupart des cartes graphiques grand public. Une seconde machine dotée d’une NVIDIA GeForce RTX 5070 Ti contribue les modèles les plus légers.

Vitesse de génération observée en local (Strix Halo)

Médiane des tokens générés par seconde sur la machine Strix Halo (Framework Desktop, Ryzen AI Max+ 395), calculée sur les réponses valides du benchmark générées sur celle-ci, tokens de raisonnement compris. La vitesse varie selon la longueur du contexte et le logiciel. Les modèles sans suffisamment de mesures sur Strix Halo ne sont pas listés.

ModèleQuantificationVitesse médianeRéponses
Gemma 4 26B A4BQ8_039.8 tokens/s465
Gemma 4 E2BQ4_K_M39.4 tokens/s224
Gemma 4 E4BQ8_035.9 tokens/s542
Gemma 4 E2BQ6_K33.2 tokens/s216
Ling 3.0 FlashQ4_K_M31.6 tokens/s277
Ling 3.0 FlashQ4_K_M30.5 tokens/s240
Gemma 4 E2BQ8_029.2 tokens/s224
Gemma 4 26B A4B QATQAT-Q4_027.9 tokens/s118
Qwen3.6 35B A3BQ4_K_M26.6 tokens/s347
Nemotron 3 Nano OmniQ4_K_M25.1 tokens/s960
Gemma 4 E4BQ4_K_M22.4 tokens/s221
Qwen3.6 35B A3BQ8_022.1 tokens/s312
Nemotron 3 Nano OmniQ8_021.2 tokens/s391
Nemotron 3 SuperQ4_K_M21.1 tokens/s413
Gemma 4 26B A4BQ6_K20.2 tokens/s539
Gemma 4 E4BQ6_K18.6 tokens/s218
Granite 4.2 8BQ4_K_M16.9 tokens/s36
Gemma 4 12BQ8_014.6 tokens/s124
Gemma 4 12B QATQAT-Q4_011 tokens/s752
Gemma 4 31B QATQAT-Q4_010 tokens/s548
Gemma 4 12BQ6_K9 tokens/s216
Qwen3.8 27BQ4_K_M8.9 tokens/s546
Muse Glimmer 30B Kquant 17gbK-Quant 17GB8.8 tokens/s394
Qwen3.8 27BQ8_08.4 tokens/s498
Muse Glimmer 30B Kquant DynamicK-Quant Dynamic8 tokens/s397
Granite 4.2 30BQ4_K_M7.6 tokens/s423
Qwen3.6 27BQ8_07.5 tokens/s190
Qwen3.8 27BQ6_K7 tokens/s504
Granite 4.2 30BQ6_K6.6 tokens/s397
Gemma 4 31BQ6_K5.8 tokens/s527
Qwen3.6 27BQ4_K_M5.2 tokens/s588
Granite 4.2 30BQ8_04.9 tokens/s447
Gemma 4 31BQ8_04.8 tokens/s316

Benchmarks comparables publiés pour le Ryzen AI Max+ 395