Q4, Q6 ou Q8 : ce que la quantification fait à la qualité d’écriture
Parfois rien, parfois vingt points. Sur les consignes françaises, Qwen3.8 27B écrit aussi bien en Q4_K_M qu’en Q8_0 avec un fichier deux fois plus petit ; Gemma 4 31B est meilleur en Q6_K qu’en Q8_0 ; Granite 4.2 30B s’effondre à tous les niveaux. La règle générale : il n’y a pas de règle générale.
La quantification réduit un modèle en stockant ses poids avec moins de bits. Un modèle de 27 milliards de paramètres pèse 27 Go en Q8_0 et 16 Go en Q4_K_M : c’est la différence entre tenir ou non sur une carte graphique de 32 Go. Tous les guides disent que le fichier plus petit écrit un peu moins bien. Nous avons mesuré de combien, en français, avec les mêmes duels à l’aveugle qui construisent le classement principal. Les scores sont ceux du classement français : 50 correspond à une chance sur deux de battre le modèle moyen. Les tailles sont celles des fichiers GGUF ; les vitesses sont des médianes mesurées sur notre machine Strix Halo, tokens de raisonnement compris.
Même modèle, trois fichiers, trois scores
| Famille | Quantification | Score | Fichier (Go) | Vitesse (tok/s) | Duels |
|---|---|---|---|---|---|
| Qwen3.8 27B | Q4_K_M | 76,5 | 15,7 | 8,9 | 1378 |
| Q8_0 | 75,2 | 27,1 | 8,4 | 1345 | |
| Q6_K | 63,6 | 20,9 | 7,0 | 1366 | |
| Qwen3.6 27B | Q8_0 | 58,6 | 26,6 | 7,5 | 1015 |
| Q4_K_M | 51,1 | 15,4 | 5,2 | 1000 | |
| Qwen3.6 35B A3B | Q8_0 | 40,9 | 34,4 | 22,1 | 1586 |
| Q4_K_M | 34,8 | 19,7 | 26,6 | 1901 | |
| Gemma 4 31B | Q6_K | 65,3 | 23,5 | 5,8 | 1369 |
| QAT-Q4_0 | 56,9 | 16,4 | 10,0 | 1578 | |
| Q8_0 | 49,7 | 30,4 | 4,8 | 1756 | |
| Gemma 4 26B A4B | Q8_0 | 56,1 | 25,0 | 39,8 | 1648 |
| QAT-Q4_0 | 55,6 | 13,4 | 27,9 | 2027 | |
| Q6_K | 50,9 | 21,1 | 20,2 | 1078 | |
| Gemma 4 12B | QAT-Q4_0 | 51,8 | 6,5 | 11,0 | 2055 |
| Q8_0 | 48,2 | 11,8 | 14,6 | 1609 | |
| Q6_K | 26,6 | 9,1 | 9,0 | 1078 | |
| Muse Glimmer 30B | K-Quant 17GB (≈ Q4) | 73,3 | 15,6 | 8,8 | 1635 |
| K-Quant Dynamic (≈ Q5) | 69,0 | 18,3 | 8,0 | 1635 | |
| Granite 4.2 30B | Q6_K | 11,7 | 22,4 | 6,6 | 940 |
| Q8_0 | 7,1 | 29,0 | 4,9 | 1131 | |
| Q4_K_M | 3,4 | 16,5 | 7,6 | 1118 | |
| Nemotron 3 Nano Omni 30B A3B | Q4_K_M | 6,3 | 22,8 | 25,1 | 1453 |
| Q8_0 | 3,5 | 31,3 | 21,2 | 1093 |
Là où la quantification est gratuite
Qwen3.8 27B est le cas exemplaire : Q4_K_M et Q8_0 sont à un point l’un de l’autre, sur plus de 1 300 duels chacun, et le fichier de 16 Go est le meilleur modèle local du classement français. Gemma 4 26B A4B et Gemma 4 12B sont presque indifférents : le QAT-Q4_0, entraîné par Google pour survivre au stockage 4 bits, fait aussi bien que le Q8_0 pour moitié moins de mémoire.
Là où elle coûte cher
Gemma 4 31B est le cas étrange : son Q6_K dépasse le Q8_0 de quinze points, sur plus de 1 300 duels chacun, et nous n’avons pas encore d’explication. Muse Glimmer 30B préfère son petit fichier : la version 17GB devance la K-Quant Dynamic de quatre points, à l’inverse de l’anglais. Qwen3.6 27B et Qwen3.6 35B A3B perdent six à sept points en Q4. Granite 4.2 30B, lui, ne tient nulle part : sept points en Q8, trois en Q4, ce qui est le score d’un modèle qui perd presque tous ses duels.
Le Q6 est rarement la réponse
Sur neuf familles, le Q6_K n’est le meilleur de sa famille que pour Gemma 4 31B et Granite 4.2 30B, et il est souvent le pire. Il économise moins de mémoire que le Q4 et garde rarement la qualité du Q8. S’il faut choisir à l’aveugle, prenez le Q8 quand il tient, un Q4 QAT ou K-Quant quand il ne tient pas, et passez le Q6.
Le même tableau dans une autre langue dit autre chose
Ceci est l’édition française. Les éditions anglaise, allemande et espagnole utilisent les mêmes fichiers et arrivent à d’autres verdicts : Qwen3.8 27B en Q4_K_M perd 21 points face au Q8_0 en allemand et 27 en espagnol. Une quantification n’est pas bonne ou mauvaise en soi ; elle est bonne ou mauvaise pour un modèle dans une langue, et c’est pourquoi nous la mesurons édition par édition.