La quantification réduit un modèle en stockant ses poids avec moins de bits. Un modèle de 27 milliards de paramètres pèse 27 Go en Q8_0 et 16 Go en Q4_K_M : c’est la différence entre tenir ou non sur une carte graphique de 32 Go. Tous les guides disent que le fichier plus petit écrit un peu moins bien. Nous avons mesuré de combien, en français, avec les mêmes duels à l’aveugle qui construisent le classement principal. Les scores sont ceux du classement français : 50 correspond à une chance sur deux de battre le modèle moyen. Les tailles sont celles des fichiers GGUF ; les vitesses sont des médianes mesurées sur notre machine Strix Halo, tokens de raisonnement compris.

Même modèle, trois fichiers, trois scores

Famille Quantification Score Fichier (Go) Vitesse (tok/s) Duels
Qwen3.8 27B Q4_K_M 76,5 15,7 8,9 1378
Q8_0 75,2 27,1 8,4 1345
Q6_K 63,6 20,9 7,0 1366
Qwen3.6 27B Q8_0 58,6 26,6 7,5 1015
Q4_K_M 51,1 15,4 5,2 1000
Qwen3.6 35B A3B Q8_0 40,9 34,4 22,1 1586
Q4_K_M 34,8 19,7 26,6 1901
Gemma 4 31B Q6_K 65,3 23,5 5,8 1369
QAT-Q4_0 56,9 16,4 10,0 1578
Q8_0 49,7 30,4 4,8 1756
Gemma 4 26B A4B Q8_0 56,1 25,0 39,8 1648
QAT-Q4_0 55,6 13,4 27,9 2027
Q6_K 50,9 21,1 20,2 1078
Gemma 4 12B QAT-Q4_0 51,8 6,5 11,0 2055
Q8_0 48,2 11,8 14,6 1609
Q6_K 26,6 9,1 9,0 1078
Muse Glimmer 30B K-Quant 17GB (≈ Q4) 73,3 15,6 8,8 1635
K-Quant Dynamic (≈ Q5) 69,0 18,3 8,0 1635
Granite 4.2 30B Q6_K 11,7 22,4 6,6 940
Q8_0 7,1 29,0 4,9 1131
Q4_K_M 3,4 16,5 7,6 1118
Nemotron 3 Nano Omni 30B A3B Q4_K_M 6,3 22,8 25,1 1453
Q8_0 3,5 31,3 21,2 1093

Là où la quantification est gratuite

Qwen3.8 27B est le cas exemplaire : Q4_K_M et Q8_0 sont à un point l’un de l’autre, sur plus de 1 300 duels chacun, et le fichier de 16 Go est le meilleur modèle local du classement français. Gemma 4 26B A4B et Gemma 4 12B sont presque indifférents : le QAT-Q4_0, entraîné par Google pour survivre au stockage 4 bits, fait aussi bien que le Q8_0 pour moitié moins de mémoire.

Là où elle coûte cher

Gemma 4 31B est le cas étrange : son Q6_K dépasse le Q8_0 de quinze points, sur plus de 1 300 duels chacun, et nous n’avons pas encore d’explication. Muse Glimmer 30B préfère son petit fichier : la version 17GB devance la K-Quant Dynamic de quatre points, à l’inverse de l’anglais. Qwen3.6 27B et Qwen3.6 35B A3B perdent six à sept points en Q4. Granite 4.2 30B, lui, ne tient nulle part : sept points en Q8, trois en Q4, ce qui est le score d’un modèle qui perd presque tous ses duels.

Le Q6 est rarement la réponse

Sur neuf familles, le Q6_K n’est le meilleur de sa famille que pour Gemma 4 31B et Granite 4.2 30B, et il est souvent le pire. Il économise moins de mémoire que le Q4 et garde rarement la qualité du Q8. S’il faut choisir à l’aveugle, prenez le Q8 quand il tient, un Q4 QAT ou K-Quant quand il ne tient pas, et passez le Q6.

Le même tableau dans une autre langue dit autre chose

Ceci est l’édition française. Les éditions anglaise, allemande et espagnole utilisent les mêmes fichiers et arrivent à d’autres verdicts : Qwen3.8 27B en Q4_K_M perd 21 points face au Q8_0 en allemand et 27 en espagnol. Une quantification n’est pas bonne ou mauvaise en soi ; elle est bonne ou mauvaise pour un modèle dans une langue, et c’est pourquoi nous la mesurons édition par édition.