En juillet, nous posions cette question avec quelques dizaines de verdicts et répondions prudemment : les réponses avec raisonnement obtenaient une majorité de points, mais l’intervalle incluait l’égalité. Deux mois et 63 000 verdicts plus tard, la réponse prudente est devenue précise. Chaque modèle local du Baromètre a été exécuté deux fois sur les mêmes 240 consignes françaises, une fois avec sa phase de raisonnement activée et une fois sans, et les deux variantes ont participé aux mêmes duels à l’aveugle. Les scores ci-dessous sont leurs positions dans le classement français, où 50 correspond à une chance sur deux de battre le modèle moyen.

Vingt et un modèles, un interrupteur

Modèle local Avec raisonnement Sans Écart
Qwen3.8 27B Q8_0 75,2 28,0 +47,2
Qwen3.8 27B Q4_K_M 76,5 34,3 +42,2
Qwen3.6 27B Q8_0 58,6 20,7 +37,9
Gemma 4 31B Q6_K 65,3 40,5 +24,8
Qwen3.6 35B A3B Q4_K_M 34,8 10,6 +24,2
Qwen3.6 35B A3B Q8_0 40,9 18,8 +22,1
Gemma 4 31B QAT-Q4_0 56,9 38,4 +18,5
Qwen3.8 27B Q6_K 63,6 51,2 +12,4
Gemma 4 26B A4B QAT-Q4_0 55,6 46,9 +8,7
Gemma 4 31B Q8_0 49,7 41,9 +7,8
Gemma 4 12B Q8_0 48,2 41,3 +6,9
Gemma 4 12B QAT-Q4_0 51,8 46,1 +5,7
Gemma 4 E2B Q6_K 14,7 10,3 +4,4
Gemma 4 26B A4B Q6_K 50,9 48,9 +2,0
Gemma 4 E2B Q4_K_M 7,7 6,3 +1,4
Gemma 4 E2B Q8_0 10,0 10,1 -0,1
Gemma 4 26B A4B Q8_0 56,1 58,1 -2,0
Gemma 4 E4B Q8_0 17,4 19,9 -2,5
Gemma 4 E4B Q4_K_M 6,7 16,9 -10,2
Gemma 4 E4B Q6_K 13,2 23,6 -10,4
Gemma 4 12B Q6_K 26,6 38,5 -11,9

Qwen a besoin de son raisonnement, Gemma beaucoup moins

Toutes les variantes Qwen gagnent entre 12,4 et 47,2 points avec le raisonnement. Qwen3.8 27B Q8_0 passe de 28,0 à 75,2 : sans raisonnement, c’est l’un des modèles les plus faibles du classement ; avec, c’est le deuxième meilleur modèle local. Les Qwen semblent rédiger leur brouillon dans la phase de raisonnement et ne faire que le polir dans la réponse visible ; ôtez le brouillon et la réponse est maigre.

Les grands Gemma 4 (12B, 26B A4B, 31B) forment un tableau contrasté : de +24,8 points pour le 31B Q6_K à −11,9 pour le 12B Q6_K, avec une moyenne de 6,7. Gemma écrit un texte correct sans raisonner, et pour certains fichiers il écrit même mieux ainsi en français. La version Q8_0 du 26B A4B ne bouge pas (−2,0 points).

Les petits Gemma 4 E2B et E4B affichent une moyenne de -2,9 points et 4 de leurs 6 paires sont négatives : pour ces modèles, la phase de raisonnement produit parfois un texte moins bon que l’absence de raisonnement.

Ce qui a changé depuis juillet

L’article de juillet comptait quatre variantes et 34 verdicts anglais ; il trouvait 66,2 % des points pour le raisonnement, dans un intervalle de 48,6 % à 80,6 %. La direction était bonne et la prudence justifiée. Aujourd’hui, chaque paire du tableau repose sur 1 000 à 1 800 duels classants par variante, les intervalles font deux à trois points de large, et le partage entre familles est le résultat : le raisonnement n’est pas un réglage général qui aide à écrire, c’est une propriété de chaque modèle.

La même expérience dans trois autres langues

Les éditions anglaise, allemande et espagnole font tourner les mêmes 21 paires sur leurs propres consignes. Qwen gagne partout. Les gains de Gemma sont plus petits et, en français comme en allemand, plusieurs fichiers Gemma écrivent mieux raisonnement désactivé. Le réglage se teste modèle par modèle et langue par langue, ce que le filtre « Mode de génération » des quatre classements permet de faire.