L’IA écrit-elle mieux en français avec ou sans raisonnement ?
Même fichier, mêmes consignes, un seul interrupteur. Sur 21 modèles locaux, le raisonnement apporte en moyenne 31,0 points à la famille Qwen et 6,7 aux grands Gemma 4 ; les petits Gemma E2B et E4B n’y gagnent rien et y perdent parfois.
En juillet, nous posions cette question avec quelques dizaines de verdicts et répondions prudemment : les réponses avec raisonnement obtenaient une majorité de points, mais l’intervalle incluait l’égalité. Deux mois et 63 000 verdicts plus tard, la réponse prudente est devenue précise. Chaque modèle local du Baromètre a été exécuté deux fois sur les mêmes 240 consignes françaises, une fois avec sa phase de raisonnement activée et une fois sans, et les deux variantes ont participé aux mêmes duels à l’aveugle. Les scores ci-dessous sont leurs positions dans le classement français, où 50 correspond à une chance sur deux de battre le modèle moyen.
Vingt et un modèles, un interrupteur
| Modèle local | Avec raisonnement | Sans | Écart |
|---|---|---|---|
| Qwen3.8 27B Q8_0 | 75,2 | 28,0 | +47,2 |
| Qwen3.8 27B Q4_K_M | 76,5 | 34,3 | +42,2 |
| Qwen3.6 27B Q8_0 | 58,6 | 20,7 | +37,9 |
| Gemma 4 31B Q6_K | 65,3 | 40,5 | +24,8 |
| Qwen3.6 35B A3B Q4_K_M | 34,8 | 10,6 | +24,2 |
| Qwen3.6 35B A3B Q8_0 | 40,9 | 18,8 | +22,1 |
| Gemma 4 31B QAT-Q4_0 | 56,9 | 38,4 | +18,5 |
| Qwen3.8 27B Q6_K | 63,6 | 51,2 | +12,4 |
| Gemma 4 26B A4B QAT-Q4_0 | 55,6 | 46,9 | +8,7 |
| Gemma 4 31B Q8_0 | 49,7 | 41,9 | +7,8 |
| Gemma 4 12B Q8_0 | 48,2 | 41,3 | +6,9 |
| Gemma 4 12B QAT-Q4_0 | 51,8 | 46,1 | +5,7 |
| Gemma 4 E2B Q6_K | 14,7 | 10,3 | +4,4 |
| Gemma 4 26B A4B Q6_K | 50,9 | 48,9 | +2,0 |
| Gemma 4 E2B Q4_K_M | 7,7 | 6,3 | +1,4 |
| Gemma 4 E2B Q8_0 | 10,0 | 10,1 | -0,1 |
| Gemma 4 26B A4B Q8_0 | 56,1 | 58,1 | -2,0 |
| Gemma 4 E4B Q8_0 | 17,4 | 19,9 | -2,5 |
| Gemma 4 E4B Q4_K_M | 6,7 | 16,9 | -10,2 |
| Gemma 4 E4B Q6_K | 13,2 | 23,6 | -10,4 |
| Gemma 4 12B Q6_K | 26,6 | 38,5 | -11,9 |
Qwen a besoin de son raisonnement, Gemma beaucoup moins
Toutes les variantes Qwen gagnent entre 12,4 et 47,2 points avec le raisonnement. Qwen3.8 27B Q8_0 passe de 28,0 à 75,2 : sans raisonnement, c’est l’un des modèles les plus faibles du classement ; avec, c’est le deuxième meilleur modèle local. Les Qwen semblent rédiger leur brouillon dans la phase de raisonnement et ne faire que le polir dans la réponse visible ; ôtez le brouillon et la réponse est maigre.
Les grands Gemma 4 (12B, 26B A4B, 31B) forment un tableau contrasté : de +24,8 points pour le 31B Q6_K à −11,9 pour le 12B Q6_K, avec une moyenne de 6,7. Gemma écrit un texte correct sans raisonner, et pour certains fichiers il écrit même mieux ainsi en français. La version Q8_0 du 26B A4B ne bouge pas (−2,0 points).
Les petits Gemma 4 E2B et E4B affichent une moyenne de -2,9 points et 4 de leurs 6 paires sont négatives : pour ces modèles, la phase de raisonnement produit parfois un texte moins bon que l’absence de raisonnement.
Ce qui a changé depuis juillet
L’article de juillet comptait quatre variantes et 34 verdicts anglais ; il trouvait 66,2 % des points pour le raisonnement, dans un intervalle de 48,6 % à 80,6 %. La direction était bonne et la prudence justifiée. Aujourd’hui, chaque paire du tableau repose sur 1 000 à 1 800 duels classants par variante, les intervalles font deux à trois points de large, et le partage entre familles est le résultat : le raisonnement n’est pas un réglage général qui aide à écrire, c’est une propriété de chaque modèle.
La même expérience dans trois autres langues
Les éditions anglaise, allemande et espagnole font tourner les mêmes 21 paires sur leurs propres consignes. Qwen gagne partout. Les gains de Gemma sont plus petits et, en français comme en allemand, plusieurs fichiers Gemma écrivent mieux raisonnement désactivé. Le réglage se teste modèle par modèle et langue par langue, ce que le filtre « Mode de génération » des quatre classements permet de faire.