Des écarts de rang expliqués et des termes plus justes

Les pages de résultats des juges IA expliquent désormais leurs écarts de rang visibles, tandis que le guide anglais des modèles locaux corrige la mention d’une colonne inexistante.

  • Petit: Dans les quatre éditions, la page précise que chaque juge attribue les rangs avant que les filtres ne masquent certains modèles ; la numérotation visible peut donc conserver des écarts.
  • Petit: Le guide anglais consacré aux IA locales ne promet plus une colonne séparée pour les paramètres actifs et indique correctement que les valeurs connues figurent dans le nom du modèle.

Contrôles: Contrôlé avec des tests ciblés des pages, la suite Django complète et des vérifications sur navigateur mobile des routes publiques concernées.

Des rangs filtrés et des aperçus de recherche plus explicites

Le classement explique désormais les écarts de rang visibles après filtrage et présente plus précisément son utilité dans les résultats de recherche.

  • Petit: La page précise que les catégories d’écriture sélectionnées déterminent d’abord le classement. Les filtres d’éditeur, de taille, d’accès, de raisonnement et de quantification masquent ensuite des modèles sans renuméroter les lignes restantes, ce qui peut laisser des écarts.
  • Petit: Les descriptions destinées aux moteurs de recherche présentent maintenant le classement complet comme un outil de comparaison doté de filtres pratiques, au lieu de reprendre le texte plus général de l’accueil.

Contrôles: Vérifié avec des tests Django ciblés, la suite complète et des contrôles sur navigateur mobile dans les quatre éditions.

Des variantes locales, des rangs et des besoins en mémoire plus clairs

Le classement local distingue désormais les variantes exactes, explique les sauts de rang dus aux filtres et complète les besoins en mémoire de trois variantes Gemma 4 Q6 classées.

  • Moyen: Gemma 4 12B, 26B A4B et 31B en Q6_K affichent maintenant environ 16, 32 et 32 Go de mémoire au lieu d’une valeur inconnue. Le calcul prend en compte le fichier GGUF téléchargé et son fichier de projection associé, puis applique la marge de sécurité existante.
  • Petit: Le classement local précise que les rangs sont attribués à l’ensemble des variantes locales admissibles avant l’application des filtres d’affichage ; une variante masquée peut donc provoquer un saut dans la numérotation visible.
  • Petit: Sur l’accueil, le top 10 local est désormais présenté comme un classement de variantes : une même version de modèle peut fournir plusieurs entrées testées selon sa quantification et son mode de raisonnement.

Contrôles: Vérifié avec des tests Django ciblés, la suite complète et des contrôles sur navigateur mobile dans les quatre éditions.

Des résultats IA plus rapides et des scores mieux expliqués

Les pages de résultats IA chargent leurs catégories sans doublons, précisent le classement par victoires et explicitent le score du Face-à-face.

  • Moyen: La requête des catégories ne renvoie plus qu’une ligne par catégorie au lieu d’en transférer des dizaines de milliers, sans modifier les filtres disponibles ni les jugements publiés.
  • Petit: Chaque tableau de juge IA indique désormais que le rang dépend d’abord du total de victoires et invite à lire ensemble victoires, défaites, égalités et confrontations lorsque la couverture varie.
  • Petit: Le Face-à-face précise que le score IA n’est pas une note en pourcentage et que 50 correspond à une chance estimée sur deux face au modèle moyen de la cohorte choisie.

Contrôles: Vérifié avec des tests Django ciblés, la suite complète et des contrôles sur navigateur mobile dans les quatre éditions.

Un score local mieux expliqué et un classement humain accessible au clavier

Le classement des modèles locaux précise désormais l’échelle de son score, tandis que les grands tableaux du classement humain peuvent être parcourus au clavier.

  • Petit: La page des modèles locaux indique que son score reprend l’échelle du classement général, qu’il ne s’agit pas d’une note en pourcentage et donne le sens de 50 pour la sélection de catégories active.
  • Petit: Lorsqu’il contient des résultats, le tableau du classement humain dispose maintenant d’un focus clavier et d’un nom de région accessible en français pour le défilement horizontal.

Contrôles: Vérifié avec des tests Django ciblés, la suite complète et des contrôles sur navigateur mobile dans les quatre éditions.

Des scores plus clairs et des jugements IA plus transparents

Les quatre éditions expliquent désormais le score dès l’accueil, signalent la possibilité qu’un juge évalue son propre modèle et rendent les grands tableaux accessibles au clavier.

  • Moyen: Chaque classement, matrice et tableau de juge à défilement horizontal dispose maintenant d’un focus clavier et d’un nom de région accessible distinct.
  • Petit: Le classement d’accueil précise que son score n’est pas une note en pourcentage et donne le sens d’une valeur de 50.
  • Petit: L’introduction des résultats indique qu’un juge peut évaluer une paire contenant une réponse de son propre modèle, tout en ignorant l’identité des auteurs pendant sa décision.

Contrôles: Vérifié avec des tests Django ciblés, la suite complète et des contrôles sur navigateur mobile dans les quatre éditions.

Muse Glimmer face aux autres IA locales

Les quatre articles montrent désormais les comparaisons disponibles avec Gemma, Qwen et Nemotron, au lieu de les masquer derrière le seuil plus strict du duel principal.

  • Moyen: L’article présente maintenant les résultats provisoires des deux quantifications face à quatre modèles locaux, avec les effectifs et les écarts propres à chaque langue.
  • Petit: Les quatre éditions ont reçu de nouveaux titres et une révision native ; la version française a été réécrite plus en profondeur.
  • Petit: Un nouveau graphique accessible remplace la vue du désaccord entre juges et affiche huit duels locaux sans débordement sur mobile.

Contrôles: Vérifié contre le snapshot de production, les tests éditoriaux et SEO, la suite Django complète de 977 tests et le rendu mobile dans les quatre langues.

Muse Glimmer 30B passé au test de l’écriture locale

Une nouvelle analyse compare les deux quantifications officielles de Muse Glimmer et délimite ce que les premiers résultats d’écriture permettent vraiment d’affirmer.

  • Moyen: Le dossier Muse Glimmer croise 100 jugements IA à l’aveugle en français, anglais, allemand et espagnol avec les spécifications officielles et les premiers résultats Arena.
  • Petit: Cinq graphiques accessibles présentent le duel des quantifications, l’accord entre juges, la taille des fichiers, les vitesses DFlash annoncées et l’incertitude des scores Arena.
  • Petit: L’article apporte des repères concrets sur la mémoire, la confidentialité, la licence et la vérification des faits, sans classer Muse face à des concurrents encore sous le seuil de données.

Contrôles: Vérifié par contrôle des données sourcées, tests éditoriaux ciblés, suite Django complète de 972 tests et rendu local des cinq graphiques dans le navigateur.

Des résultats plus rapides et des modèles mieux identifiés

Le Baromètre répond plus directement à deux questions concrètes : quel juge a établi un classement et quelle mémoire graphique prévoir pour un modèle local.

  • Moyen: La page des résultats ne reconstitue plus des identifiants internes d’exécution qui n’étaient jamais affichés. L’ordre, les scores, le nombre de verdicts et la date d’actualisation restent identiques.
  • Petit: Le juge historique est désormais nommé Claude Opus 4.8, avec son numéro de version correctement ponctué.
  • Petit: La page d’accueil allemande indique maintenant la mémoire graphique des modèles locaux en GB, comme sa page dédiée, au lieu d’employer l’abréviation française Go.

Contrôles: Contrôlé par des tests de pages ciblés, la suite Django complète et des vérifications publiques sur les quatre éditions.

Un audit toutes les huit heures, avec garde-fous

Le Baromètre peut désormais progresser à intervalles réguliers sans confier sa maintenance à une automatisation sans contrôle.

  • Moyen: Mise en place d’un audit systemd borné toutes les huit heures. GPT-5.6 Sol ne peut appliquer que les changements approuvés indépendamment par Claude Opus 5.
  • Petit: Ajout de garde-fous qui imposent le retour à la version précédente si les tests, les contrôles publics ou la relecture après publication échouent.
  • Petit: Publication de ce journal horodaté dans quatre éditions rédigées séparément.

Contrôles: Suite Django complète, contrôles publics des quatre sites et validation indépendante par Opus 5 obligatoires.