AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Journal des modifications

Un journal simple des mises à jour produit et benchmark, regroupées par date. Nous l'utilisons pour noter les nouveaux modèles testés, les re-tests, les changements de benchmark et les évolutions UX/produit livrées.

2026-09-08

  • Nouvelle fonctionnalité: Un mode clair à l’aspect papier et un mode sombre aux tons graphite, avec des en-têtes de comparaison compacts, une sélection de modèles claire et des recommandations moins encombrantes sur mobile.

2026-09-07

  • Nouvelle fonctionnalité: Le site adopte une typographie plus lisible, des commandes cohérentes et des thèmes clair et sombre plus sobres. La recherche de modèles, les commandes de comparaison et les cartes de métriques sur mobile restent disponibles.
  • Nouveaux modèles testés: Qwen3.8 Max (0902)

2026-09-05

  • Nouvelle fonctionnalité: Copiez les créations SVG en images ou téléchargez des PNG avec filigrane. Les aperçus affichent désormais le classement du modèle.
  • Correction de bug: Restauration de créations SVG valides et clarification des erreurs de dépassement du délai.

2026-08-20

  • Nouveaux modèles testés: GLM 5.3

2026-08-15

  • Nouvelle fonctionnalité: dots-studio/dots-3-note-preview:free Ajout de Dots3-Note Preview (gratuit) pour les tests rapides de disponibilité et des modes de raisonnement.
  • Nouvelle fonctionnalité: Les exécutions locales utilisent désormais le coût électrique estimé d’une RTX 3090 dans les comparaisons de coût et de valeur.

2026-08-14

  • Nouveaux modèles testés: Gemini 3.7 Flash, Qwen3.8 27B
  • Nouvelle fonctionnalité: Ajout de l’exécution locale des benchmarks avec Ollama, de la provenance du fournisseur, d’un traitement correct du calcul local sans prix et d’étiquettes Exécution locale claires.

2026-08-12

  • Nouveaux modèles testés: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • Nouvelle fonctionnalité: Ajout du nombre de paramètres avec sources, des paramètres MoE actifs, de la disponibilité et de l’architecture sur les pages de modèle et de comparaison, avec de nouveaux filtres du classement.

2026-08-02

  • Nouvelle fonctionnalité: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • Nouveaux modèles testés: Trinity Large Thinking, Qwen3.7 Flash
  • Nouvelle fonctionnalité: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • Nouvelle fonctionnalité: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-18

  • Nouveaux modèles testés: Inkling

2026-07-17

  • Nouveaux tests ajoutés: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • Nouveaux modèles testés: Muse Spark 1.1, Kimi K3
  • Nouvelle fonctionnalité: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • Nouvelle fonctionnalité: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-06-17

  • Nouveaux modèles testés: GLM 5.2
  • Correction de bug: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • Nouvelle fonctionnalité: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • Nouveaux modèles testés: Kimi K2.7 Code
  • Nouvelle fonctionnalité: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-06

  • Nouvelle fonctionnalité: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • Nouvelle fonctionnalité: Added model-generated visual showcases to model and comparison pages.
  • Nouvelle fonctionnalité: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • Nouveaux modèles testés: Nemotron 3 Ultra
  • Nouveaux tests ajoutés: Added a coding benchmark with executable reference cases.

2026-06-01

2026-05-27

  • Nouvelle fonctionnalité: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • Nouveaux modèles testés: Qwen3.7 Max
  • Nouveaux tests ajoutés: Ajout d'une nouvelle catégorie de test Coding axée sur la recherche de bugs dans des solutions C++.

2026-05-21

  • Nouveaux modèles testés: Grok Build 0.1
  • Nouveaux tests ajoutés: Added a new benchmark test and improved answer judging.
  • Correction de bug: Suppression de la variante sans raisonnement non prise en charge de xAI Grok Build 0.1 après que la validation du fournisseur a exigé le raisonnement.

2026-05-08

  • Nouveaux tests ajoutés: Added a new benchmark test to expand suite coverage.
  • Correction de bug: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

  • Nouveaux modèles testés: Cobuddy

2026-04-30

2026-04-26

  • UX: Amélioration du positionnement mobile du menu de comparaison, resserrement de la mise en page des pages modèle et division de l'historique en shards par modèle pour charger moins de données historiques.
  • Correction de bug: L’historique des runs regroupe désormais les retests quasi dupliqués d’une même suite et affiche tous les runs publics dans un tableau de comparaison direct sur les pages modèle.

2026-04-25

  • Nouvelle fonctionnalité: Ajout d'une télémétrie de fiabilité afin de suivre les échecs de l'API cible et de limite de débit séparément des mauvaises réponses.

2026-04-24

  • Nouveaux modèles testés: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • Correction de bug: Les liens de modèles du changelog pointent désormais vers les pages canoniques actives des modèles, et les pages modèle relient maintenant les variantes de raisonnement entre elles.

2026-04-23

  • Nouveaux modèles testés: Ling-2.6-1T, Hy3 preview
  • Nouvelle fonctionnalité: Historique des exécutions - Les pages modèle affichent désormais les exécutions publiques historiques et un tableau de comparaison côte à côte. (Page modèle exemple)
  • UX: Le classement prend désormais en charge la pagination et les filtres pilotés par URL, ainsi que des actions de comparaison directe depuis la liste.
  • Correction de bug: La recherche de la page d’accueil, les compteurs de filtres et l’état de la pagination restent désormais cohérents sur l’ensemble du jeu de données.
  • Re-test: GLM 5.1 La suite complète de benchmark a été relancée et le snapshot public d’historique des exécutions de ce modèle a été nettoyé.
  • Correction de bug: Les modèles non retestés ne reçoivent plus un nouveau timestamp tested_at.

2026-04-20

2026-04-11

  • Nouveaux modèles testés: GLM 5.1

2026-03-18

  • Nouveaux modèles testés: MiniMax M2.7
  • Nouvelle fonctionnalité: Added input and output pricing metrics to model and comparison pages.

2026-03-06

  • Nouvelle fonctionnalité: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-04

  • Nouveaux modèles testés: GPT-5.2 Chat, GPT 5.3 Chat
  • Nouvelle fonctionnalité: Added interactive comparison charts for direct model analysis.
  • Nouveaux tests ajoutés: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • Nouvelle fonctionnalité: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • Nouveaux modèles testés: Seed-2.0-Mini
  • Nouvelle fonctionnalité: Added reasoning-quality and consistency charts to model comparisons.

Page de changelog créée

Ce changelog a commencé après le lancement, donc certaines mises à jour plus anciennes n’y figurent pas.