AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Jurnal de modificări

Un jurnal simplu al actualizărilor de produs și benchmark, grupat după dată. Îl folosim pentru a nota modelele nou testate, retestările, schimbările de benchmark și lucrările UX/produs lansate.

2026-09-05

  • Funcționalitate nouă: Copiază exemplele SVG ca imagini sau descarcă PNG-uri cu filigran. Previzualizările arată acum poziția modelului.
  • Remediere de bug: Am restabilit exemplele SVG valide și am clarificat erorile de depășire a limitei de timp.

2026-08-20

2026-08-15

  • Funcționalitate nouă: dots-studio/dots-3-note-preview:free Dots3-Note Preview (gratuit) a fost adăugat pentru teste rapide de disponibilitate și moduri de raționament.
  • Funcționalitate nouă: Rulările locale folosesc acum costul estimat al energiei pentru un RTX 3090 în comparațiile de cost și valoare.

2026-08-14

  • Modele nou testate: Gemini 3.7 Flash, Qwen3.8 27B
  • Funcționalitate nouă: A fost adăugată rularea locală a benchmarkurilor cu Ollama, proveniența furnizorului, gestionarea corectă a calculului local fără preț și etichete clare Rulare locală.

2026-08-12

  • Modele nou testate: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • Funcționalitate nouă: Au fost adăugate numărul de parametri cu surse, parametrii MoE activi, disponibilitatea și arhitectura pe paginile modelelor și de comparație, împreună cu filtre noi pentru clasament.

2026-08-02

  • Funcționalitate nouă: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • Modele nou testate: Trinity Large Thinking, Qwen3.7 Flash
  • Funcționalitate nouă: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • Funcționalitate nouă: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-18

2026-07-17

  • Teste noi adăugate: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • Modele nou testate: Muse Spark 1.1, Kimi K3
  • Funcționalitate nouă: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • Funcționalitate nouă: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-06-17

  • Modele nou testate: GLM 5.2
  • Remediere de bug: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • Funcționalitate nouă: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • Modele nou testate: Kimi K2.7 Code
  • Funcționalitate nouă: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-06

  • Funcționalitate nouă: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • Funcționalitate nouă: Added model-generated visual showcases to model and comparison pages.
  • Funcționalitate nouă: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • Modele nou testate: Nemotron 3 Ultra
  • Teste noi adăugate: Added a coding benchmark with executable reference cases.

2026-05-27

  • Funcționalitate nouă: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • Modele nou testate: Qwen3.7 Max
  • Teste noi adăugate: Am adăugat o nouă categorie de test Coding axată pe găsirea de bug-uri în soluții C++.

2026-05-21

  • Modele nou testate: Grok Build 0.1
  • Teste noi adăugate: Added a new benchmark test and improved answer judging.
  • Remediere de bug: Varianta xAI Grok Build 0.1 fără raționament, nesuportată, a fost eliminată după ce validarea furnizorului a cerut raționament.

2026-05-08

  • Teste noi adăugate: Added a new benchmark test to expand suite coverage.
  • Remediere de bug: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

2026-04-26

  • UX: Am îmbunătățit poziționarea meniului de comparare pe mobil, am compactat layoutul paginilor de model și am împărțit istoricul rulărilor în sharduri pe model, ca paginile să încarce mai puține date istorice.
  • Remediere de bug: Istoricul rulărilor grupează acum retestările aproape duplicate din aceeași suită și afișează toate rulările publice într-un tabel comparativ direct pe paginile de model.

2026-04-25

  • Funcționalitate nouă: Am adăugat telemetrie pentru fiabilitate, astfel încât erorile API-ului țintă și de limită de rată să fie urmărite separat de răspunsurile greșite.

2026-04-24

  • Modele nou testate: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • Remediere de bug: Linkurile de modele din changelog duc acum la paginile canonice active ale modelelor, iar paginile de model au acum și legături între variantele de raționament.

2026-04-23

  • Modele nou testate: Ling-2.6-1T, Hy3 preview
  • Funcționalitate nouă: Istoric rulări - Paginile modelelor afișează acum rulările publice istorice și un tabel de comparație între două rulări. (Pagină exemplu model)
  • UX: Clasamentul acceptă acum paginare și filtre bazate pe URL, plus acțiuni directe de comparare din lista de ranking.
  • Remediere de bug: Căutarea de pe homepage, numărul filtrelor și starea paginării rămân acum consecvente pentru întregul set de date.
  • Retestare: GLM 5.1 Am rulat din nou suita completă de benchmark și am curățat snapshot-ul public de istoric al rulărilor pentru acest model.
  • Remediere de bug: Am împiedicat modelele fără retestare reală să primească un nou timestamp tested_at.

2026-04-11

2026-03-18

  • Modele nou testate: MiniMax M2.7
  • Funcționalitate nouă: Added input and output pricing metrics to model and comparison pages.

2026-03-06

  • Funcționalitate nouă: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-04

  • Modele nou testate: GPT-5.2 Chat, GPT 5.3 Chat
  • Funcționalitate nouă: Added interactive comparison charts for direct model analysis.
  • Teste noi adăugate: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • Funcționalitate nouă: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • Modele nou testate: Seed-2.0-Mini
  • Funcționalitate nouă: Added reasoning-quality and consistency charts to model comparisons.

Pagină de jurnal creată

Acest changelog a început după lansare, așa că unele actualizări mai vechi lipsesc de aici.