AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Änderungsprotokoll

Ein einfaches Protokoll für Produkt- und Benchmark-Updates, nach Datum gruppiert. Wir erfassen hier neu getestete Modelle, Re-Tests, Benchmark-Änderungen und ausgelieferte UX-/Produktarbeit.

2026-09-05

  • Neues Feature: SVG-Beispiele als Bilder kopieren oder als PNG mit Wasserzeichen herunterladen. Die Vorschau zeigt jetzt den Modellrang.
  • Fehlerbehebung: Gültige SVG-Beispiele wiederhergestellt und Fehlermeldungen bei Zeitüberschreitungen präzisiert.

2026-08-20

2026-08-15

  • Neues Feature: dots-studio/dots-3-note-preview:free Dots3-Note Preview (kostenlos) für Verfügbarkeits- und Reasoning-Modus-Kurztests hinzugefügt.
  • Neues Feature: Lokale Läufe verwenden jetzt geschätzte RTX-3090-Stromkosten in Kosten- und Wertvergleichen.

2026-08-14

  • Neu getestete Modelle: Gemini 3.7 Flash, Qwen3.8 27B
  • Neues Feature: Lokale Benchmark-Ausführung mit Ollama, Anbieterherkunft, korrekter Behandlung nicht bewerteter lokaler Rechenkosten und klaren Kennzeichnungen für lokale Läufe hinzugefügt.

2026-08-12

  • Neu getestete Modelle: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • Neues Feature: Parameterzahlen mit Quellen, aktive MoE-Parameter, Verfügbarkeit und Architektur wurden auf Modell- und Vergleichsseiten ergänzt. Dazu kommen neue Filter für die Bestenliste.

2026-08-02

  • Neues Feature: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • Neu getestete Modelle: Trinity Large Thinking, Qwen3.7 Flash
  • Neues Feature: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • Neues Feature: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-18

2026-07-17

  • Neue Tests hinzugefügt: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • Neu getestete Modelle: Muse Spark 1.1, Kimi K3
  • Neues Feature: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • Neues Feature: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-06-17

  • Neu getestete Modelle: GLM 5.2
  • Fehlerbehebung: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • Neues Feature: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • Neu getestete Modelle: Kimi K2.7 Code
  • Neues Feature: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-06

  • Neues Feature: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • Neues Feature: Added model-generated visual showcases to model and comparison pages.
  • Neues Feature: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • Neu getestete Modelle: Nemotron 3 Ultra
  • Neue Tests hinzugefügt: Added a coding benchmark with executable reference cases.

2026-05-27

  • Neues Feature: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • Neu getestete Modelle: Qwen3.7 Max
  • Neue Tests hinzugefügt: Neue Coding-Testkategorie hinzugefügt, die sich auf die Fehlersuche in C++-Lösungen konzentriert.

2026-05-21

  • Neu getestete Modelle: Grok Build 0.1
  • Neue Tests hinzugefügt: Added a new benchmark test and improved answer judging.
  • Fehlerbehebung: Die nicht unterstützte xAI Grok Build 0.1-Variante ohne Reasoning wurde entfernt, nachdem die Provider-Validierung Reasoning verlangte.

2026-05-08

  • Neue Tests hinzugefügt: Added a new benchmark test to expand suite coverage.
  • Fehlerbehebung: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

2026-04-30

2026-04-26

  • UX: Die mobile Position des Vergleich-Dropdowns wurde verbessert, das Layout der Modellseiten verdichtet und der Verlauf in Modell-Shards aufgeteilt, damit Seiten weniger Verlaufsdaten laden.
  • Fehlerbehebung: Die Laufhistorie gruppiert jetzt nahezu doppelte Re-Tests derselben Suite und zeigt alle öffentlichen Läufe auf Modellseiten in einer direkten Vergleichstabelle.

2026-04-25

  • Neues Feature: Telemetrie für den Zuverlässigkeitswert hinzugefügt, damit Ziel-API- und Rate-Limit-Fehler getrennt von falschen Antworten verfolgt werden.

2026-04-24

  • Neu getestete Modelle: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • Fehlerbehebung: Modelllinks im Changelog verweisen jetzt auf kanonische Live-Modellseiten, und Modellseiten verlinken jetzt zwischen Reasoning-Varianten.

2026-04-23

  • Neu getestete Modelle: Ling-2.6-1T, Hy3 preview
  • Neues Feature: Laufhistorie - Modellseiten zeigen jetzt historische öffentliche Läufe und eine nebeneinanderstehende Laufvergleichstabelle. (Beispiel-Modellseite)
  • UX: Das Leaderboard unterstützt jetzt URL-basierte Paginierung, Filter und direkte Vergleichsaktionen aus der Rangliste.
  • Fehlerbehebung: Suche auf der Startseite, Filteranzahl und Paginierungsstatus bleiben nun über den gesamten Datensatz konsistent.
  • Re-Test: GLM 5.1 Die vollständige Benchmark-Suite wurde erneut ausgeführt und der öffentliche Snapshot der Laufhistorie dieses Modells wurde bereinigt.
  • Fehlerbehebung: Modelle ohne tatsächlichen Retest erhalten keinen neuen tested_at-Zeitstempel mehr.

2026-04-20

2026-04-11

2026-03-18

  • Neu getestete Modelle: MiniMax M2.7
  • Neues Feature: Added input and output pricing metrics to model and comparison pages.

2026-03-06

  • Neues Feature: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-04

  • Neu getestete Modelle: GPT-5.2 Chat, GPT 5.3 Chat
  • Neues Feature: Added interactive comparison charts for direct model analysis.
  • Neue Tests hinzugefügt: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • Neues Feature: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • Neu getestete Modelle: Seed-2.0-Mini
  • Neues Feature: Added reasoning-quality and consistency charts to model comparisons.

Changelog-Seite erstellt

Dieses Changelog begann erst nach dem Launch, daher fehlen hier einige ältere Updates.