AI BENCHY
Advertise here

Wijzigingslog

Een eenvoudig logboek van product- en benchmarkupdates, gegroepeerd op datum. We gebruiken dit om nieuw geteste modellen, hertests, benchmarkwijzigingen en geleverde UX-/productverbeteringen vast te leggen.

2026-09-05

  • Nieuwe functie: Kopieer SVG-voorbeelden als afbeelding of download PNG’s met watermerk. Voorbeelden tonen nu de modelrang.
  • Bugfix: Geldige SVG-voorbeelden hersteld en meldingen over tijdslimieten verduidelijkt.

2026-08-20

2026-08-15

  • Nieuwe functie: dots-studio/dots-3-note-preview:free Dots3-Note Preview (gratis) toegevoegd voor snelle tests van beschikbaarheid en redeneermodi.
  • Nieuwe functie: Lokale runs gebruiken nu geschatte stroomkosten van een RTX 3090 in kosten- en waardevergelijkingen.

2026-08-14

  • Nieuw geteste modellen: Gemini 3.7 Flash, Qwen3.8 27B
  • Nieuwe functie: Lokale benchmarks via Ollama toegevoegd, inclusief providerherkomst, correcte verwerking van niet-geprijsde lokale rekenkracht en duidelijke labels voor lokale runs.

2026-08-12

  • Nieuw geteste modellen: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • Nieuwe functie: Parameteraantallen met bronnen, actieve MoE-parameters, beschikbaarheid en architectuur zijn toegevoegd aan model- en vergelijkingspagina's, samen met nieuwe ranglijstfilters.

2026-08-02

  • Nieuwe functie: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • Nieuw geteste modellen: Trinity Large Thinking, Qwen3.7 Flash
  • Nieuwe functie: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • Nieuwe functie: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-18

2026-07-17

  • Nieuwe tests toegevoegd: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • Nieuw geteste modellen: Muse Spark 1.1, Kimi K3
  • Nieuwe functie: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • Nieuwe functie: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-06-17

  • Nieuw geteste modellen: GLM 5.2
  • Bugfix: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • Nieuwe functie: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • Nieuw geteste modellen: Kimi K2.7 Code
  • Nieuwe functie: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-06

  • Nieuwe functie: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • Nieuwe functie: Added model-generated visual showcases to model and comparison pages.
  • Nieuwe functie: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • Nieuw geteste modellen: Nemotron 3 Ultra
  • Nieuwe tests toegevoegd: Added a coding benchmark with executable reference cases.

2026-05-27

  • Nieuwe functie: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • Nieuw geteste modellen: Qwen3.7 Max
  • Nieuwe tests toegevoegd: Nieuwe Coding-testcategorie toegevoegd, gericht op het vinden van bugs in C++-oplossingen.

2026-05-21

  • Nieuw geteste modellen: Grok Build 0.1
  • Nieuwe tests toegevoegd: Added a new benchmark test and improved answer judging.
  • Bugfix: De niet-ondersteunde xAI Grok Build 0.1-variant zonder reasoning is verwijderd nadat provider-validatie reasoning vereiste.

2026-05-08

  • Nieuwe tests toegevoegd: Added a new benchmark test to expand suite coverage.
  • Bugfix: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

2026-04-30

2026-04-26

  • UX: De mobiele positie van het vergelijkingsmenu is verbeterd, de modelpagina-layout is compacter gemaakt en de runhistorie is opgesplitst in shards per model, zodat pagina's minder historische data laden.
  • Bugfix: De rungeschiedenis groepeert nu bijna dubbele hertests van dezelfde suite en toont alle openbare runs op modelpagina's in een directe vergelijkingstabel.

2026-04-25

  • Nieuwe functie: Telemetrie voor betrouwbaarheid toegevoegd zodat doel-API- en snelheidslimietfouten los van foute antwoorden worden gevolgd.

2026-04-24

2026-04-23

  • Nieuw geteste modellen: Ling-2.6-1T, Hy3 preview
  • Nieuwe functie: Rungeschiedenis - Modelpagina’s tonen nu historische publieke runs en een zij-aan-zij runvergelijkingstabel. (Voorbeeldmodelpagina)
  • UX: Het leaderboard ondersteunt nu URL-gestuurde paginering, filters en directe vergelijkingsacties vanuit de ranglijst.
  • Bugfix: Zoeken op de homepage, filteraantallen en pagineringsstatus blijven nu consistent over de volledige dataset.
  • Hertest: GLM 5.1 De volledige benchmarksuite is opnieuw uitgevoerd en de publieke rungeschiedenis-snapshot voor dit model is opgeschoond.
  • Bugfix: Modellen die niet echt opnieuw zijn getest krijgen niet langer een nieuwe tested_at-timestamp.

2026-04-20

2026-04-11

2026-03-18

  • Nieuw geteste modellen: MiniMax M2.7
  • Nieuwe functie: Added input and output pricing metrics to model and comparison pages.

2026-03-06

  • Nieuwe functie: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-04

  • Nieuw geteste modellen: GPT-5.2 Chat, GPT 5.3 Chat
  • Nieuwe functie: Added interactive comparison charts for direct model analysis.
  • Nieuwe tests toegevoegd: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • Nieuwe functie: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • Nieuw geteste modellen: Seed-2.0-Mini
  • Nieuwe functie: Added reasoning-quality and consistency charts to model comparisons.

Changelogpagina aangemaakt

Deze changelog begon pas na de lancering, dus sommige oudere updates ontbreken hier.