AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

परिवर्तन लॉग

उत्पाद और बेंचमार्क अपडेट का एक सरल लॉग, तारीख के अनुसार समूहित। हम इसका उपयोग नए परीक्षण किए गए मॉडल, री-टेस्ट, बेंचमार्क बदलाव और शिप किए गए UX/उत्पाद कार्य को दर्ज करने के लिए करते हैं।

2026-09-05

  • नई सुविधा: SVG उदाहरणों को चित्र के रूप में कॉपी करें या वॉटरमार्क वाले PNG डाउनलोड करें। पूर्वावलोकन में अब मॉडल रैंक दिखती है।
  • बग फिक्स: मान्य SVG उदाहरण बहाल किए गए और टाइमआउट त्रुटियाँ स्पष्ट की गईं।

2026-09-04

  • नए परीक्षण किए गए मॉडल: GPT-6 Astra

2026-08-29

  • नए परीक्षण किए गए मॉडल: Hy4 preview

2026-08-26

  • नए परीक्षण किए गए मॉडल: GLM 5.3 Flash

2026-08-20

  • नए परीक्षण किए गए मॉडल: GLM 5.3

2026-08-15

  • नई सुविधा: dots-studio/dots-3-note-preview:free उपलब्धता और रीजनिंग मोड की त्वरित जाँच के लिए Dots3-Note Preview (मुफ़्त) जोड़ा गया।
  • नई सुविधा: स्थानीय रन अब लागत और मूल्य तुलना में RTX 3090 की अनुमानित बिजली लागत का उपयोग करते हैं।

2026-08-14

  • नए परीक्षण किए गए मॉडल: Gemini 3.7 Flash, Qwen3.8 27B
  • नई सुविधा: Ollama के साथ स्थानीय बेंचमार्क निष्पादन, प्रदाता की जानकारी, बिना मूल्य वाली स्थानीय कंप्यूटिंग का सही प्रबंधन और स्पष्ट स्थानीय रन टैग जोड़े गए।

2026-08-12

  • नए परीक्षण किए गए मॉडल: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • नई सुविधा: स्रोत-सहित पैरामीटर संख्या, सक्रिय MoE पैरामीटर, मॉडल उपलब्धता और आर्किटेक्चर की जानकारी मॉडल तथा तुलना पृष्ठों पर जोड़ी गई, साथ ही लीडरबोर्ड के नए फ़िल्टर भी जोड़े गए।

2026-08-08

  • नए परीक्षण किए गए मॉडल: Ling 3.0 Tiny

2026-08-06

  • नए परीक्षण किए गए मॉडल: Muse Spark 1.2

2026-08-04

  • नए परीक्षण किए गए मॉडल: Qwen3.8 Max

2026-08-02

  • नई सुविधा: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • नए परीक्षण किए गए मॉडल: Trinity Large Thinking, Qwen3.7 Flash
  • नई सुविधा: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • नई सुविधा: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-25

  • नए परीक्षण किए गए मॉडल: Claude Opus 5

2026-07-24

  • नए परीक्षण किए गए मॉडल: Ling-3.0-flash

2026-07-22

  • नए परीक्षण किए गए मॉडल: Laguna S 2.1

2026-07-20

  • नए परीक्षण किए गए मॉडल: LongCat 2.0

2026-07-18

  • नए परीक्षण किए गए मॉडल: Inkling

2026-07-17

  • नए टेस्ट जोड़े गए: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • नए परीक्षण किए गए मॉडल: Muse Spark 1.1, Kimi K3
  • नई सुविधा: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • नई सुविधा: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-07-02

  • नए परीक्षण किए गए मॉडल: Laguna XS 2.1

2026-06-30

  • नए परीक्षण किए गए मॉडल: Claude Sonnet 5

2026-06-18

  • नए परीक्षण किए गए मॉडल: North Mini Code

2026-06-17

  • नए परीक्षण किए गए मॉडल: GLM 5.2
  • बग फिक्स: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • नई सुविधा: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • नए परीक्षण किए गए मॉडल: Kimi K2.7 Code
  • नई सुविधा: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-10

  • नए परीक्षण किए गए मॉडल: Claude Fable 5

2026-06-06

  • नई सुविधा: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • नई सुविधा: Added model-generated visual showcases to model and comparison pages.
  • नई सुविधा: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • नए परीक्षण किए गए मॉडल: Nemotron 3 Ultra
  • नए टेस्ट जोड़े गए: Added a coding benchmark with executable reference cases.

2026-06-03

  • नए परीक्षण किए गए मॉडल: Qwen3.7 Plus

2026-06-01

  • नए परीक्षण किए गए मॉडल: MiniMax M3

2026-05-29

  • नए परीक्षण किए गए मॉडल: Step 3.7 Flash

2026-05-28

  • नए परीक्षण किए गए मॉडल: Claude Opus 4.8

2026-05-27

  • नई सुविधा: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • नए परीक्षण किए गए मॉडल: Qwen3.7 Max
  • नए टेस्ट जोड़े गए: C++ समाधानों में बग खोजने पर केंद्रित एक नई Coding परीक्षण श्रेणी जोड़ी गई।

2026-05-21

  • नए परीक्षण किए गए मॉडल: Grok Build 0.1
  • नए टेस्ट जोड़े गए: Added a new benchmark test and improved answer judging.
  • बग फिक्स: प्रदाता सत्यापन द्वारा reasoning आवश्यक होने के बाद xAI Grok Build 0.1 का असमर्थित no-reasoning वैरिएंट हटा दिया गया।

2026-05-20

2026-05-10

  • नए परीक्षण किए गए मॉडल: Ring-2.6-1T

2026-05-08

  • नए टेस्ट जोड़े गए: Added a new benchmark test to expand suite coverage.
  • बग फिक्स: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

  • नए परीक्षण किए गए मॉडल: Cobuddy

2026-04-30

  • नए परीक्षण किए गए मॉडल: Owl Alpha

2026-04-26

  • UX: मोबाइल तुलना ड्रॉपडाउन की स्थिति सुधारी गई, मॉडल पेज लेआउट को अधिक सघन किया गया, और रन इतिहास को प्रति-मॉडल शार्ड में बांटा गया ताकि पेज कम ऐतिहासिक डेटा लोड करें।
  • बग फिक्स: रन इतिहास अब समान suite के लगभग-डुप्लिकेट री-टेस्ट को समूहित करता है और मॉडल पेजों पर सभी सार्वजनिक रन को सीधे तुलना तालिका में दिखाता है।

2026-04-25

  • नई सुविधा: विश्वसनीयता स्कोर टेलीमेट्री जोड़ी गई ताकि लक्ष्य API और रेट-लिमिट विफलताओं को गलत उत्तरों से अलग ट्रैक किया जा सके।

2026-04-24

  • नए परीक्षण किए गए मॉडल: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • बग फिक्स: Changelog ke model links ab canonical live model pages par resolve hote hain, aur model pages ab reasoning variants ke beech bhi link karti hain.

2026-04-23

  • नए परीक्षण किए गए मॉडल: Ling-2.6-1T, Hy3 preview
  • नई सुविधा: रन इतिहास - मॉडल पेज अब ऐतिहासिक सार्वजनिक रन और एक side-by-side run comparison तालिका दिखाते हैं। (उदाहरण मॉडल पेज)
  • UX: लीडरबोर्ड अब URL-आधारित pagination, filters और ranking list से direct compare actions को support करता है।
  • बग फिक्स: होमपेज खोज, filter counts और pagination state अब पूरे dataset में एकसमान रहती है।
  • री-टेस्ट: GLM 5.1 इस मॉडल के लिए पूरी benchmark suite दोबारा चलाई गई और public run-history snapshot साफ़ किया गया।
  • बग फिक्स: जिन मॉडलों का वास्तव में retest नहीं हुआ, उन्हें नया tested_at timestamp मिलने से रोका गया।

2026-04-20

  • नए परीक्षण किए गए मॉडल: Kimi K2.6

2026-04-16

  • नए परीक्षण किए गए मॉडल: Claude Opus 4.7

2026-04-14

  • नए परीक्षण किए गए मॉडल: Ling-2.6-flash

2026-04-11

  • नए परीक्षण किए गए मॉडल: GLM 5.1

2026-04-04

  • नए परीक्षण किए गए मॉडल: Gemma 4 26B A4B

2026-03-21

  • नए परीक्षण किए गए मॉडल: Mimo V2 Omni

2026-03-20

  • नए परीक्षण किए गए मॉडल: Mimo V2 PRO

2026-03-18

  • नए परीक्षण किए गए मॉडल: MiniMax M2.7
  • नई सुविधा: Added input and output pricing metrics to model and comparison pages.

2026-03-15

  • नए परीक्षण किए गए मॉडल: GLM 5 Turbo

2026-03-06

  • नई सुविधा: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-05

  • नए परीक्षण किए गए मॉडल: Mercury 2, GPT-5.4

2026-03-04

  • नए परीक्षण किए गए मॉडल: GPT-5.2 Chat, GPT 5.3 Chat
  • नई सुविधा: Added interactive comparison charts for direct model analysis.
  • नए टेस्ट जोड़े गए: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • नई सुविधा: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • नए परीक्षण किए गए मॉडल: Seed-2.0-Mini
  • नई सुविधा: Added reasoning-quality and consistency charts to model comparisons.

2026-02-24

  • नए परीक्षण किए गए मॉडल: GPT-5.3-Codex

2026-02-17

चेंजलॉग पेज बनाया गया

यह चेंजलॉग लॉन्च के बाद शुरू हुआ, इसलिए कुछ पुराने अपडेट यहाँ नहीं हैं।