AI BENCHY
Advertise here

سجل التغييرات

سجل بسيط لتحديثات المنتج والاختبارات، مجمعة حسب التاريخ. نستخدمه لتوثيق النماذج المختبرة حديثًا، وإعادات الاختبار، وتغييرات الاختبارات، والعمل المنتجّي وتجارب الاستخدام التي تم إطلاقها.

2026-09-05

  • ميزة جديدة: انسخ نماذج SVG كصور أو نزّل ملفات PNG بعلامة مائية. تعرض المعاينات الآن ترتيب النموذج.
  • إصلاح خطأ: استُعيدت نماذج SVG الصالحة وأصبحت رسائل انتهاء المهلة أوضح.

2026-09-04

  • نماذج جديدة تم اختبارها: GPT-6 Astra

2026-08-29

  • نماذج جديدة تم اختبارها: Hy4 preview

2026-08-26

2026-08-20

  • نماذج جديدة تم اختبارها: GLM 5.3

2026-08-15

  • ميزة جديدة: dots-studio/dots-3-note-preview:free أُضيف Dots3-Note Preview المجاني لاختبارات التوفر السريعة وأنماط الاستدلال.
  • ميزة جديدة: تستخدم عمليات التشغيل المحلية الآن تكلفة كهرباء تقديرية لبطاقة RTX 3090 في مقارنات التكلفة والقيمة.

2026-08-14

  • نماذج جديدة تم اختبارها: Gemini 3.7 Flash, Qwen3.8 27B
  • ميزة جديدة: أُضيف تنفيذ محلي للمعايير عبر Ollama مع توثيق مزوّد التنفيذ، ومعالجة الحوسبة المحلية غير المسعّرة، وعلامات تشغيل محلي واضحة.

2026-08-12

  • نماذج جديدة تم اختبارها: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • ميزة جديدة: أُضيفت أعداد المعلمات الموثقة بالمصادر، ومعلمات MoE النشطة، وحالة إتاحة النموذج وبنيته إلى صفحات النماذج والمقارنة، مع مرشحات جديدة للوحة الترتيب.

2026-08-08

2026-08-06

2026-08-04

  • نماذج جديدة تم اختبارها: Qwen3.8 Max

2026-08-02

  • ميزة جديدة: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • نماذج جديدة تم اختبارها: Trinity Large Thinking, Qwen3.7 Flash
  • ميزة جديدة: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • ميزة جديدة: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • تجربة الاستخدام: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-25

2026-07-24

2026-07-22

2026-07-20

  • نماذج جديدة تم اختبارها: LongCat 2.0

2026-07-18

  • نماذج جديدة تم اختبارها: Inkling

2026-07-17

  • اختبارات جديدة أُضيفت: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • نماذج جديدة تم اختبارها: Muse Spark 1.1, Kimi K3
  • ميزة جديدة: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • ميزة جديدة: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-07-02

2026-06-17

  • نماذج جديدة تم اختبارها: GLM 5.2
  • إصلاح خطأ: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • تجربة الاستخدام: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • ميزة جديدة: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • نماذج جديدة تم اختبارها: Kimi K2.7 Code
  • ميزة جديدة: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-10

2026-06-06

  • ميزة جديدة: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • ميزة جديدة: Added model-generated visual showcases to model and comparison pages.
  • ميزة جديدة: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • نماذج جديدة تم اختبارها: Nemotron 3 Ultra
  • اختبارات جديدة أُضيفت: Added a coding benchmark with executable reference cases.

2026-06-03

2026-06-01

  • نماذج جديدة تم اختبارها: MiniMax M3

2026-05-29

2026-05-27

  • ميزة جديدة: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • نماذج جديدة تم اختبارها: Qwen3.7 Max
  • اختبارات جديدة أُضيفت: تمت إضافة فئة اختبار Coding جديدة تركز على اكتشاف الأخطاء في حلول C++.

2026-05-21

  • نماذج جديدة تم اختبارها: Grok Build 0.1
  • اختبارات جديدة أُضيفت: Added a new benchmark test and improved answer judging.
  • إصلاح خطأ: تمت إزالة متغير xAI Grok Build 0.1 غير المدعوم من دون reasoning بعد أن طلب تحقق المزود تفعيل reasoning.

2026-05-10

  • نماذج جديدة تم اختبارها: Ring-2.6-1T

2026-05-08

  • اختبارات جديدة أُضيفت: Added a new benchmark test to expand suite coverage.
  • إصلاح خطأ: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • تجربة الاستخدام: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

  • نماذج جديدة تم اختبارها: Cobuddy

2026-04-30

  • نماذج جديدة تم اختبارها: Owl Alpha

2026-04-26

  • تجربة الاستخدام: حسّنا موضع قائمة المقارنة على الجوال، وجعلنا تخطيط صفحات النماذج أكثر إحكاما، وقسمنا سجل التشغيل إلى أجزاء لكل نموذج حتى تحمل الصفحات بيانات تاريخية أقل.
  • إصلاح خطأ: أصبح سجل التشغيل يجمع الآن عمليات إعادة الاختبار شبه المكررة لنفس الحزمة، ويعرض كل التشغيلات العامة في جدول مقارنة مباشر على صفحات النماذج.

2026-04-25

  • ميزة جديدة: أضفنا قياس درجة الموثوقية بحيث يتم تتبع إخفاقات واجهة API الهدف وحدود المعدل منفصلة عن الإجابات الخاطئة.

2026-04-24

  • نماذج جديدة تم اختبارها: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • إصلاح خطأ: أصبحت روابط النماذج في سجل التغييرات تشير الآن إلى صفحات النماذج الحية المعتمدة، كما أصبحت صفحات النماذج تربط بين متغيرات الاستدلال.

2026-04-23

  • نماذج جديدة تم اختبارها: Ling-2.6-1T, Hy3 preview
  • ميزة جديدة: سجل التشغيل - تعرض صفحات النماذج الآن عمليات التشغيل العامة السابقة وجدول مقارنة جنبًا إلى جنب بين التشغيلات. (صفحة نموذج مثال)
  • تجربة الاستخدام: يدعم ترتيب النتائج الآن ترقيم الصفحات والفلاتر المعتمدة على URL وإجراءات المقارنة المباشرة من قائمة الترتيب.
  • إصلاح خطأ: أصبح البحث في الصفحة الرئيسية وعدادات الفلاتر وحالة ترقيم الصفحات متسقًا الآن عبر كامل مجموعة البيانات.
  • إعادة اختبار: GLM 5.1 تمت إعادة تشغيل مجموعة benchmark الكاملة وتنظيف اللقطة العامة لسجل التشغيل لهذا النموذج.
  • إصلاح خطأ: تم منع النماذج غير المعاد اختبارها فعليًا من الحصول على طابع زمني tested_at جديد.

2026-04-20

  • نماذج جديدة تم اختبارها: Kimi K2.6

2026-04-14

2026-04-11

  • نماذج جديدة تم اختبارها: GLM 5.1

2026-03-21

2026-03-20

  • نماذج جديدة تم اختبارها: Mimo V2 PRO

2026-03-18

  • نماذج جديدة تم اختبارها: MiniMax M2.7
  • ميزة جديدة: Added input and output pricing metrics to model and comparison pages.

2026-03-15

  • نماذج جديدة تم اختبارها: GLM 5 Turbo

2026-03-06

  • ميزة جديدة: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-04

  • نماذج جديدة تم اختبارها: GPT-5.2 Chat, GPT 5.3 Chat
  • ميزة جديدة: Added interactive comparison charts for direct model analysis.
  • اختبارات جديدة أُضيفت: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • ميزة جديدة: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • نماذج جديدة تم اختبارها: Seed-2.0-Mini
  • ميزة جديدة: Added reasoning-quality and consistency charts to model comparisons.

2026-02-24

تم إنشاء صفحة سجل التغييرات

بدأ هذا السجل بعد الإطلاق، لذلك بعض التحديثات الأقدم غير موجودة هنا.