AI BENCHY
Advertise here

পরিবর্তনপঞ্জি

তারিখ অনুযায়ী সাজানো পণ্য ও বেঞ্চমার্ক আপডেটের একটি সহজ লগ। এখানে নতুনভাবে পরীক্ষিত মডেল, পুনঃপরীক্ষা, বেঞ্চমার্ক পরিবর্তন এবং প্রকাশিত UX/পণ্য কাজ নথিভুক্ত করা হয়।

2026-09-05

  • নতুন ফিচার: SVG উদাহরণ ছবি হিসেবে কপি করুন বা ওয়াটারমার্কসহ PNG ডাউনলোড করুন। প্রিভিউতে এখন মডেলের র‍্যাঙ্ক দেখা যায়।
  • বাগ ফিক্স: বৈধ SVG উদাহরণ পুনরুদ্ধার করা হয়েছে এবং সময়সীমা অতিক্রমের ত্রুটি স্পষ্ট করা হয়েছে।

2026-09-04

  • নতুন পরীক্ষিত মডেল: GPT-6 Astra

2026-08-29

  • নতুন পরীক্ষিত মডেল: Hy4 preview

2026-08-26

  • নতুন পরীক্ষিত মডেল: GLM 5.3 Flash

2026-08-20

  • নতুন পরীক্ষিত মডেল: GLM 5.3

2026-08-15

  • নতুন ফিচার: dots-studio/dots-3-note-preview:free উপলভ্যতা ও রিজনিং মোডের দ্রুত পরীক্ষার জন্য Dots3-Note Preview (ফ্রি) যোগ করা হয়েছে।
  • নতুন ফিচার: স্থানীয় রানের খরচ ও মূল্য তুলনায় এখন RTX 3090-এর আনুমানিক বিদ্যুৎ খরচ ব্যবহার করা হয়।

2026-08-14

  • নতুন পরীক্ষিত মডেল: Gemini 3.7 Flash, Qwen3.8 27B
  • নতুন ফিচার: Ollama দিয়ে স্থানীয় বেঞ্চমার্ক চালনা, প্রদানকারীর উৎস, মূল্যহীন স্থানীয় কম্পিউটের সঠিক ব্যবস্থাপনা এবং স্পষ্ট স্থানীয় চালনা ট্যাগ যোগ করা হয়েছে।

2026-08-12

  • নতুন পরীক্ষিত মডেল: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • নতুন ফিচার: মডেল ও তুলনা পৃষ্ঠায় উৎস-সমর্থিত প্যারামিটার সংখ্যা, সক্রিয় MoE প্যারামিটার, মডেলের উপলভ্যতা ও আর্কিটেকচারের তথ্য এবং লিডারবোর্ডে নতুন ফিল্টার যোগ করা হয়েছে।

2026-08-08

  • নতুন পরীক্ষিত মডেল: Ling 3.0 Tiny

2026-08-06

2026-08-04

  • নতুন পরীক্ষিত মডেল: Qwen3.8 Max

2026-08-02

  • নতুন ফিচার: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • নতুন পরীক্ষিত মডেল: Trinity Large Thinking, Qwen3.7 Flash
  • নতুন ফিচার: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • নতুন ফিচার: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-25

  • নতুন পরীক্ষিত মডেল: Claude Opus 5

2026-07-24

2026-07-22

  • নতুন পরীক্ষিত মডেল: Laguna S 2.1

2026-07-20

  • নতুন পরীক্ষিত মডেল: LongCat 2.0

2026-07-18

  • নতুন পরীক্ষিত মডেল: Inkling

2026-07-17

  • নতুন পরীক্ষা যোগ হয়েছে: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • নতুন পরীক্ষিত মডেল: Muse Spark 1.1, Kimi K3
  • নতুন ফিচার: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • নতুন ফিচার: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-07-02

  • নতুন পরীক্ষিত মডেল: Laguna XS 2.1

2026-06-30

2026-06-18

2026-06-17

  • নতুন পরীক্ষিত মডেল: GLM 5.2
  • বাগ ফিক্স: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • নতুন ফিচার: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • নতুন পরীক্ষিত মডেল: Kimi K2.7 Code
  • নতুন ফিচার: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-10

2026-06-06

  • নতুন ফিচার: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • নতুন ফিচার: Added model-generated visual showcases to model and comparison pages.
  • নতুন ফিচার: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • নতুন পরীক্ষিত মডেল: Nemotron 3 Ultra
  • নতুন পরীক্ষা যোগ হয়েছে: Added a coding benchmark with executable reference cases.

2026-06-03

  • নতুন পরীক্ষিত মডেল: Qwen3.7 Plus

2026-06-01

  • নতুন পরীক্ষিত মডেল: MiniMax M3

2026-05-29

2026-05-28

2026-05-27

  • নতুন ফিচার: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • নতুন পরীক্ষিত মডেল: Qwen3.7 Max
  • নতুন পরীক্ষা যোগ হয়েছে: C++ সমাধানে বাগ খোঁজার উপর দৃষ্টি নিবদ্ধ করে একটি নতুন Coding পরীক্ষা বিভাগ যোগ করা হয়েছে।

2026-05-21

  • নতুন পরীক্ষিত মডেল: Grok Build 0.1
  • নতুন পরীক্ষা যোগ হয়েছে: Added a new benchmark test and improved answer judging.
  • বাগ ফিক্স: প্রোভাইডার যাচাইকরণে reasoning প্রয়োজন হওয়ার পর xAI Grok Build 0.1-এর অসমর্থিত no-reasoning ভ্যারিয়েন্ট সরানো হয়েছে।

2026-05-20

2026-05-10

  • নতুন পরীক্ষিত মডেল: Ring-2.6-1T

2026-05-08

  • নতুন পরীক্ষা যোগ হয়েছে: Added a new benchmark test to expand suite coverage.
  • বাগ ফিক্স: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

  • নতুন পরীক্ষিত মডেল: Cobuddy

2026-04-30

  • নতুন পরীক্ষিত মডেল: Owl Alpha

2026-04-26

  • UX: মোবাইলে তুলনা ড্রপডাউনের অবস্থান উন্নত করা হয়েছে, মডেল পেজের লেআউট আরও ঘন করা হয়েছে, এবং রান ইতিহাস প্রতি-মডেল শার্ডে ভাগ করা হয়েছে যাতে পেজ কম ঐতিহাসিক ডেটা লোড করে।
  • বাগ ফিক্স: রান ইতিহাস এখন একই suite-এর কাছাকাছি-ডুপ্লিকেট পুনঃপরীক্ষাগুলো একত্র করে এবং মডেল পেজে সব পাবলিক রান সরাসরি তুলনা টেবিলে দেখায়।

2026-04-25

  • নতুন ফিচার: নির্ভরযোগ্যতা স্কোর টেলিমেট্রি যোগ করা হয়েছে, যাতে লক্ষ্য API ও রেট-লিমিট ব্যর্থতা ভুল উত্তরের থেকে আলাদাভাবে ট্র্যাক হয়।

2026-04-24

  • নতুন পরীক্ষিত মডেল: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • বাগ ফিক্স: চেঞ্জলগের মডেল লিংকগুলো এখন ক্যানোনিকাল লাইভ মডেল পেজে যায়, আর মডেল পেজগুলো এখন reasoning variantগুলোর মধ্যেও একে অপরকে লিংক করে।

2026-04-23

  • নতুন পরীক্ষিত মডেল: Ling-2.6-1T, Hy3 preview
  • নতুন ফিচার: রান ইতিহাস - মডেল পেজ এখন ঐতিহাসিক public run এবং পাশাপাশি run comparison টেবিল দেখায়। (উদাহরণ মডেল পেজ)
  • UX: লিডারবোর্ড এখন URL-ভিত্তিক pagination, filters এবং ranking list থেকে সরাসরি compare action সমর্থন করে।
  • বাগ ফিক্স: হোমপেজের search, filter count এবং pagination state এখন পুরো dataset জুড়ে একসঙ্গত থাকে।
  • পুনঃপরীক্ষা: GLM 5.1 এই মডেলের জন্য পুরো benchmark suite আবার চালানো হয়েছে এবং public run-history snapshot পরিষ্কার করা হয়েছে।
  • বাগ ফিক্স: যেসব মডেল আসলে retest করা হয়নি, তাদের নতুন tested_at timestamp দেওয়া বন্ধ করা হয়েছে।

2026-04-20

  • নতুন পরীক্ষিত মডেল: Kimi K2.6

2026-04-16

2026-04-14

2026-04-11

  • নতুন পরীক্ষিত মডেল: GLM 5.1

2026-04-04

2026-03-21

  • নতুন পরীক্ষিত মডেল: Mimo V2 Omni

2026-03-20

  • নতুন পরীক্ষিত মডেল: Mimo V2 PRO

2026-03-18

  • নতুন পরীক্ষিত মডেল: MiniMax M2.7
  • নতুন ফিচার: Added input and output pricing metrics to model and comparison pages.

2026-03-15

  • নতুন পরীক্ষিত মডেল: GLM 5 Turbo

2026-03-06

  • নতুন ফিচার: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-05

2026-03-04

  • নতুন পরীক্ষিত মডেল: GPT-5.2 Chat, GPT 5.3 Chat
  • নতুন ফিচার: Added interactive comparison charts for direct model analysis.
  • নতুন পরীক্ষা যোগ হয়েছে: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • নতুন ফিচার: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • নতুন পরীক্ষিত মডেল: Seed-2.0-Mini
  • নতুন ফিচার: Added reasoning-quality and consistency charts to model comparisons.

2026-02-24

  • নতুন পরীক্ষিত মডেল: GPT-5.3-Codex

চেঞ্জলগ পেজ তৈরি হয়েছে

এই চেঞ্জলগ চালুর পরে শুরু হয়েছে, তাই কিছু পুরোনো আপডেট এখানে নেই।