AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Catatan perubahan

Log sederhana untuk pembaruan produk dan benchmark, dikelompokkan berdasarkan tanggal. Kami menggunakannya untuk mencatat model yang baru diuji, uji ulang, perubahan benchmark, dan pekerjaan UX/produk yang sudah dirilis.

2026-09-05

  • Fitur baru: Salin contoh SVG sebagai gambar atau unduh PNG dengan tanda air. Pratinjau kini menampilkan peringkat model.
  • Perbaikan bug: Contoh SVG yang valid dipulihkan dan pesan kesalahan batas waktu diperjelas.

2026-08-20

2026-08-15

  • Fitur baru: dots-studio/dots-3-note-preview:free Menambahkan Dots3-Note Preview (gratis) untuk uji singkat ketersediaan dan mode penalaran.
  • Fitur baru: Proses lokal kini memakai perkiraan biaya listrik RTX 3090 dalam perbandingan biaya dan nilai.

2026-08-14

  • Model baru yang diuji: Gemini 3.7 Flash, Qwen3.8 27B
  • Fitur baru: Menambahkan benchmark lokal melalui Ollama, asal penyedia, penanganan komputasi lokal tanpa harga, dan label Proses lokal yang jelas.

2026-08-12

  • Model baru yang diuji: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • Fitur baru: Menambahkan jumlah parameter beserta sumbernya, parameter MoE aktif, ketersediaan, dan arsitektur pada halaman model dan perbandingan, serta filter papan peringkat baru.

2026-08-02

  • Fitur baru: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • Model baru yang diuji: Trinity Large Thinking, Qwen3.7 Flash
  • Fitur baru: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • Fitur baru: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-18

2026-07-17

  • Tes baru ditambahkan: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • Model baru yang diuji: Muse Spark 1.1, Kimi K3
  • Fitur baru: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • Fitur baru: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-06-17

  • Model baru yang diuji: GLM 5.2
  • Perbaikan bug: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • Fitur baru: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • Model baru yang diuji: Kimi K2.7 Code
  • Fitur baru: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-06

  • Fitur baru: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • Fitur baru: Added model-generated visual showcases to model and comparison pages.
  • Fitur baru: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • Model baru yang diuji: Nemotron 3 Ultra
  • Tes baru ditambahkan: Added a coding benchmark with executable reference cases.

2026-05-27

  • Fitur baru: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • Model baru yang diuji: Qwen3.7 Max
  • Tes baru ditambahkan: Menambahkan kategori tes Coding baru yang berfokus pada pencarian bug dalam solusi C++.

2026-05-21

  • Model baru yang diuji: Grok Build 0.1
  • Tes baru ditambahkan: Added a new benchmark test and improved answer judging.
  • Perbaikan bug: Menghapus varian xAI Grok Build 0.1 tanpa reasoning yang tidak didukung setelah validasi penyedia mewajibkan reasoning.

2026-05-08

  • Tes baru ditambahkan: Added a new benchmark test to expand suite coverage.
  • Perbaikan bug: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

2026-04-30

2026-04-26

  • UX: Memperbaiki posisi dropdown perbandingan di seluler, merapikan tata letak halaman model, dan membagi riwayat run menjadi shard per model agar halaman memuat lebih sedikit data historis.
  • Perbaikan bug: Riwayat run kini mengelompokkan retest suite yang hampir duplikat dan menampilkan semua run publik dalam tabel perbandingan langsung di halaman model.

2026-04-25

  • Fitur baru: Menambahkan telemetri keandalan agar kegagalan API target dan batas laju dilacak terpisah dari jawaban salah.

2026-04-24

  • Model baru yang diuji: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • Perbaikan bug: Tautan model di changelog kini mengarah ke halaman model live kanonis, dan halaman model kini juga saling menautkan antar varian penalaran.

2026-04-23

  • Model baru yang diuji: Ling-2.6-1T, Hy3 preview
  • Fitur baru: Riwayat run - Halaman model kini menampilkan run publik historis dan tabel perbandingan run berdampingan. (Halaman model contoh)
  • UX: Leaderboard kini mendukung pagination dan filter berbasis URL, serta aksi compare langsung dari daftar peringkat.
  • Perbaikan bug: Pencarian homepage, jumlah filter, dan state pagination kini tetap konsisten di seluruh dataset.
  • Uji ulang: GLM 5.1 Suite benchmark lengkap dijalankan ulang dan snapshot publik riwayat run untuk model ini dibersihkan.
  • Perbaikan bug: Model yang sebenarnya tidak diuji ulang tidak lagi menerima timestamp tested_at baru.

2026-04-20

2026-04-11

2026-03-18

  • Model baru yang diuji: MiniMax M2.7
  • Fitur baru: Added input and output pricing metrics to model and comparison pages.

2026-03-06

  • Fitur baru: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-04

  • Model baru yang diuji: GPT-5.2 Chat, GPT 5.3 Chat
  • Fitur baru: Added interactive comparison charts for direct model analysis.
  • Tes baru ditambahkan: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • Fitur baru: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • Model baru yang diuji: Seed-2.0-Mini
  • Fitur baru: Added reasoning-quality and consistency charts to model comparisons.

Halaman changelog dibuat

Changelog ini dimulai setelah peluncuran, jadi beberapa pembaruan lama tidak tercantum di sini.