Leaderboard AI Benchy
Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-09-02
Model Dievaluasi: 305
Model rekomendasi
305/305
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Skor Skor rata-rata di semua tes benchmark. | Perusahaan | Total Biaya | Waktu respons (rata-rata) Waktu respons (rata-rata) | Tes benar Menampilkan berapa tes yang lulus penuh (semua run lulus). |
|---|---|---|---|---|---|---|
| #305#305 | LFM2-24B-A2BnoneModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru. | 2.2… | Liquid | $0.001 … | 782ms… | Tes dianggap lulus penuh hanya jika semua run-nya lulus. Jawaban salah: 9 Kesalahan API: 4 Tidak mengikuti instruksi: 1 Waktu respons (rata-rata)782ms Waktu respons (maks)3.15s Waktu respons (total)10.94s … |
|
||||||
| #303#303 | Nemotron 3 Nano Omni 30b A3b ReasoningnoneModel diarsipkan: model ini tidak lagi diperbarui atau diuji pada pengujian baru. | 3.2… | NVIDIA | $0.000 … | 728ms… | Tes dianggap lulus penuh hanya jika semua run-nya lulus. Jawaban salah: 9 Kesalahan API: 6 Tidak mengikuti instruksi: 2 Waktu respons (rata-rata)728ms Waktu respons (maks)2.21s Waktu respons (total)9.47s … |
|
||||||
| #279#279 | Laguna S 2.1none | 4.5… | Poolside | $0.022 ↓ … | 11.67s… | Tes dianggap lulus penuh hanya jika semua run-nya lulus. Jawaban salah: 18 Tidak mengikuti instruksi: 1 Tidak ada jawaban: 1 Waktu respons (rata-rata)11.67s Waktu respons (maks)200.52s Waktu respons (total)256.71s … |
|
||||||
| #291#291 | Ling 3.0 Tinynone | 4.0… | Inclusionai | $0.000 … | 14.02s… | Tes dianggap lulus penuh hanya jika semua run-nya lulus. Jawaban salah: 13 Tidak mengikuti instruksi: 4 Kesalahan API: 1 Format tambahan: 1 Pemanggilan alat tidak valid: 1 Waktu respons (rata-rata)14.02s Waktu respons (maks)240.61s Waktu respons (total)294.46s … |
Jawaban salah: 13 Tidak mengikuti instruksi: 4 Kesalahan API: 1 Format tambahan: 1 Pemanggilan alat tidak valid: 1
|
||||||
| #292#292 | Granite 4.1 8Bnone | 4.0… | IBM Granite | $0.007 … | 1.44s… | Tes dianggap lulus penuh hanya jika semua run-nya lulus. Jawaban salah: 13 Tidak mengikuti instruksi: 4 Pemanggilan alat tidak valid: 2 Format tambahan: 1 Waktu respons (rata-rata)1.44s Waktu respons (maks)16.67s Waktu respons (total)31.75s … |
|
||||||
Tren benchmark global
Lihat bagaimana model saat ini menyeimbangkan skor, biaya, kecepatan, panjang output, dan kekuatan per kategori.
Perkembangan skor terbaik perusahaan terdepan
Frontier Pareto: kecerdasan vs kecepatan respons
Frontier Pareto Skor vs Token Output
Tingkat kesulitan kategori lintas model
Perbandingan Cepat
Gemini 3.6 FlashhighvsGemini 3.7 FlashhighGemini 3.7 FlashhighvsGemini 3.6 FlashmediumGemini 3.6 FlashmediumvsGPT-5.6 SollowGPT-5.6 SollowvsGemini 3 Flash PreviewmediumGemini 3 Flash PreviewmediumvsGemini 3.5 FlashhighGemini 3.5 FlashhighvsGemini 3.7 FlashmediumGemini 3.7 FlashmediumvsGPT-5.6 SolmediumGPT-5.6 SolmediumvsGPT-5.6 SolhighGPT-5.6 SolhighvsGPT-5.5lowGPT-5.5lowvsGrok 4.6highGrok 4.6highvsGemini 3.1 Pro PreviewmediumGemini 3.1 Pro PreviewmediumvsGemini 3.7 Flashlow