Peringkat Gabungan
Lihat model AI mana yang paling baik di Gabungan, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Total Biaya ↓.
Alasan kegagalan
Dengan alasan kegagalan Pemanggilan alat tidak valid96 Dengan alasan kegagalan Jawaban salah71 Dengan alasan kegagalan Tidak ada jawaban33 Dengan alasan kegagalan Kesalahan API26 Dengan alasan kegagalan Kedaluwarsa5 Dengan alasan kegagalan Format tambahan1 Dengan alasan kegagalan Tidak mengikuti instruksi1
220/220
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Gabungan | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #210 | MiMo-V2-Flash none | Xiaomi | 1.5 | 4.0 | $0.025 | 0/1 | 2.87s |
| #174 | Qwen3 Coder Next none | Qwen | 3.0 | 5.1 | $0.025 | 0/2 | 30.9s |
| #200 | Laguna S 2.1 none | Poolside | 2.9 | 4.5 | $0.025 | 0/2 | 21.6s |
| #173 | Mistral Small 4 none | Mistral | 3.0 | 5.1 | $0.022 | 0/2 | 7.44s |
| #163 | Mimo V2 Omni none | Xiaomi | 1.5 | 5.5 | $0.021 | 0/1 | 5.96s |
| #177 | Qwen3.5-9B none | Qwen | 3.0 | 5.1 | $0.021 | 0/2 | 194.0s |
| #121 | Gemma 4 31B none | 3.8 | 6.2 | $0.021 | 0/2 | 30.0s | |
| #219 | Step 3.5 Flash none | Stepfun | 1.5 | 2.3 | $0.020 | 0/1 | 0ms |
| #127 | gpt-oss-120b medium | OpenAI | 6.5 | 6.1 | $0.019 | 1/2 | 24.0s |
| #106 | Hy3 preview medium | Tencent | 5.0 | 6.5 | $0.018 | 1/1 | 46.0s |
| #124 | Gemini 2.5 Flash none | 3.0 | 6.2 | $0.017 | 0/2 | 61.2s | |
| #185 | GLM 4.7 Flash none | Z.ai | 3.0 | 4.9 | $0.016 | 0/2 | 50.2s |
| #170 | Ling-2.6-1T none | Inclusionai | 6.5 | 5.3 | $0.016 | 1/2 | 23.8s |
| #208 | Laguna Xs.2 medium | Poolside | 1.5 | 4.1 | $0.015 | 0/1 | 15.9s |
| #159 | Hy3 preview low | Tencent | 5.0 | 5.5 | $0.015 | 1/1 | 78.7s |