Peringkat Gabungan
Lihat model AI mana yang paling baik di Gabungan, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Total Biaya ↑.
Alasan kegagalan
Dengan alasan kegagalan Pemanggilan alat tidak valid91 Dengan alasan kegagalan Jawaban salah69 Dengan alasan kegagalan Tidak ada jawaban32 Dengan alasan kegagalan Kesalahan API26 Dengan alasan kegagalan Kedaluwarsa5 Dengan alasan kegagalan Format tambahan1 Dengan alasan kegagalan Tidak mengikuti instruksi1
216/216
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Gabungan | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #49 | DeepSeek V4 Flash high | DeepSeek | 6.4 | 7.7 | $0.041 | 1/2 | 104.1s |
| #147 | GLM 5 none | Z.ai | 1.5 | 5.7 | $0.041 | 0/1 | 4.98s |
| #186 | GPT-5.4 Nano none | OpenAI | 3.0 | 4.8 | $0.041 | 0/2 | 14.7s |
| #164 | KAT-Coder-Air V2.5 low | Kwaipilot | 6.4 | 5.4 | $0.041 | 1/2 | 55.9s |
| #156 | DeepSeek V4 Flash none | DeepSeek | 4.6 | 5.6 | $0.042 | 0/2 | 179.6s |
| #119 | MiMo-V2-Flash medium | Xiaomi | 4.9 | 6.3 | $0.043 | 1/1 | 75.7s |
| #117 | LongCat 2.0 none | Meituan | 6.5 | 6.3 | $0.044 | 1/2 | 28.4s |
| #153 | Mimo V2 PRO none | Xiaomi | 1.5 | 5.6 | $0.045 | 0/1 | 6.58s |
| #128 | Gemini 3.1 Flash Lite none | 3.0 | 6.1 | $0.046 | 0/2 | 9.49s | |
| #176 | GLM 5 Turbo none | Z.ai | 1.5 | 5.1 | $0.047 | 0/1 | 4.89s |
| #126 | Gemini 3.1 Flash Lite minimal | 3.0 | 6.1 | $0.047 | 0/2 | 7.75s | |
| #141 | Hy3 preview high | Tencent | 5.0 | 5.9 | $0.048 | 1/1 | 113.1s |
| #155 | KAT-Coder-Air V2.5 medium | Kwaipilot | 6.5 | 5.6 | $0.048 | 1/2 | 19.6s |
| #151 | GLM 5V Turbo none | Z.ai | 1.5 | 5.6 | $0.052 | 0/1 | 6.51s |
| #112 | Gemini 3.1 Flash Lite Preview none | 3.0 | 6.4 | $0.052 | 0/2 | 6.23s |