Peringkat Gabungan
Lihat model AI mana yang paling baik di Gabungan, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Waktu respons (rata-rata) ↑.
Alasan kegagalan
Dengan alasan kegagalan Pemanggilan alat tidak valid147 Dengan alasan kegagalan Jawaban salah95 Dengan alasan kegagalan Tidak ada jawaban43 Dengan alasan kegagalan Kesalahan API37 Dengan alasan kegagalan Kedaluwarsa9 Dengan alasan kegagalan Format tambahan1 Dengan alasan kegagalan Tidak mengikuti instruksi1
311/311
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Gabungan | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #125 | Solar Pro 4 high | Upstage | 7.3 | 7.1 | $0.046 | 1/2 | 167.4s |
| #94 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 6.9 | 7.5 | $0.459 | 1/2 | 175.8s |
| #129 | GLM 5.1 medium | Z.ai | 9.8 | 7.0 | $0.727 | 2/2 | 175.9s |
| #40 | Qwen3.6 Max Preview medium | Qwen | 7.3 | 8.6 | $1.132 | 1/2 | 177.5s |
| #233 | DeepSeek V4 Flash 0423 none | DeepSeek | 4.6 | 5.4 | $0.037 | 0/2 | 179.6s |
| #301 | Ling 3.0 Tiny high | Inclusionai | 3.0 | 3.8 | $0.000 | 0/2 | 179.9s |
| #151 | KAT-Coder-Pro V2.5 none | Kwaipilot | 4.1 | 6.7 | $0.487 | 0/2 | 183.1s |
| #48 | Qwen3.8 27B high | Qwen | 10.0 | 8.4 | ~$0.287 | 2/2 | 185.6s |
| #70 | Qwen3.7 Plus medium | Qwen | 8.2 | 7.9 | $0.277 | 1/2 | 190.3s |
| #256 | Qwen3.5-9B none | Qwen | 3.0 | 5.1 | $0.021 | 0/2 | 194.0s |
| #239 | DeepSeek V4 Flash 0731 none | DeepSeek | 3.7 | 5.4 | $0.011 | 0/2 | 202.4s |
| #87 | Solar Pro 4 xhigh | Upstage | 10.0 | 7.6 | $0.050 | 2/2 | 202.5s |
| #120 | Qwen3.7 Flash low | Qwen | 6.4 | 7.2 | $0.043 | 1/2 | 217.8s |
| #166 | Laguna XS 2.1 medium | Poolside | 6.3 | 6.5 | $0.068 | 1/2 | 218.1s |
| #88 | Nemotron 3 Ultra medium | NVIDIA | 6.3 | 7.6 | $0.567 | 1/2 | 218.2s |