Peringkat Gabungan
Lihat model AI mana yang paling baik di Gabungan, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Metrik ↑.
Alasan kegagalan
Dengan alasan kegagalan Pemanggilan alat tidak valid91 Dengan alasan kegagalan Jawaban salah68 Dengan alasan kegagalan Tidak ada jawaban29 Dengan alasan kegagalan Kesalahan API26 Dengan alasan kegagalan Kedaluwarsa5 Dengan alasan kegagalan Format tambahan1 Dengan alasan kegagalan Tidak mengikuti instruksi1
210/210
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Gabungan | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #184 | Hunter Alpha medium | OpenRouter | 2.3 | 4.7 | $0.000 | 0/1 | 30.5s |
| #117 | GPT-5.6 Luna low | OpenAI | 2.8 | 6.2 | $0.249 | 0/2 | 13.7s |
| #151 | GLM 5.1 none | Z.ai | 2.8 | 5.5 | $0.164 | 0/2 | 46.9s |
| #155 | Kimi K2.5 none | Moonshot AI | 2.8 | 5.5 | $0.127 | 0/2 | 61.0s |
| #194 | GLM 4.7 Flash medium | Z.ai | 2.9 | 4.3 | $0.166 | 0/2 | 802.8s |
| #110 | Gemma 4 31B medium | 2.9 | 6.3 | $0.163 | 0/2 | 433.1s | |
| #123 | Inkling low | Thinkingmachines | 2.9 | 6.1 | $0.187 | 0/2 | 22.7s |
| #125 | Qwen3.5-Flash none | Qwen | 2.9 | 6.1 | $0.073 | 0/2 | 243.6s |
| #132 | GPT-5.6 Terra none | OpenAI | 2.9 | 6.0 | $0.349 | 0/2 | 7.02s |
| #137 | North Mini Code medium | Cohere | 2.9 | 5.9 | $0.000 | 0/2 | 554.9s |
| #164 | Inkling none | Thinkingmachines | 2.9 | 5.2 | $0.147 | 0/2 | 25.7s |
| #61 | Gemini 3 Flash Preview low | 3.0 | 7.4 | $0.177 | 0/2 | 10.2s | |
| #79 | Gemini 3.5 Flash none | 3.0 | 7.0 | $1.079 | 0/2 | 0ms | |
| #88 | Gemini 3.5 Flash minimal | 3.0 | 6.8 | $0.300 | 0/2 | 14.4s | |
| #90 | Qwen3.6 35B A3B medium | Qwen | 3.0 | 6.7 | $0.746 | 0/2 | 817.6s |