Peringkat Tugas agen
Lihat model AI mana yang paling baik di Tugas agen, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Tes benar ↓.
380/380
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Tugas agen | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #83 | GLM 5.2 medium | Z.ai | 10.0 | 8.2 | $0.398 | 1/1 | 102.4s |
| #84 | GPT-5.6 Terra medium | OpenAI | 10.0 | 8.2 | $0.744 | 1/1 | 54.7s |
| #85 | Seed-2.0-Lite medium | Bytedance Seed | 10.0 | 8.2 | $0.271 | 1/1 | 69.3s |
| #86 | Seed-2.0-Code low | Bytedance Seed | 10.0 | 8.1 | $0.881 | 1/1 | 90.2s |
| #87 | DeepSeek V4 Pro 0423 high | DeepSeek | 10.0 | 8.1 | $0.556 | 1/1 | 64.5s |
| #89 | DeepSeek V4 Flash 0423 high | DeepSeek | 10.0 | 8.1 | $0.056 | 1/1 | 148.1s |
| #91 | GPT-5.6 Luna high | OpenAI | 10.0 | 8.0 | $0.207 | 1/1 | 60.2s |
| #92 | Nemotron 3 Ultra medium | NVIDIA | 10.0 | 8.0 | $0.762 | 1/1 | 188.1s |
| #93 | GPT-5.4 Nano medium | OpenAI | 10.0 | 8.0 | $0.187 | 1/1 | 74.0s |
| #95 | GPT-5.6 Terra low | OpenAI | 10.0 | 7.9 | $0.645 | 1/1 | 54.6s |
| #96 | Qwen3.5-27B medium | Qwen | 10.0 | 7.9 | $1.135 | 1/1 | 146.5s |
| #99 | GPT-5.4 Mini medium | OpenAI | 10.0 | 7.9 | $1.008 | 1/1 | 100.7s |
| #100 | Qwen3.7 Max none | Qwen | 10.0 | 7.9 | $0.492 | 1/1 | 80.3s |
| #102 | Qwen3.8 2.4T A95B high | Qwen | 10.0 | 7.9 | $2.805 | 1/1 | 127.1s |
| #103 | MiMo-V2.6-Flash medium | Xiaomi | 10.0 | 7.9 | $0.218 | 1/1 | 90.1s |