Peringkat Tugas agen
Lihat model AI mana yang paling baik di Tugas agen, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Waktu respons (rata-rata) ↓.
380/380
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Tugas agen | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #76 | GPT-5.6 Terra high | OpenAI | 10.0 | 8.3 | $1.116 | 1/1 | 66.4s |
| #79 | GPT-6 Luna medium | OpenAI | 10.0 | 8.3 | $0.047 | 1/1 | 66.4s |
| #200 | Laguna XS 2.1 medium | Poolside | 6.1 | 6.4 | $0.083 | 0/1 | 66.4s |
| #239 | MiMo-V2.6-Pro none | Xiaomi | 5.0 | 6.0 | $0.193 | 0/1 | 66.1s |
| #72 | Inkling high | Thinkingmachines | 10.0 | 8.4 | $1.250 | 1/1 | 66.0s |
| #284 | Qwen3.6 35B A3B none | Qwen | 5.2 | 5.3 | $0.105 | 0/1 | 65.6s |
| #1 | Gemini 3.6 Flash high | 10.0 | 9.9 | $1.512 | 1/1 | 65.6s | |
| #129 | DeepSeek V4 Pro 0423 none | DeepSeek | 10.0 | 7.4 | $0.311 | 1/1 | 65.5s |
| #310 | Hy4 preview none | Tencent | 5.0 | 4.9 | $0.161 | 0/1 | 65.5s |
| #104 | Grok 4.5 medium | X AI | 5.0 | 7.8 | $2.454 | 0/1 | 65.2s |
| #167 | Claude Opus 4.8 none | Anthropic | 5.0 | 6.9 | $2.334 | 0/1 | 65.1s |
| #246 | Claude Sonnet 5 none | Anthropic | 4.7 | 5.9 | $1.095 | 0/1 | 64.7s |
| #87 | DeepSeek V4 Pro 0423 high | DeepSeek | 10.0 | 8.1 | $0.556 | 1/1 | 64.5s |
| #120 | Seed-2.0-Mini medium | Bytedance Seed | 10.0 | 7.5 | $0.140 | 1/1 | 64.5s |
| #24 | Claude Opus 5.5 high | Anthropic | 10.0 | 9.4 | $2.133 | 1/1 | 64.4s |