Peringkat Tugas agen
Lihat model AI mana yang paling baik di Tugas agen, mana yang tetap andal, dan di mana kesenjangan terbesar muncul.
380/380
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Tugas agen | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #222 | Trinity Large Thinking low | Arcee AI | 7.4 | 6.3 | $0.700 | 0/1 | 63.2s |
| #250 | DeepSeek V4.1 Flash none | DeepSeek | 7.4 | 5.8 | $0.123 | 0/1 | 55.8s |
| #63 | Qwen3.8 Max (0902) low | Qwen | 6.1 | 8.6 | $1.131 | 0/1 | 136.0s |
| #67 | Qwen3.7 Max medium | Qwen | 6.1 | 8.5 | $2.046 | 0/1 | 137.0s |
| #80 | Claude Opus 4.8 medium | Anthropic | 6.1 | 8.3 | $3.490 | 0/1 | 99.4s |
| #90 | DeepSeek V4.1 Flash low | DeepSeek | 6.1 | 8.0 | $0.153 | 0/1 | 56.0s |
| #97 | GLM 5.3 FlashX max | Z.ai | 6.1 | 7.9 | $0.623 | 0/1 | 104.8s |
| #117 | Qwen3.8 27B low | Qwen | 6.1 | 7.6 | ~$0.089 | 0/1 | 211.3s |
| #140 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 6.1 | 7.2 | $0.567 | 0/1 | 186.4s |
| #142 | Gemini 3.8 Flash low | 6.1 | 7.2 | $0.323 | 0/1 | 67.2s | |
| #145 | LongCat 2.0 medium | Meituan | 6.1 | 7.2 | $0.593 | 0/1 | 174.1s |
| #158 | Qwen3.5-122B-A10B medium | Qwen | 6.1 | 7.0 | $1.152 | 0/1 | 95.3s |
| #161 | Muse Glimmer 30B low | Meta | 6.1 | 6.9 | $0.266 | 0/1 | 105.0s |
| #163 | Ember-1 high | Fireworks | 6.1 | 6.9 | $2.405 | 0/1 | 88.3s |
| #173 | Space Bunny Alpha max | Stealth | 6.1 | 6.7 | $0.000 | 0/1 | 90.6s |