Peringkat Tugas agen
Lihat model AI mana yang paling baik di Tugas agen, mana yang tetap andal, dan di mana kesenjangan terbesar muncul. Urutkan berdasarkan: Tes benar ↓.
380/380
Filter model
Tidak ada model yang cocok dengan pencarian dan filter saat ini.
| Peringkat | Model | Perusahaan | Skor Tugas agen | Skor | Total Biaya | Tes benar | Waktu respons (rata-rata) |
|---|---|---|---|---|---|---|---|
| #124 | DeepSeek V4 Flash 0731 low | DeepSeek | 4.7 | 7.4 | $0.307 | 0/1 | 321.2s |
| #127 | Grok 4.7 low | X AI | 5.0 | 7.4 | $2.263 | 0/1 | 154.9s |
| #128 | Inkling Small high | Thinkingmachines | 3.0 | 7.4 | $0.402 | 0/1 | 23ms |
| #130 | Inkling medium | Thinkingmachines | 4.7 | 7.4 | $0.540 | 0/1 | 45.9s |
| #132 | GLM 5.3 Flash high | Z.ai | 7.4 | 7.3 | $0.084 | 0/1 | 111.5s |
| #133 | Claude Fable 5.1 medium | Anthropic | 3.0 | 7.3 | $3.197 | 0/1 | 16.2s |
| #134 | Grok 4.7 medium | X AI | 3.9 | 7.3 | $3.501 | 0/1 | 372.1s |
| #135 | Gemini 2.5 Flash medium | 3.0 | 7.3 | $0.644 | 0/1 | 6.54s | |
| #137 | Qwen3.6 Plus medium | Qwen | 4.7 | 7.3 | $0.391 | 0/1 | 307.1s |
| #138 | Gemini 3.5 Flash Lite medium | 4.7 | 7.3 | $0.440 | 0/1 | 86.9s | |
| #140 | Qwen3.5 Plus 2026-02-15 medium | Qwen | 6.1 | 7.2 | $0.567 | 0/1 | 186.4s |
| #141 | Qwen3.8 27B medium | Qwen | 4.7 | 7.2 | ~$0.073 | 0/1 | 187.9s |
| #142 | Gemini 3.8 Flash low | 6.1 | 7.2 | $0.323 | 0/1 | 67.2s | |
| #143 | Claude Opus 4.8 low | Anthropic | 4.7 | 7.2 | $3.787 | 0/1 | 110.7s |
| #144 | Qwen3.7 Flash high | Qwen | 4.7 | 7.2 | $0.063 | 0/1 | 135.9s |