Agentenaufgaben-Ranking
Sieh, welche KI-Modelle bei Agentenaufgaben am besten abschneiden, welche zuverlässig bleiben und wo die größten Unterschiede liegen. Sortieren nach: Metrik ↑.
Angezeigte Modelle
15
Durchschnittlicher Wert für Agentenaufgaben-Score
5.8
Bestes Modell
Qwen3.6 Max Preview 0.0
380/380
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Agentenaufgaben-Score | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #64 | Claude Sonnet 5 medium | Anthropic | 10.0 | 8.5 | $1.438 | 1/1 | 69.3s |
| #68 | Qwen3.8 2.4T A95B low | Qwen | 10.0 | 8.4 | $3.172 | 1/1 | 151.8s |
| #69 | GPT-5 Mini medium | OpenAI | 10.0 | 8.4 | $0.293 | 1/1 | 68.5s |
| #70 | Muse Glimmer 30B xhigh | Meta | 10.0 | 8.4 | $0.724 | 1/1 | 145.1s |
| #72 | Inkling high | Thinkingmachines | 10.0 | 8.4 | $1.250 | 1/1 | 66.0s |
| #73 | Muse Spark 1.1 high | Meta | 10.0 | 8.4 | $2.570 | 1/1 | 49.7s |
| #74 | DeepSeek V4 Flash 0731 high | DeepSeek | 10.0 | 8.4 | $0.578 | 1/1 | 204.4s |
| #75 | GLM 5.2 high | Z.ai | 10.0 | 8.4 | $1.620 | 1/1 | 52.4s |
| #76 | GPT-5.6 Terra high | OpenAI | 10.0 | 8.3 | $1.116 | 1/1 | 66.4s |
| #77 | Kimi K3 max | Moonshot AI | 10.0 | 8.3 | $4.013 | 1/1 | 74.2s |
| #79 | Qwen3.7 Plus medium | Qwen | 10.0 | 8.3 | $0.432 | 1/1 | 196.5s |
| #81 | GLM 5.2 medium | Z.ai | 10.0 | 8.2 | $0.398 | 1/1 | 102.4s |
| #82 | GPT-5.6 Terra medium | OpenAI | 10.0 | 8.2 | $0.744 | 1/1 | 54.7s |
| #83 | Seed-2.0-Lite medium | Bytedance Seed | 10.0 | 8.2 | $0.271 | 1/1 | 69.3s |
| #84 | Seed-2.0-Code low | Bytedance Seed | 10.0 | 8.1 | $0.881 | 1/1 | 90.2s |