Agentenaufgaben-Ranking
Sieh, welche KI-Modelle bei Agentenaufgaben am besten abschneiden, welche zuverlässig bleiben und wo die größten Unterschiede liegen.
Angezeigte Modelle
15
Durchschnittlicher Wert für Agentenaufgaben-Score
5.8
Bestes Modell
Gemini 3.6 Flash 10.0
380/380
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Agentenaufgaben-Score | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #107 | Grok 4.6 medium | X AI | 5.0 | 7.8 | $2.270 | 0/1 | 103.6s |
| #109 | Grok 4.5 low | X AI | 5.0 | 7.8 | $1.345 | 0/1 | 61.5s |
| #127 | Grok 4.7 low | X AI | 5.0 | 7.4 | $2.263 | 0/1 | 154.9s |
| #155 | Gemini 3.1 Flash Lite Preview medium | 5.0 | 7.0 | $0.158 | 0/1 | 54.9s | |
| #156 | Kimi K2.7 Code medium | Moonshot AI | 5.0 | 7.0 | $0.861 | 0/1 | 104.0s |
| #159 | Grok 4.6 low | X AI | 5.0 | 6.9 | $0.781 | 0/1 | 58.0s |
| #160 | Gemini 3 Flash Preview low | 5.0 | 6.9 | $0.254 | 0/1 | 52.6s | |
| #162 | Gemini 3.1 Flash Lite medium | 5.0 | 6.9 | $0.153 | 0/1 | 47.8s | |
| #167 | Claude Opus 4.8 none | Anthropic | 5.0 | 6.9 | $2.334 | 0/1 | 65.1s |
| #168 | Kimi K2.6 medium | Moonshot AI | 5.0 | 6.8 | $1.323 | 0/1 | 233.9s |
| #172 | GPT-6 Sol none | OpenAI | 5.0 | 6.8 | $0.551 | 0/1 | 57.0s |
| #183 | GPT-5.6 Sol none | OpenAI | 5.0 | 6.7 | $0.472 | 0/1 | 58.3s |
| #185 | GPT-5.5 none | OpenAI | 5.0 | 6.6 | $1.212 | 0/1 | 57.5s |
| #202 | Gemini 3 Flash Preview none | 5.0 | 6.4 | $0.155 | 0/1 | 57.8s | |
| #207 | Gemini 3.5 Flash minimal | 5.0 | 6.4 | $0.508 | 0/1 | 49.2s |