Agentenaufgaben: Ungültiger Werkzeugaufruf
Agentenaufgaben
Ungültiger Werkzeugaufruf
Sieh, welche KI-Modelle bei Agentenaufgaben am ehesten auf Ungültiger Werkzeugaufruf stoßen, damit du Schwachstellen schneller erkennst.
Fehlergründe
Kategorien
44/44
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Ungültiger Werkzeugaufruf-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #239 | MiMo-V2.6-Pro none | Xiaomi | 1 | 5.0 | $0.193 | 0/1 | 66.1s |
| #250 | DeepSeek V4.1 Flash none | DeepSeek | 1 | 7.4 | $0.123 | 0/1 | 55.8s |
| #261 | Solar Pro 4 none | Upstage | 1 | 5.0 | $0.033 | 0/1 | 69.2s |
| #267 | GPT-6 Luna none | OpenAI | 1 | 5.0 | $0.026 | 0/1 | 51.1s |
| #283 | Laguna XS 2.1 none | Poolside | 1 | 5.0 | $0.019 | 0/1 | 70.8s |
| #284 | Qwen3.6 35B A3B none | Qwen | 1 | 5.2 | $0.105 | 0/1 | 65.6s |
| #293 | Mercury 2.5 low | Inception | 1 | 5.0 | $0.020 | 0/1 | 47.1s |
| #295 | MiMo-V2.5-Pro none | Xiaomi | 1 | 3.9 | $0.157 | 0/1 | 49.6s |
| #298 | MiniMax M2.7 medium | Minimax | 1 | 4.7 | $0.202 | 0/1 | 198.8s |
| #308 | MiMo-V2.5 none | Xiaomi | 1 | 3.9 | $0.063 | 0/1 | 124.2s |
| #310 | Hy4 preview none | Tencent | 1 | 5.0 | $0.161 | 0/1 | 65.5s |
| #314 | Mercury 2.5 Preview none | Inception | 1 | 3.9 | $0.023 | 0/1 | 85.0s |
| #336 | Granite 4.2 8B none | IBM Granite | 1 | 5.0 | $0.047 | 0/1 | 49.2s |
| #346 | Qwen3.5-9B medium | Qwen | 1 | 5.2 | $0.106 | 0/1 | 152.9s |