API-Fehler-Fehler
Sieh, bei welchen KI-Modellen API-Fehler besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst.
Kategorien
In der Kategorie Programmierung56 In der Kategorie Kombiniert37 In der Kategorie Werkzeugaufrufe25 In der Kategorie Anti-KI-Tricks22 In der Kategorie Datenanalyse und -extraktion22 In der Kategorie Domänenspezifisch17 In der Kategorie Rätsellösen15 In der Kategorie Allgemeine Intelligenz14 In der Kategorie Allgemeinwissen14 In der Kategorie Befolgung von Anweisungen5
104/104
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | API-Fehler-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #150 | DeepSeek V3.2 medium | DeepSeek | 2 | 7.0 | $0.078 | 11/22 | 68.4s |
| #176 | LongCat 2.0 low | Meituan | 2 | 6.7 | $0.412 | 10/22 | 113.6s |
| #186 | Qwen3.6 35B A3B medium | Qwen | 2 | 6.6 | $0.750 | 12/22 | 58.5s |
| #200 | Ring-2.6-1T medium | Inclusionai | 2 | 6.4 | $0.102 | 11/22 | 68.8s |
| #206 | Gemma 4 31B medium | 2 | 6.2 | $0.100 | 13/22 | 78.6s | |
| #218 | Gemma 4 31B none | 2 | 6.1 | $0.016 | 9/22 | 5.41s | |
| #220 | Nemotron 3 Ultra none | NVIDIA | 2 | 6.1 | $0.084 | 8/22 | 3.88s |
| #221 | Trinity Large Thinking low | Arcee AI | 2 | 6.0 | $0.625 | 8/22 | 96.6s |
| #264 | KAT-Coder-Air V2.5 low | Kwaipilot | 2 | 5.4 | $0.046 | 7/22 | 10.6s |
| #275 | Qwen3.6 35B A3B none | Qwen | 2 | 5.3 | $0.061 | 4/22 | 5.57s |
| #296 | Ling-2.6-flash none | Inclusionai | 2 | 4.9 | $0.002 | 6/22 | 10.7s |
| #303 | Grok 4.20 Multi Agent Beta medium | X AI | 2 | 4.8 | $5.599 | 8/18 | 9.69s |
| #306 | Trinity Large Preview none | Arcee AI | 2 | 4.8 | $0.008 | 4/21 | 2.98s |
| #52 | DeepSeek V4.1 Flash low | DeepSeek | 1 | 8.5 | $0.224 | 15/22 | 26.8s |
| #53 | DeepSeek V4.1 Flash high | DeepSeek | 1 | 8.5 | $0.287 | 15/22 | 32.8s |