AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Kategoriefehler

Werkzeugaufrufe: API-Fehler

Werkzeugaufrufe
API-Fehler

Sieh, welche KI-Modelle bei Werkzeugaufrufe am ehesten auf API-Fehler stoßen, damit du Schwachstellen schneller erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.

Angezeigte Modelle

15

Gesamtfehler

15

Am stärksten betroffenes Modell

Gemini 3.5 Flash 1
Rang Modell Unternehmen API-Fehler-Anzahl Kategorie-Score Korrekte Tests Antwortzeit (Durchschnitt)
#20 Gemini 3.5 Flash none Google 1 3.0 0/1 0ms
#27 Gemma 4 31B medium Google 1 3.0 0/1 0ms
#46 Qwen3.6 35B A3B medium Qwen 1 3.0 0/1 0ms
#55 GLM 5.1 medium Z.ai 1 3.0 0/1 0ms
#83 Step 3.5 Flash none Stepfun 1 3.0 0/1 0ms
#84 Grok 4.20 Multi Agent Beta medium X AI 1 3.0 0/1 0ms
#85 Gemma 4 31B none Google 1 3.0 0/1 0ms
#96 Ring-2.6-1T none Inclusionai 1 3.0 0/1 0ms
#100 Grok Build 0.1 none X AI 1 3.0 0/1 0ms
#126 gpt-oss-120b none OpenAI 1 3.0 0/1 0ms
#149 Nemotron 3 Nano Omni 30b A3b Reasoning medium NVIDIA 1 3.0 0/1 0ms
#153 Qwen3.6 35B A3B none Qwen 1 3.0 0/1 0ms
#160 LFM2-24B-A2B none Liquid 1 3.0 0/1 0ms
#162 Nemotron 3 Nano Omni 30b A3b Reasoning none NVIDIA 1 3.0 0/1 0ms
#89 Hy3 preview low Tencent 1 2.8 0/1 17.8s

Top-Modelle nach API-Fehler-Anzahl

API-Fehler-Anzahl vs Punktzahl

Top-Modelle nach Antwortzeit (Durchschnitt)

Top-Modelle nach Geschätzte verschwendete Kosten