Domänenspezifisch: Falsche Antwort
Domänenspezifisch
Falsche Antwort
Sieh, welche KI-Modelle bei Domänenspezifisch am ehesten auf Falsche Antwort stoßen, damit du Schwachstellen schneller erkennst.
Fehlergründe
303/303
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #297 | Hunter Alpha none | OpenRouter | 2 | 5.3 | $0.000 | 1/3 | 2.33s |
| #298 | Grok 4.20 none | X AI | 2 | 3.0 | $0.057 | 0/3 | 687ms |
| #299 | Laguna Xs.2 medium | Poolside | 2 | 4.1 | $0.015 | 0/3 | 11.1s |
| #300 | Hy3 preview none | Tencent | 2 | 3.6 | $0.007 | 0/3 | 17.6s |
| #301 | MiMo-V2-Flash none | Xiaomi | 2 | 5.3 | $0.025 | 1/3 | 564ms |
| #302 | Ling 3.0 Tiny none | Inclusionai | 2 | 3.0 | $0.000 | 0/3 | 880ms |
| #305 | Grok Build 0.1 none | X AI | 2 | 3.6 | $0.547 | 0/3 | 103.7s |
| #308 | Grok 4.1 Fast none | X AI | 2 | 5.9 | $0.008 | 1/3 | 1.06s |
| #311 | Laguna Xs.2 none | Poolside | 2 | 5.3 | $0.004 | 1/3 | 371ms |
| #313 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 2 | 2.9 | $0.000 | 0/3 | 56.7s |
| #1 | Gemini 3.6 Flash high | 1 | 8.2 | $0.699 | 2/3 | 33.3s | |
| #4 | GPT-6 Astra high | OpenAI | 1 | 7.6 | $3.474 | 2/3 | 95.1s |
| #5 | GPT-6 Astra xhigh | OpenAI | 1 | 7.6 | $5.156 | 2/3 | 147.0s |
| #9 | GPT-6 Astra low | OpenAI | 1 | 7.7 | $1.289 | 2/3 | 13.9s |
| #10 | Gemini 3 Flash Preview medium | 1 | 7.7 | $0.763 | 2/3 | 20.1s |