Domänenspezifisch: Falsche Antwort
Domänenspezifisch
Falsche Antwort
Sieh, welche KI-Modelle bei Domänenspezifisch am ehesten auf Falsche Antwort stoßen, damit du Schwachstellen schneller erkennst.
Fehlergründe
303/303
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #91 | GPT-5.6 Luna high | OpenAI | 2 | 5.3 | $0.179 | 1/3 | 62.9s |
| #94 | Claude Opus 5 none | Anthropic | 2 | 5.3 | $1.550 | 1/3 | 11.1s |
| #95 | GPT-5.4 Nano medium | OpenAI | 2 | 5.9 | $0.142 | 1/3 | 38.7s |
| #96 | GPT-5.6 Terra low | OpenAI | 2 | 5.3 | $0.420 | 1/3 | 9.34s |
| #98 | GPT 5.3 Chat none | OpenAI | 2 | 2.9 | $0.533 | 0/3 | 12.7s |
| #101 | Mercury 2.5 Preview medium | Inception | 2 | 5.3 | $0.024 | 1/3 | 3.72s |
| #103 | Grok Build 0.1 medium | X AI | 2 | 2.9 | $1.130 | 0/3 | 175.9s |
| #104 | Gemini 3.8 Flash low | 2 | 5.8 | $0.239 | 1/3 | 6.50s | |
| #105 | Gemini 3.1 Flash Lite Preview medium | 2 | 5.3 | $0.117 | 1/3 | 4.09s | |
| #109 | LongCat 2.0 medium | Meituan | 2 | 3.0 | $0.499 | 0/3 | 390.6s |
| #110 | Qwen3.8 2.4T A95B high | Qwen | 2 | 4.1 | $2.357 | 0/3 | 301.1s |
| #112 | Gemini 3 Flash Preview low | 2 | 5.3 | $0.185 | 1/3 | 9.74s | |
| #116 | GLM 5.3 Flash high | Z.ai | 2 | 3.0 | $0.029 | 0/3 | 85.9s |
| #118 | Qwen3.7 Plus none | Qwen | 2 | 5.3 | $0.106 | 1/3 | 1.04s |
| #120 | Claude Opus 4.8 none | Anthropic | 2 | 5.3 | $1.166 | 1/3 | 1.76s |