Domänenspezifisch: Falsche Antwort
Domänenspezifisch
Falsche Antwort
Sieh, welche KI-Modelle bei Domänenspezifisch am ehesten auf Falsche Antwort stoßen, damit du Schwachstellen schneller erkennst.
Fehlergründe
303/303
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #77 | Gemini 3.5 Flash Lite medium | 3 | 4.1 | $0.272 | 0/3 | 5.34s | |
| #82 | Seed-2.0-Lite medium | Bytedance Seed | 3 | 3.6 | $0.236 | 0/3 | 84.4s |
| #84 | Qwen3.7 Flash high | Qwen | 3 | 2.9 | $0.052 | 0/3 | 34.4s |
| #86 | Seed-2.0-Code low | Bytedance Seed | 3 | 4.1 | $0.767 | 0/3 | 238.4s |
| #88 | DeepSeek V4 Pro high | DeepSeek | 3 | 3.6 | $0.476 | 0/3 | 249.5s |
| #89 | DeepSeek V4 Flash 0423 high | DeepSeek | 3 | 3.6 | $0.042 | 0/3 | 115.4s |
| #92 | Solar Pro 4 xhigh | Upstage | 3 | 3.0 | $0.050 | 0/3 | 287.7s |
| #93 | Nemotron 3 Ultra medium | NVIDIA | 3 | 3.6 | $0.701 | 0/3 | 35.2s |
| #102 | GPT-5.4 Mini medium | OpenAI | 3 | 3.6 | $0.786 | 0/3 | 71.1s |
| #108 | GPT-5.6 Luna medium | OpenAI | 3 | 2.9 | $0.072 | 0/3 | 18.5s |
| #111 | Grok 4.6 low | X AI | 3 | 3.0 | $0.449 | 0/3 | 18.2s |
| #115 | KAT-Coder-Pro V2.5 low | Kwaipilot | 3 | 3.5 | $0.400 | 0/3 | 22.9s |
| #117 | Gemini 3.1 Flash Lite medium | 3 | 2.9 | $0.120 | 0/3 | 3.93s | |
| #119 | DeepSeek V4 Flash 0731 medium | DeepSeek | 3 | 2.9 | $0.066 | 0/3 | 203.1s |
| #122 | KAT-Coder-Pro V2.5 high | Kwaipilot | 3 | 2.9 | $0.506 | 0/3 | 44.7s |