Domänenspezifisch: Falsche Antwort
Domänenspezifisch
Falsche Antwort
Sieh, welche KI-Modelle bei Domänenspezifisch am ehesten auf Falsche Antwort stoßen, damit du Schwachstellen schneller erkennst. Sortieren nach: Antwortzeit (Durchschnitt) ↑.
Fehlergründe
303/303
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #85 | GLM 5 medium | Z.ai | 2 | 3.5 | $0.228 | 0/3 | 0ms |
| #303 | Granite 4.1 8B none | IBM Granite | 3 | 3.0 | $0.007 | 0/3 | 287ms |
| #316 | LFM2-24B-A2B none | Liquid | 1 | 5.9 | $0.001 | 1/3 | 287ms |
| #247 | Laguna XS 2.1 none | Poolside | 2 | 5.3 | $0.008 | 1/3 | 303ms |
| #290 | Laguna S 2.1 none | Poolside | 3 | 3.0 | $0.022 | 0/3 | 337ms |
| #311 | Laguna Xs.2 none | Poolside | 2 | 5.3 | $0.004 | 1/3 | 371ms |
| #256 | Mistral Small 4 none | Mistral | 2 | 5.3 | $0.022 | 1/3 | 377ms |
| #246 | Inkling Small none | Thinkingmachines | 2 | 5.3 | $0.054 | 1/3 | 442ms |
| #200 | Gemini 2.5 Flash none | 3 | 3.6 | $0.017 | 0/3 | 449ms | |
| #314 | Nemotron 3 Nano Omni 30b A3b Reasoning none | NVIDIA | 3 | 3.6 | $0.000 | 0/3 | 489ms |
| #286 | Mercury 2 none | Inception | 2 | 5.9 | $0.030 | 1/3 | 500ms |
| #206 | Qwen3.5-35B-A3B none | Qwen | 2 | 5.3 | $0.076 | 1/3 | 507ms |
| #223 | Qwen3.5-122B-A10B none | Qwen | 2 | 5.3 | $0.283 | 1/3 | 523ms |
| #236 | Qwen3.8 27B none | Qwen | 1 | 7.7 | ~$0.006 | 2/3 | 552ms |
| #301 | MiMo-V2-Flash none | Xiaomi | 2 | 5.3 | $0.025 | 1/3 | 564ms |