Rätsellösen: Falsche Antwort
Rätsellösen
Falsche Antwort
Sieh, welche KI-Modelle bei Rätsellösen am ehesten auf Falsche Antwort stoßen, damit du Schwachstellen schneller erkennst.
Fehlergründe
142/142
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #125 | Qwen3.5-Flash none | Qwen | 3 | 3.1 | $0.073 | 0/3 | 10.9s |
| #137 | North Mini Code medium | Cohere | 3 | 3.3 | $0.000 | 0/3 | 19.7s |
| #144 | KAT-Coder-Air V2.5 high | Kwaipilot | 3 | 3.5 | $0.077 | 0/3 | 2.47s |
| #149 | KAT-Coder-Air V2.5 medium | Kwaipilot | 3 | 3.6 | $0.048 | 0/3 | 1.87s |
| #155 | Kimi K2.5 none | Moonshot AI | 3 | 3.0 | $0.127 | 0/3 | 4.04s |
| #160 | Laguna XS 2.1 none | Poolside | 3 | 3.0 | $0.008 | 0/3 | 1.01s |
| #166 | Qwen3 Coder Next none | Qwen | 3 | 3.0 | $0.025 | 0/3 | 24.3s |
| #182 | KAT-Coder-Air V2.5 none | Kwaipilot | 3 | 2.9 | $0.067 | 0/3 | 1.84s |
| #189 | Mercury 2 none | Inception | 3 | 3.1 | $0.030 | 0/3 | 535ms |
| #203 | Grok 4.1 Fast none | X AI | 3 | 3.0 | $0.008 | 0/3 | 1.10s |
| #29 | Step 3.7 Flash medium | Stepfun | 2 | 5.7 | $0.515 | 1/3 | 6.19s |
| #51 | Nemotron 3 Ultra medium | NVIDIA | 2 | 5.5 | $0.774 | 1/3 | 3.54s |
| #53 | GPT-5.4 Nano medium | OpenAI | 2 | 4.1 | $0.138 | 0/3 | 3.79s |
| #60 | LongCat 2.0 medium | Meituan | 2 | 5.4 | $0.478 | 1/3 | 8.84s |
| #62 | KAT-Coder-Pro V2.5 low | Kwaipilot | 2 | 6.4 | $0.387 | 1/3 | 3.11s |