Rätsellösen: Falsche Antwort
Rätsellösen
Falsche Antwort
Sieh, welche KI-Modelle bei Rätsellösen am ehesten auf Falsche Antwort stoßen, damit du Schwachstellen schneller erkennst. Sortieren nach: Gesamtkosten ↓.
Fehlergründe
186/186
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #278 | Grok 4.20 Multi Agent Beta medium | X AI | 1 | 6.7 | $5.599 | 1/3 | 5.19s |
| #87 | Claude Opus 4.6 medium | Anthropic | 1 | 7.7 | $2.961 | 2/3 | 4.71s |
| #233 | Hy4 preview low | Tencent | 1 | 5.3 | $1.745 | 0/3 | 238.0s |
| #121 | Kimi K2.6 medium | Moonshot AI | 1 | 6.0 | $1.247 | 1/3 | 25.1s |
| #146 | Step 3.7 Flash high | Stepfun | 2 | 5.3 | $1.229 | 1/3 | 10.2s |
| #68 | GLM 5.2 high | Z.ai | 1 | 6.0 | $1.188 | 1/3 | 33.7s |
| #103 | Grok Build 0.1 medium | X AI | 1 | 7.7 | $1.130 | 2/3 | 18.3s |
| #64 | Inkling high | Thinkingmachines | 1 | 6.9 | $1.046 | 1/3 | 10.7s |
| #60 | Claude Sonnet 5 medium | Anthropic | 1 | 7.7 | $0.922 | 2/3 | 2.98s |
| #70 | GPT-5.6 Terra high | OpenAI | 1 | 7.7 | $0.836 | 2/3 | 5.45s |
| #137 | Grok 4.20 medium | X AI | 1 | 7.7 | $0.805 | 2/3 | 6.22s |
| #194 | Trinity Large Thinking medium | Arcee AI | 1 | 5.2 | $0.756 | 0/3 | 2.90s |
| #131 | Grok 4.3 medium | X AI | 1 | 5.9 | $0.741 | 1/3 | 22.5s |
| #134 | GLM 5.1 medium | Z.ai | 1 | 8.2 | $0.727 | 2/3 | 31.6s |
| #93 | Nemotron 3 Ultra medium | NVIDIA | 2 | 5.5 | $0.701 | 1/3 | 3.54s |