Falsche Antwort-Fehler
Sieh, bei welchen KI-Modellen Falsche Antwort besonders häufig auftritt, damit du Zuverlässigkeitsrisiken vor der Auswahl erkennst. Sortieren nach: Korrekte Tests ↓.
Kategorien
In der Kategorie Domänenspezifisch654 In der Kategorie Anti-KI-Tricks386 In der Kategorie Programmierung361 In der Kategorie Rätsellösen275 In der Kategorie Allgemeinwissen244 In der Kategorie Kombiniert95 In der Kategorie Allgemeine Intelligenz90 In der Kategorie Befolgung von Anweisungen82 In der Kategorie Datenanalyse und -extraktion66 In der Kategorie Werkzeugaufrufe5
309/309
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Punktzahl | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #272 | Trinity Large Thinking high | Arcee AI | 10 | 4.8 | $0.592 | 5/22 | 75.9s |
| #274 | KAT-Coder-Air V2.5 none | Kwaipilot | 13 | 4.8 | $0.070 | 5/22 | 12.5s |
| #275 | GLM 4.7 Flash none | Z.ai | 14 | 4.8 | $0.016 | 5/22 | 8.81s |
| #284 | MiniMax M2.5 medium | Minimax | 7 | 4.6 | $0.327 | 5/22 | 69.1s |
| #287 | Laguna M.1 none | Poolside | 10 | 4.4 | $0.009 | 4/19 | 2.89s |
| #308 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 7 | 3.4 | $0.000 | 4/19 | 17.1s |
| #276 | Trinity Large Preview none | Arcee AI | 12 | 4.8 | $0.008 | 4/21 | 2.98s |
| #295 | Hy3 preview none | Tencent | 8 | 4.0 | $0.007 | 4/21 | 12.9s |
| #296 | MiMo-V2-Flash none | Xiaomi | 13 | 4.0 | $0.025 | 4/21 | 2.76s |
| #233 | DeepSeek V4 Flash 0423 none | DeepSeek | 13 | 5.4 | $0.037 | 4/22 | 36.2s |
| #234 | Laguna S 2.1 medium | Poolside | 13 | 5.4 | $0.053 | 4/22 | 58.4s |
| #239 | DeepSeek V4 Flash 0731 none | DeepSeek | 13 | 5.4 | $0.011 | 4/22 | 20.7s |
| #240 | Laguna S 2.1 high | Poolside | 11 | 5.4 | $0.114 | 4/22 | 111.6s |
| #244 | Ling-2.6-1T none | Inclusionai | 12 | 5.3 | $0.016 | 4/22 | 8.59s |
| #246 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.051 | 4/22 | 5.57s |