Anti-KI-Tricks: Falsche Antwort
Anti-KI-Tricks
Falsche Antwort
Sieh, welche KI-Modelle bei Anti-KI-Tricks am ehesten auf Falsche Antwort stoßen, damit du Schwachstellen schneller erkennst.
Fehlergründe
188/188
Modelle filtern
Keine Modelle entsprechen der aktuellen Suche und den Filtern.
| Rang | Modell | Unternehmen | Falsche Antwort-Anzahl | Kategorie-Score | Gesamtkosten | Korrekte Tests | Antwortzeit (Durchschnitt) |
|---|---|---|---|---|---|---|---|
| #135 | GPT-5.5 none | OpenAI | 2 | 6.9 | $0.544 | 2/4 | 1.31s |
| #150 | DeepSeek V4 Pro none | DeepSeek | 2 | 3.2 | $0.220 | 0/4 | 4.02s |
| #151 | GLM 5.3 low | Z.ai | 2 | 6.9 | $0.257 | 2/4 | 4.16s |
| #158 | Gemini 3.5 Flash minimal | 2 | 6.5 | $0.300 | 2/4 | 892ms | |
| #166 | Gemini 3.1 Flash Lite low | 2 | 7.3 | $0.621 | 2/4 | 1.84s | |
| #171 | Laguna XS 2.1 medium | Poolside | 2 | 4.8 | $0.068 | 1/4 | 42.0s |
| #191 | Gemini 3.1 Flash Lite none | 2 | 7.5 | $0.046 | 2/4 | 1.07s | |
| #194 | Trinity Large Thinking medium | Arcee AI | 2 | 6.8 | $0.756 | 2/4 | 5.11s |
| #196 | Gemma 4 31B none | 2 | 6.5 | $0.016 | 2/4 | 1.85s | |
| #204 | GPT-5 Nano medium | OpenAI | 2 | 6.5 | $0.118 | 2/4 | 25.5s |
| #236 | Qwen3.8 27B none | Qwen | 2 | 6.5 | ~$0.006 | 2/4 | 828ms |
| #240 | KAT-Coder-Air V2.5 low | Kwaipilot | 2 | 7.3 | $0.046 | 2/4 | 3.50s |
| #247 | Laguna XS 2.1 none | Poolside | 2 | 5.3 | $0.008 | 1/4 | 755ms |
| #248 | Seed-2.0-Code none | Bytedance Seed | 2 | 3.0 | $0.151 | 0/4 | 5.06s |
| #255 | Nemotron 3.5 Lightning medium | NVIDIA | 2 | 6.9 | $0.156 | 2/4 | 12.3s |