Wrong answer Failures
See which AI models run into Wrong answer most often, so you can spot reliability risks before choosing one. Sort by: Tests Correct ↓.
Categories
313/313
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #25 | Claude Fable 5.1 high | Anthropic | 3 | 9.0 | $3.364 | 19/22 | 13.6s |
| #161 | Claude Opus 4.7 none | Anthropic | 3 | 6.6 | $0.505 | 16/19 | 3.02s |
| #8 | GPT-5.6 Sol low | OpenAI | 4 | 9.5 | $0.357 | 18/22 | 9.04s |
| #13 | GPT-5.6 Sol medium | OpenAI | 4 | 9.4 | $0.508 | 18/22 | 12.6s |
| #15 | GPT-5.6 Sol high | OpenAI | 4 | 9.4 | $0.446 | 18/22 | 11.5s |
| #20 | Claude Opus 5 high | Anthropic | 2 | 9.2 | $3.070 | 18/22 | 22.5s |
| #21 | Claude Opus 5 medium | Anthropic | 3 | 9.2 | $1.586 | 18/22 | 10.3s |
| #26 | Gemini 3.5 Flash medium | 3 | 9.0 | $0.665 | 18/22 | 8.48s | |
| #27 | GPT-5.5 medium | OpenAI | 4 | 9.0 | $4.163 | 18/22 | 39.0s |
| #33 | Gemini 3.5 Flash low | 3 | 8.8 | $0.449 | 18/22 | 5.76s | |
| #37 | Claude Opus 5 low | Anthropic | 4 | 8.7 | $1.121 | 18/22 | 6.99s |
| #38 | Gemini 3.6 Flash low | 4 | 8.7 | $0.251 | 18/22 | 4.92s | |
| #40 | Claude Opus 4.7 medium | Anthropic | 3 | 8.7 | $1.476 | 18/22 | 7.62s |
| #250 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #201 | Grok 4.20 Beta medium | X AI | 3 | 6.0 | $0.750 | 14/18 | 9.75s |