Wrong answer Failures
See which AI models run into Wrong answer most often, so you can spot reliability risks before choosing one. Sort by: Tests Correct ↑.
Categories
313/313
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #8 | GPT-5.6 Sol low | OpenAI | 4 | 9.5 | $0.357 | 18/22 | 9.04s |
| #13 | GPT-5.6 Sol medium | OpenAI | 4 | 9.4 | $0.508 | 18/22 | 12.6s |
| #15 | GPT-5.6 Sol high | OpenAI | 4 | 9.4 | $0.446 | 18/22 | 11.5s |
| #20 | Claude Opus 5 high | Anthropic | 2 | 9.2 | $3.070 | 18/22 | 22.5s |
| #21 | Claude Opus 5 medium | Anthropic | 3 | 9.2 | $1.586 | 18/22 | 10.3s |
| #26 | Gemini 3.5 Flash medium | 3 | 9.0 | $0.665 | 18/22 | 8.48s | |
| #27 | GPT-5.5 medium | OpenAI | 4 | 9.0 | $4.163 | 18/22 | 39.0s |
| #33 | Gemini 3.5 Flash low | 3 | 8.8 | $0.449 | 18/22 | 5.76s | |
| #37 | Claude Opus 5 low | Anthropic | 4 | 8.7 | $1.121 | 18/22 | 6.99s |
| #38 | Gemini 3.6 Flash low | 4 | 8.7 | $0.251 | 18/22 | 4.92s | |
| #40 | Claude Opus 4.7 medium | Anthropic | 3 | 8.7 | $1.476 | 18/22 | 7.62s |
| #161 | Claude Opus 4.7 none | Anthropic | 3 | 6.6 | $0.505 | 16/19 | 3.02s |
| #11 | Gemini 3.5 Flash high | 2 | 9.4 | $2.011 | 19/22 | 15.5s | |
| #14 | GPT-6 Astra medium | OpenAI | 3 | 9.4 | $1.774 | 19/22 | 8.08s |
| #16 | GPT-5.5 low | OpenAI | 3 | 9.3 | $1.257 | 19/22 | 10.1s |