Wrong answer Failures
See which AI models run into Wrong answer most often, so you can spot reliability risks before choosing one. Sort by: Tests Correct ↑.
Categories
219/219
Filter models
No models match the current search and filters.
| Rank | Model | Company | Wrong answer Count | Score | Total Cost | Tests Correct | Response Time (avg) |
|---|---|---|---|---|---|---|---|
| #152 | Owl Alpha medium | Openrouter | 10 | 5.6 | $0.000 | 8/21 | 11.9s |
| #163 | Mimo V2 Omni none | Xiaomi | 10 | 5.5 | $0.021 | 8/21 | 2.44s |
| #102 | LongCat 2.0 high | Meituan | 6 | 6.6 | $0.469 | 9/22 | 148.7s |
| #108 | Laguna XS 2.1 medium | Poolside | 11 | 6.5 | $0.068 | 9/22 | 47.9s |
| #124 | Gemini 2.5 Flash none | 12 | 6.2 | $0.017 | 9/22 | 6.20s | |
| #127 | gpt-oss-120b medium | OpenAI | 9 | 6.1 | $0.019 | 9/22 | 21.9s |
| #128 | Gemini 3.1 Flash Lite none | 11 | 6.1 | $0.046 | 9/22 | 1.75s | |
| #134 | GPT-5 Nano medium | OpenAI | 9 | 6.1 | $0.114 | 9/22 | 54.9s |
| #143 | North Mini Code medium | Cohere | 9 | 5.9 | $0.000 | 9/22 | 137.1s |
| #188 | Ring-2.6-1T none | Inclusionai | 5 | 4.8 | $0.026 | 9/22 | 55.1s |
| #147 | GLM 5 none | Z.ai | 12 | 5.7 | $0.041 | 9/21 | 4.03s |
| #190 | Grok 4.20 Multi Agent Beta medium | X AI | 4 | 4.8 | $5.599 | 8/18 | 9.69s |
| #193 | Hunter Alpha medium | OpenRouter | 4 | 4.7 | $0.000 | 8/18 | 10.3s |
| #50 | DeepSeek V4 Pro high | DeepSeek | 6 | 7.7 | $0.200 | 10/22 | 79.1s |
| #81 | Kimi K2.5 medium | Moonshot AI | 5 | 7.0 | $0.600 | 10/22 | 99.0s |