答案错误 失败
看看哪些 AI 模型最常遇到 答案错误,让你在选择前先发现稳定性风险。 排序方式: 响应时间(平均) ↑.
215/215
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #174 | MiMo-V2.5 none | Xiaomi | 14 | 5.1 | $0.025 | 5/22 | 4.62s |
| #202 | Hunter Alpha none | OpenRouter | 9 | 4.2 | $0.000 | 6/18 | 4.70s |
| #109 | Qwen3.5-27B none | Qwen | 12 | 6.5 | $0.090 | 8/22 | 4.76s |
| #70 | Claude Opus 4.8 none | Anthropic | 4 | 7.3 | $1.166 | 13/22 | 4.91s |
| #123 | GPT-5.6 Luna low | OpenAI | 10 | 6.2 | $0.249 | 10/22 | 5.04s |
| #129 | Inkling low | Thinkingmachines | 8 | 6.1 | $0.187 | 10/22 | 5.15s |
| #117 | LongCat 2.0 none | Meituan | 14 | 6.3 | $0.044 | 7/22 | 5.18s |
| #59 | GPT-5.6 Terra low | OpenAI | 8 | 7.5 | $0.519 | 13/22 | 5.31s |
| #121 | Gemma 4 31B none | 9 | 6.2 | $0.021 | 10/22 | 5.34s | |
| #167 | Qwen3.6 35B A3B none | Qwen | 13 | 5.3 | $0.061 | 4/22 | 5.52s |
| #14 | Gemini 3.5 Flash low | 2 | 8.9 | $0.433 | 19/22 | 5.55s | |
| #183 | Nemotron 3 Super none | NVIDIA | 15 | 4.9 | $0.008 | 5/22 | 5.97s |
| #104 | Gemini 3.5 Flash-Lite medium | 9 | 6.5 | $0.369 | 12/22 | 6.01s | |
| #118 | Claude Sonnet 5 none | Anthropic | 7 | 6.3 | $0.548 | 8/22 | 6.04s |
| #124 | Gemini 2.5 Flash none | 12 | 6.2 | $0.017 | 9/22 | 6.20s |