答案错误 失败
看看哪些 AI 模型最常遇到 答案错误,让你在选择前先发现稳定性风险。
313/313
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #39 | GLM 5.3 Flash max | Z.ai | 2 | 8.7 | $0.059 | 16/22 | 52.1s |
| #53 | Qwen3.8 27B high | Qwen | 2 | 8.4 | ~$0.287 | 16/22 | 167.9s |
| #68 | GLM 5.2 high | Z.ai | 2 | 8.0 | $1.188 | 14/22 | 69.9s |
| #154 | Gemma 4 26B A4B medium | 2 | 6.8 | $0.092 | 15/22 | 104.9s | |
| #188 | Qwen3.5-35B-A3B medium | Qwen | 2 | 6.1 | $0.675 | 11/22 | 110.8s |
| #250 | Gemini 3.1 Flash Lite Preview high | 2 | 5.3 | $2.310 | 13/16 | 68.1s | |
| #269 | Qwen3.6 Plus Preview medium | Qwen | 2 | 4.9 | $0.000 | 9/19 | 15.2s |
| #309 | Qwen3.5-9B medium | Qwen | 2 | 3.8 | $0.062 | 3/22 | 107.5s |
| #1 | Gemini 3.6 Flash high | 1 | 9.9 | $0.699 | 21/22 | 16.8s | |
| #4 | GPT-6 Astra high | OpenAI | 1 | 9.9 | $3.474 | 21/22 | 18.6s |
| #5 | GPT-6 Astra xhigh | OpenAI | 1 | 9.9 | $5.156 | 21/22 | 28.4s |
| #44 | Claude Fable 5 medium | Anthropic | 1 | 8.6 | $3.004 | 17/22 | 15.0s |
| #315 | Step 3.5 Flash none | Stepfun | 1 | 2.3 | $0.020 | 6/12 | 39.0s |