答案错误 失败
看看哪些 AI 模型最常遇到 答案错误,让你在选择前先发现稳定性风险。 排序方式: 分数 ↑.
215/215
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #111 | Gemini 3.1 Flash Lite low | 9 | 6.5 | $0.621 | 12/22 | 16.3s | |
| #110 | Gemini 3.1 Flash Lite Preview low | 7 | 6.5 | $0.646 | 13/22 | 16.7s | |
| #108 | Laguna XS 2.1 medium | Poolside | 11 | 6.5 | $0.068 | 9/22 | 47.9s |
| #109 | Qwen3.5-27B none | Qwen | 12 | 6.5 | $0.090 | 8/22 | 4.76s |
| #107 | MiMo-V2.5 medium | Xiaomi | 5 | 6.5 | $0.082 | 12/22 | 32.2s |
| #106 | Hy3 preview medium | Tencent | 3 | 6.5 | $0.018 | 14/21 | 16.3s |
| #105 | Qwen3.6 27B medium | Qwen | 6 | 6.5 | $0.779 | 10/22 | 106.3s |
| #104 | Gemini 3.5 Flash-Lite medium | 9 | 6.5 | $0.369 | 12/22 | 6.01s | |
| #103 | Qwen3.6 Max Preview none | Qwen | 10 | 6.6 | $0.231 | 12/22 | 7.82s |
| #102 | LongCat 2.0 high | Meituan | 6 | 6.6 | $0.469 | 9/22 | 148.7s |
| #101 | GLM 5.2 none | Z.ai | 8 | 6.6 | $0.128 | 12/22 | 9.34s |
| #100 | Gemma 4 26B A4B medium | 3 | 6.6 | $0.089 | 14/22 | 103.8s | |
| #99 | Claude Opus 4.7 none | Anthropic | 3 | 6.6 | $0.505 | 16/19 | 3.02s |
| #98 | GLM 5V Turbo medium | Z.ai | 7 | 6.7 | $0.457 | 11/21 | 23.1s |
| #97 | KAT-Coder-Pro V2.5 none | Kwaipilot | 10 | 6.7 | $0.476 | 11/22 | 25.6s |