答案错误 失败
看看哪些 AI 模型最常遇到 答案错误,让你在选择前先发现稳定性风险。 排序方式: 响应时间(平均) ↑.
313/313
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #59 | Muse Spark 1.3 low | Meta | 4 | 8.2 | $0.689 | 15/22 | 16.0s |
| #51 | Grok 4.5 low | X AI | 6 | 8.4 | $0.945 | 16/22 | 16.2s |
| #166 | Gemini 3.1 Flash Lite low | 8 | 6.6 | $0.621 | 13/22 | 16.2s | |
| #172 | Hy3 preview medium | Tencent | 3 | 6.5 | $0.049 | 14/21 | 16.3s |
| #91 | GPT-5.6 Luna high | OpenAI | 8 | 7.6 | $0.179 | 14/22 | 16.5s |
| #164 | Gemini 3.1 Flash Lite Preview low | 6 | 6.6 | $0.646 | 14/22 | 16.7s | |
| #1 | Gemini 3.6 Flash high | 1 | 9.9 | $0.699 | 21/22 | 16.8s | |
| #30 | GPT-5.3-Codex medium | OpenAI | 4 | 8.9 | $0.988 | 16/22 | 16.9s |
| #313 | Nemotron 3 Nano Omni 30b A3b Reasoning medium | NVIDIA | 7 | 3.4 | $0.000 | 4/19 | 17.1s |
| #129 | Step 3.7 Flash low | Stepfun | 9 | 7.1 | $0.390 | 11/22 | 17.9s |
| #267 | DeepSeek V3.2 none | DeepSeek | 8 | 5.0 | $0.054 | 6/22 | 17.9s |
| #243 | Kimi K2.5 none | Moonshot AI | 16 | 5.4 | $0.101 | 5/22 | 18.0s |
| #128 | Muse Glimmer 30B low | Meta | 6 | 7.1 | $0.143 | 11/22 | 18.6s |
| #4 | GPT-6 Astra high | OpenAI | 1 | 9.9 | $3.474 | 21/22 | 18.6s |
| #261 | Qwen3.5-9B none | Qwen | 14 | 5.1 | $0.021 | 4/22 | 19.2s |