通用智能:答案错误
通用智能
答案错误
看看哪些 AI 模型在 通用智能 上最容易遇到 答案错误,更快找出薄弱点。
59/59
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #122 | Gemini 3.1 Flash Lite none | 1 | 4.0 | $0.046 | 0/1 | 992ms | |
| #129 | Nemotron 3 Ultra none | NVIDIA | 1 | 5.0 | $0.095 | 0/1 | 13.5s |
| #132 | GPT-5.6 Terra none | OpenAI | 1 | 5.0 | $0.349 | 0/1 | 1.03s |
| #134 | Mimo V2 Omni medium | Xiaomi | 1 | 5.4 | $0.683 | 0/1 | 3.61s |
| #137 | North Mini Code medium | Cohere | 1 | 5.1 | $0.000 | 0/1 | 25.1s |
| #139 | GPT-5.4 none | OpenAI | 1 | 4.4 | $0.397 | 0/1 | 1.78s |
| #144 | KAT-Coder-Air V2.5 high | Kwaipilot | 1 | 5.1 | $0.077 | 0/1 | 7.10s |
| #150 | DeepSeek V4 Flash none | DeepSeek | 1 | 4.2 | $0.044 | 0/1 | 23.7s |
| #151 | GLM 5.1 none | Z.ai | 1 | 5.0 | $0.164 | 0/1 | 790ms |
| #154 | MiMo-V2.5-Pro none | Xiaomi | 1 | 4.0 | $0.068 | 0/1 | 2.58s |
| #157 | Mimo V2 Omni none | Xiaomi | 1 | 4.1 | $0.021 | 0/1 | 2.33s |
| #159 | GPT-5.6 Luna none | OpenAI | 1 | 5.0 | $0.142 | 0/1 | 1.00s |
| #160 | Laguna XS 2.1 none | Poolside | 1 | 5.0 | $0.008 | 0/1 | 529ms |
| #161 | Qwen3.6 35B A3B none | Qwen | 1 | 4.4 | $0.061 | 0/1 | 3.51s |
| #164 | Inkling none | Thinkingmachines | 1 | 5.0 | $0.147 | 0/1 | 859ms |