常识问答:答案错误
常识问答
答案错误
看看哪些 AI 模型在 常识问答 上最容易遇到 答案错误,更快找出薄弱点。
259/259
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #210 | Gemini 2.5 Flash none | 1 | 3.0 | $0.017 | 0/1 | 1.15s | |
| #212 | GPT-5.6 Terra none | OpenAI | 1 | 3.0 | $0.280 | 0/1 | 787ms |
| #214 | GPT-5 Nano medium | OpenAI | 1 | 3.0 | $0.118 | 0/1 | 20.1s |
| #215 | Qwen3.5-Flash none | Qwen | 1 | 3.0 | $0.073 | 0/1 | 588ms |
| #216 | Qwen3.5-35B-A3B none | Qwen | 1 | 3.0 | $0.135 | 0/1 | 493ms |
| #217 | Step 3.5 Flash medium | Stepfun | 1 | 3.0 | $0.132 | 0/1 | 108.4s |
| #218 | Dots 3 Note Preview medium | Dots Studio | 1 | 3.0 | $0.000 | 0/1 | 15.5s |
| #219 | Mimo V2 Omni medium | Xiaomi | 1 | 3.0 | $0.683 | 0/1 | 234.2s |
| #220 | Hy3 preview high | Tencent | 1 | 3.0 | $0.135 | 0/1 | 47.7s |
| #221 | GLM 5.3 Flash low | Z.ai | 1 | 3.0 | $0.018 | 0/1 | 4.54s |
| #222 | GPT-5.4 Mini none | OpenAI | 1 | 3.0 | $0.095 | 0/1 | 1.33s |
| #223 | Seed 2.1 Turbo none | Bytedance Seed | 1 | 3.0 | $0.092 | 0/1 | 2.12s |
| #224 | GPT-5.4 none | OpenAI | 1 | 3.0 | $0.397 | 0/1 | 990ms |
| #225 | Solar Pro 4 none | Upstage | 1 | 3.0 | $0.017 | 0/1 | 1.29s |
| #227 | Nemotron 3 Super medium | NVIDIA | 1 | 3.0 | $0.054 | 0/1 | 55.3s |