领域专项:答案错误
领域专项
答案错误
看看哪些 AI 模型在 领域专项 上最容易遇到 答案错误,更快找出薄弱点。
198/198
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #101 | MiMo-V2.5 medium | Xiaomi | 1 | 5.3 | $0.082 | 1/3 | 34.5s |
| #109 | Mimo V2 PRO medium | Xiaomi | 1 | 5.3 | $0.333 | 1/3 | 8.82s |
| #110 | Gemma 4 31B medium | 1 | 7.7 | $0.163 | 2/3 | 38.5s | |
| #114 | Qwen3.5-Flash medium | Qwen | 1 | 5.3 | $0.139 | 1/3 | 146.5s |
| #115 | Gemma 4 31B none | 1 | 7.7 | $0.035 | 2/3 | 3.22s | |
| #119 | Qwen3.5-35B-A3B medium | Qwen | 1 | 4.1 | $0.837 | 0/3 | 88.3s |
| #125 | Qwen3.5-Flash none | Qwen | 1 | 7.7 | $0.073 | 2/3 | 905ms |
| #127 | Qwen3.5-35B-A3B none | Qwen | 1 | 7.7 | $0.106 | 2/3 | 485ms |
| #128 | GPT-5 Nano medium | OpenAI | 1 | 5.2 | $0.114 | 1/3 | 204.0s |
| #134 | Mimo V2 Omni medium | Xiaomi | 1 | 3.0 | $0.683 | 0/3 | 47.9s |
| #144 | KAT-Coder-Air V2.5 high | Kwaipilot | 1 | 2.9 | $0.077 | 0/3 | 7.47s |
| #152 | Qwen3.6 27B none | Qwen | 1 | 7.7 | $0.087 | 2/3 | 3.03s |
| #167 | Mistral Small 4 medium | Mistral | 1 | 5.3 | $0.096 | 1/3 | 6.11s |
| #172 | MiniMax M2.7 medium | Minimax | 1 | 3.0 | $0.163 | 0/3 | 19.0s |
| #176 | GLM 4.7 Flash none | Z.ai | 1 | 7.7 | $0.016 | 2/3 | 744ms |