综合:答案错误
综合
答案错误
看看哪些 AI 模型在 综合 上最容易遇到 答案错误,更快找出薄弱点。 排序方式: 响应时间(平均) ↑.
63/63
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #205 | Laguna Xs.2 none | Poolside | 1 | 1.5 | $0.004 | 0/1 | 2.01s |
| #189 | Mercury 2 none | Inception | 2 | 3.0 | $0.030 | 0/2 | 2.56s |
| #200 | MiMo-V2-Flash none | Xiaomi | 1 | 1.5 | $0.025 | 0/1 | 2.87s |
| #203 | Grok 4.1 Fast none | X AI | 1 | 1.5 | $0.008 | 0/1 | 3.33s |
| #195 | Elephant Alpha medium | Openrouter | 1 | 1.5 | $0.000 | 0/1 | 3.70s |
| #193 | Elephant Alpha none | Openrouter | 1 | 1.5 | $0.000 | 0/1 | 3.81s |
| #170 | GLM 5 Turbo none | Z.ai | 1 | 1.5 | $0.047 | 0/1 | 4.89s |
| #141 | GLM 5 none | Z.ai | 1 | 1.5 | $0.041 | 0/1 | 4.98s |
| #157 | Mimo V2 Omni none | Xiaomi | 1 | 1.5 | $0.021 | 0/1 | 5.96s |
| #136 | GPT-5.4 Mini none | OpenAI | 1 | 6.5 | $0.095 | 1/2 | 6.22s |
| #106 | Gemini 3.1 Flash Lite Preview none | 1 | 3.0 | $0.052 | 0/2 | 6.23s | |
| #174 | GPT-4o-mini none | OpenAI | 1 | 3.0 | $0.010 | 0/2 | 6.32s |
| #145 | GLM 5V Turbo none | Z.ai | 1 | 1.5 | $0.052 | 0/1 | 6.51s |
| #147 | Mimo V2 PRO none | Xiaomi | 1 | 1.5 | $0.045 | 0/1 | 6.58s |
| #159 | GPT-5.6 Luna none | OpenAI | 1 | 3.2 | $0.142 | 0/2 | 6.68s |