智能体任务:答案错误
智能体任务
答案错误
看看哪些 AI 模型在 智能体任务 上最容易遇到 答案错误,更快找出薄弱点。
108/108
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #265 | Kimi K2.6 none | Moonshot AI | 1 | 4.7 | $0.376 | 0/1 | 175.2s |
| #268 | Gemma 4 26B A4B none | 1 | 5.0 | $0.026 | 0/1 | 75.8s | |
| #270 | Seed-2.0-Code none | Bytedance Seed | 1 | 6.1 | $0.257 | 0/1 | 80.0s |
| #272 | Qwen3.8 27B none | Qwen | 1 | 5.0 | ~$0.010 | 0/1 | 47.4s |
| #273 | North Mini Code medium | Cohere | 1 | 3.9 | $0.000 | 0/1 | 105.2s |
| #275 | MiMo-V2.6-Flash none | Xiaomi | 1 | 5.0 | $0.060 | 0/1 | 62.6s |
| #276 | Step 3.5 Flash medium | Stepfun | 1 | 2.8 | $0.105 | 0/1 | 172.2s |
| #277 | Ember-1 none | Fireworks | 1 | 6.1 | $0.786 | 0/1 | 92.9s |
| #279 | GPT-5.6 Luna none | OpenAI | 1 | 5.0 | $0.056 | 0/1 | 53.8s |
| #280 | Granite 4.2 8B low | IBM Granite | 1 | 6.1 | $0.036 | 0/1 | 142.7s |
| #281 | Kimi K2.5 none | Moonshot AI | 1 | 5.0 | $0.236 | 0/1 | 321.2s |
| #291 | Mistral Small 4 medium | Mistral | 1 | 5.0 | $0.126 | 0/1 | 54.1s |
| #292 | Mistral Small 4 none | Mistral | 1 | 5.0 | $0.047 | 0/1 | 45.5s |
| #296 | Laguna S 2.1 medium | Poolside | 1 | 3.4 | $0.080 | 0/1 | 165.0s |
| #297 | Mercury 2.5 Preview low | Inception | 1 | 5.0 | $0.015 | 0/1 | 84.5s |