智能体任务:答案错误
智能体任务
答案错误
看看哪些 AI 模型在 智能体任务 上最容易遇到 答案错误,更快找出薄弱点。 排序方式: 总成本 ↑.
108/108
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #173 | Space Bunny Alpha max | Stealth | 1 | 6.1 | $0.000 | 0/1 | 90.6s |
| #210 | Dots 3 Note Preview high | Dots Studio | 1 | 6.1 | $0.000 | 0/1 | 129.1s |
| #211 | Dots 3 Note Preview low | Dots Studio | 1 | 6.1 | $0.000 | 0/1 | 161.2s |
| #221 | Space Bunny Alpha medium | Stealth | 1 | 6.1 | $0.000 | 0/1 | 153.1s |
| #257 | Dots 3 Note Preview medium | Dots Studio | 1 | 4.7 | $0.000 | 0/1 | 140.5s |
| #259 | Space Bunny Alpha low | Stealth | 1 | 4.7 | $0.000 | 0/1 | 89.0s |
| #273 | North Mini Code medium | Cohere | 1 | 3.9 | $0.000 | 0/1 | 105.2s |
| #299 | Dots 3 Note Preview none | Dots Studio | 1 | 3.9 | $0.000 | 0/1 | 45.7s |
| #316 | North Mini Code none | Cohere | 1 | 3.0 | $0.000 | 0/1 | 18.9s |
| #272 | Qwen3.8 27B none | Qwen | 1 | 5.0 | ~$0.010 | 0/1 | 47.4s |
| #297 | Mercury 2.5 Preview low | Inception | 1 | 5.0 | $0.015 | 0/1 | 84.5s |
| #342 | gpt-oss-120b none | OpenAI | 1 | 6.1 | $0.016 | 0/1 | 140.9s |
| #333 | Nemotron 3 Super none | NVIDIA | 1 | 2.8 | $0.016 | 0/1 | 30.5s |
| #300 | GPT-4o-mini none | OpenAI | 1 | 5.0 | $0.024 | 0/1 | 40.0s |
| #268 | Gemma 4 26B A4B none | 1 | 5.0 | $0.026 | 0/1 | 75.8s |