智能体任务 排名
看看哪些 AI 模型在 智能体任务 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↑.
380/380
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 智能体任务 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #265 | Kimi K2.6 none | Moonshot AI | 4.7 | 5.5 | $0.376 | 0/1 | 175.2s |
| #266 | Gemini 2.5 Flash none | 3.0 | 5.5 | $0.017 | 0/1 | 1.81s | |
| #267 | GPT-6 Luna none | OpenAI | 5.0 | 5.5 | $0.026 | 0/1 | 51.1s |
| #268 | Gemma 4 26B A4B none | 5.0 | 5.5 | $0.026 | 0/1 | 75.8s | |
| #269 | GLM 5V Turbo medium | Z.ai | 0.0 | 5.5 | $0.457 | 0/0 | 0ms |
| #270 | Seed-2.0-Code none | Bytedance Seed | 6.1 | 5.4 | $0.257 | 0/1 | 80.0s |
| #271 | Claude Opus 4.7 none | Anthropic | 0.0 | 5.4 | $0.505 | 0/0 | 0ms |
| #272 | Qwen3.8 27B none | Qwen | 5.0 | 5.4 | ~$0.010 | 0/1 | 47.4s |
| #273 | North Mini Code medium | Cohere | 3.9 | 5.4 | $0.000 | 0/1 | 105.2s |
| #274 | Hy4 preview low | Tencent | 4.7 | 5.4 | $1.670 | 0/1 | 52.4s |
| #275 | MiMo-V2.6-Flash none | Xiaomi | 5.0 | 5.4 | $0.060 | 0/1 | 62.6s |
| #276 | Step 3.5 Flash medium | Stepfun | 2.8 | 5.4 | $0.105 | 0/1 | 172.2s |
| #277 | Ember-1 none | Fireworks | 6.1 | 5.4 | $0.786 | 0/1 | 92.9s |
| #278 | Hy3 preview medium | Tencent | 0.0 | 5.3 | $0.049 | 0/0 | 0ms |
| #279 | GPT-5.6 Luna none | OpenAI | 5.0 | 5.3 | $0.056 | 0/1 | 53.8s |