智能体任务 排名
看看哪些 AI 模型在 智能体任务 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↑.
380/380
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 智能体任务 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #151 | MiMo-V2.6-Flash low | Xiaomi | 4.7 | 7.1 | $0.200 | 0/1 | 107.9s |
| #153 | GPT-5.2 Chat none | OpenAI | 3.0 | 7.0 | $0.594 | 0/1 | 955ms |
| #154 | Qwen3.6 Max Preview medium | Qwen | 0.0 | 7.0 | $1.132 | 0/0 | 0ms |
| #155 | Gemini 3.1 Flash Lite Preview medium | 5.0 | 7.0 | $0.158 | 0/1 | 54.9s | |
| #156 | Kimi K2.7 Code medium | Moonshot AI | 5.0 | 7.0 | $0.861 | 0/1 | 104.0s |
| #157 | Ember-1 low | Fireworks | 4.7 | 7.0 | $1.488 | 0/1 | 121.3s |
| #158 | Qwen3.5-122B-A10B medium | Qwen | 6.1 | 7.0 | $1.152 | 0/1 | 95.3s |
| #159 | Grok 4.6 low | X AI | 5.0 | 6.9 | $0.781 | 0/1 | 58.0s |
| #160 | Gemini 3 Flash Preview low | 5.0 | 6.9 | $0.254 | 0/1 | 52.6s | |
| #161 | Muse Glimmer 30B low | Meta | 6.1 | 6.9 | $0.266 | 0/1 | 105.0s |
| #162 | Claude Opus 4.8 none | Anthropic | 5.4 | 6.9 | $2.328 | 0/1 | 69.1s |
| #163 | Gemini 3.1 Flash Lite medium | 5.0 | 6.9 | $0.153 | 0/1 | 47.8s | |
| #164 | Ember-1 high | Fireworks | 6.1 | 6.9 | $2.405 | 0/1 | 88.3s |
| #168 | Kimi K2.6 medium | Moonshot AI | 5.0 | 6.8 | $1.323 | 0/1 | 233.9s |
| #171 | Mercury 2.5 Preview medium | Inception | 3.9 | 6.8 | $0.037 | 0/1 | 74.6s |