智能体任务 排名
看看哪些 AI 模型在 智能体任务 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 响应时间(平均) ↓.
380/380
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 智能体任务 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #15 | Gemini 3 Flash Preview medium | 10.0 | 9.6 | $0.876 | 1/1 | 59.2s | |
| #6 | GPT-6.1 Sol xhigh | OpenAI | 10.0 | 9.9 | $1.377 | 1/1 | 58.9s |
| #25 | Gemini 3.7 Flash low | 10.0 | 9.4 | $0.286 | 1/1 | 58.8s | |
| #213 | Qwen3.6 27B none | Qwen | 10.0 | 6.3 | $0.147 | 1/1 | 58.6s |
| #17 | Gemini 3.7 Flash medium | 10.0 | 9.5 | $0.432 | 1/1 | 58.4s | |
| #183 | GPT-5.6 Sol none | OpenAI | 5.0 | 6.7 | $0.472 | 0/1 | 58.3s |
| #122 | GPT-5.6 Luna medium | OpenAI | 7.4 | 7.4 | $0.101 | 0/1 | 58.1s |
| #249 | GPT-5.6 Terra none | OpenAI | 5.0 | 5.8 | $0.516 | 0/1 | 58.0s |
| #159 | Grok 4.6 low | X AI | 5.0 | 6.9 | $0.781 | 0/1 | 58.0s |
| #202 | Gemini 3 Flash Preview none | 5.0 | 6.4 | $0.155 | 0/1 | 57.8s | |
| #185 | GPT-5.5 none | OpenAI | 5.0 | 6.6 | $1.212 | 0/1 | 57.5s |
| #19 | GPT-5.6 Sol medium | OpenAI | 10.0 | 9.5 | $0.763 | 1/1 | 57.3s |
| #13 | GPT-5.6 Sol low | OpenAI | 10.0 | 9.6 | $0.609 | 1/1 | 57.1s |
| #48 | Claude Fable 5 medium | Anthropic | 10.0 | 8.9 | $5.089 | 1/1 | 57.1s |
| #172 | GPT-6 Sol none | OpenAI | 5.0 | 6.8 | $0.551 | 0/1 | 57.0s |