智能体任务 排名
看看哪些 AI 模型在 智能体任务 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 总成本 ↑.
380/380
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 智能体任务 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #94 | Gemini 3.8 Flash medium | 2.8 | 8.0 | $0.769 | 0/1 | 63.7s | |
| #159 | Grok 4.6 low | X AI | 5.0 | 6.9 | $0.781 | 0/1 | 58.0s |
| #277 | Ember-1 none | Fireworks | 6.1 | 5.4 | $0.786 | 0/1 | 92.9s |
| #193 | Qwen3.6 35B A3B medium | Qwen | 6.1 | 6.5 | $0.812 | 0/1 | 88.5s |
| #232 | Trinity Large Thinking medium | Arcee AI | 6.1 | 6.1 | $0.820 | 0/1 | 52.5s |
| #9 | Gemini 3.7 Flash high | 10.0 | 9.8 | $0.851 | 1/1 | 78.5s | |
| #123 | Qwen3.6 Flash medium | Qwen | 10.0 | 7.4 | $0.858 | 1/1 | 56.1s |
| #49 | Qwen3.8 MAX low | Qwen | 10.0 | 8.8 | $0.859 | 1/1 | 96.8s |
| #156 | Kimi K2.7 Code medium | Moonshot AI | 5.0 | 7.0 | $0.861 | 0/1 | 104.0s |
| #15 | Gemini 3 Flash Preview medium | 10.0 | 9.6 | $0.876 | 1/1 | 59.2s | |
| #86 | Seed-2.0-Code low | Bytedance Seed | 10.0 | 8.1 | $0.881 | 1/1 | 90.2s |
| #53 | Muse Spark 1.2 low | Meta | 10.0 | 8.7 | $0.881 | 1/1 | 56.8s |
| #60 | Muse Spark 1.1 low | Meta | 10.0 | 8.6 | $0.885 | 1/1 | 42.2s |
| #166 | Claude Sonnet 5.5 low | Anthropic | 10.0 | 6.9 | $0.909 | 1/1 | 46.6s |
| #65 | Muse Spark 1.3 low | Meta | 10.0 | 8.5 | $0.911 | 1/1 | 55.1s |