综合 排名
看看哪些 AI 模型在 综合 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 响应时间(平均) ↓.
316/316
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 综合 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #195 | Qwen3.6 Flash none | Qwen | 3.8 | 6.1 | $0.062 | 0/2 | 26.5s |
| #120 | Claude Opus 4.8 none | Anthropic | 9.8 | 7.3 | $1.166 | 2/2 | 26.4s |
| #30 | GPT-5.3-Codex medium | OpenAI | 10.0 | 8.9 | $0.988 | 2/2 | 26.0s |
| #209 | Mimo V2 Omni medium | Xiaomi | 5.0 | 5.9 | $0.683 | 1/1 | 25.9s |
| #253 | Inkling none | Thinkingmachines | 2.9 | 5.2 | $0.147 | 0/2 | 25.7s |
| #59 | Muse Spark 1.3 low | Meta | 7.3 | 8.2 | $0.689 | 1/2 | 25.7s |
| #183 | Seed-2.0-Lite none | Bytedance Seed | 3.0 | 6.2 | $0.066 | 0/2 | 25.6s |
| #15 | GPT-5.6 Sol high | OpenAI | 10.0 | 9.4 | $0.446 | 2/2 | 25.0s |
| #42 | Muse Spark 1.2 medium | Meta | 8.5 | 8.6 | $1.339 | 1/2 | 24.9s |
| #4 | GPT-6 Astra high | OpenAI | 10.0 | 9.9 | $3.474 | 2/2 | 24.4s |
| #236 | Qwen3.8 27B none | Qwen | 3.0 | 5.5 | ~$0.006 | 0/2 | 24.1s |
| #189 | gpt-oss-120b medium | OpenAI | 6.5 | 6.1 | $0.020 | 1/2 | 24.0s |
| #21 | Claude Opus 5 medium | Anthropic | 10.0 | 9.2 | $1.586 | 2/2 | 23.9s |
| #249 | Ling-2.6-1T none | Inclusionai | 6.5 | 5.3 | $0.016 | 1/2 | 23.8s |
| #111 | Grok 4.6 low | X AI | 6.5 | 7.4 | $0.449 | 1/2 | 23.3s |