综合 排名
看看哪些 AI 模型在 综合 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 响应时间(平均) ↓.
316/316
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 综合 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #50 | Grok 4.6 medium | X AI | 10.0 | 8.4 | $1.713 | 2/2 | 62.7s |
| #174 | Qwen3.6 Max Preview none | Qwen | 6.5 | 6.4 | $0.228 | 1/2 | 61.6s |
| #200 | Gemini 2.5 Flash none | 3.0 | 6.0 | $0.017 | 0/2 | 61.2s | |
| #243 | Kimi K2.5 none | Moonshot AI | 2.8 | 5.4 | $0.101 | 0/2 | 61.0s |
| #208 | Dots 3 Note Preview medium | Dots Studio | 9.9 | 5.9 | $0.000 | 2/2 | 60.8s |
| #22 | Gemini 3.8 Flash medium | 8.7 | 9.1 | $0.653 | 1/2 | 60.3s | |
| #102 | GPT-5.4 Mini medium | OpenAI | 6.9 | 7.5 | $0.786 | 1/2 | 59.6s |
| #82 | Seed-2.0-Lite medium | Bytedance Seed | 6.4 | 7.8 | $0.236 | 1/2 | 58.5s |
| #52 | GPT-5.2 medium | OpenAI | 10.0 | 8.4 | $1.182 | 2/2 | 58.5s |
| #6 | Gemini 3.7 Flash high | 10.0 | 9.8 | $0.646 | 2/2 | 57.2s | |
| #240 | KAT-Coder-Air V2.5 low | Kwaipilot | 6.4 | 5.4 | $0.046 | 1/2 | 55.9s |
| #31 | Muse Spark 1.3 high | Meta | 10.0 | 8.9 | $1.653 | 2/2 | 55.5s |
| #131 | Grok 4.3 medium | X AI | 6.5 | 7.0 | $0.741 | 1/2 | 55.1s |
| #211 | GLM 5.3 Flash low | Z.ai | 3.8 | 5.9 | $0.015 | 0/2 | 54.7s |
| #36 | Claude Opus 4.8 medium | Anthropic | 9.9 | 8.8 | $1.983 | 2/2 | 54.3s |