综合 排名
看看哪些 AI 模型在 综合 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 响应时间(平均) ↓.
216/216
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 综合 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #113 | Qwen3.5 Plus 2026-02-15 none | Qwen | 6.5 | 6.4 | $0.073 | 1/2 | 64.8s |
| #115 | Mimo V2 PRO medium | Xiaomi | 2.3 | 6.3 | $0.333 | 0/1 | 64.7s |
| #32 | Inkling high | Thinkingmachines | 7.3 | 8.0 | $1.006 | 1/2 | 63.8s |
| #103 | Qwen3.6 Max Preview none | Qwen | 6.5 | 6.6 | $0.231 | 1/2 | 61.6s |
| #124 | Gemini 2.5 Flash none | 3.0 | 6.2 | $0.017 | 0/2 | 61.2s | |
| #161 | Kimi K2.5 none | Moonshot AI | 2.8 | 5.5 | $0.127 | 0/2 | 61.0s |
| #60 | GPT-5.4 Mini medium | OpenAI | 6.9 | 7.5 | $0.756 | 1/2 | 59.6s |
| #39 | Seed-2.0-Lite medium | Bytedance Seed | 6.4 | 7.9 | $0.234 | 1/2 | 58.5s |
| #24 | GPT-5.2 medium | OpenAI | 10.0 | 8.4 | $0.951 | 2/2 | 58.5s |
| #2 | Gemini 3.6 Flash high | 10.0 | 9.7 | $1.785 | 2/2 | 56.3s | |
| #164 | KAT-Coder-Air V2.5 low | Kwaipilot | 6.4 | 5.4 | $0.041 | 1/2 | 55.9s |
| #77 | Grok 4.3 medium | X AI | 6.5 | 7.1 | $0.779 | 1/2 | 55.1s |
| #17 | Claude Opus 4.8 medium | Anthropic | 9.9 | 8.8 | $1.931 | 2/2 | 54.3s |
| #192 | Laguna M.1 medium | Poolside | 1.5 | 4.7 | $0.033 | 0/1 | 53.1s |
| #42 | GLM 5.2 medium | Z.ai | 5.0 | 7.8 | $0.187 | 1/1 | 52.0s |