综合 排名
看看哪些 AI 模型在 综合 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↓.
316/316
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 综合 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #187 | Gemini 3.1 Flash Lite minimal | 3.0 | 6.1 | $0.047 | 0/2 | 7.75s | |
| #188 | Qwen3.5-35B-A3B medium | Qwen | 3.8 | 6.1 | $0.675 | 0/2 | 512.8s |
| #190 | Qwen3.7 Flash none | Qwen | 3.8 | 6.1 | $0.019 | 0/2 | 94.6s |
| #191 | Gemini 3.1 Flash Lite none | 3.0 | 6.1 | $0.046 | 0/2 | 9.49s | |
| #193 | Inkling low | Thinkingmachines | 2.9 | 6.1 | $0.187 | 0/2 | 22.7s |
| #194 | Trinity Large Thinking medium | Arcee AI | 2.9 | 6.1 | $0.756 | 0/2 | 382.7s |
| #195 | Qwen3.6 Flash none | Qwen | 3.8 | 6.1 | $0.062 | 0/2 | 26.5s |
| #196 | Gemma 4 31B none | 3.8 | 6.1 | $0.016 | 0/2 | 30.0s | |
| #198 | Nemotron 3 Ultra none | NVIDIA | 3.0 | 6.1 | $0.093 | 0/2 | 21.1s |
| #199 | Trinity Large Thinking low | Arcee AI | 5.2 | 6.0 | $0.625 | 0/2 | 291.0s |
| #200 | Gemini 2.5 Flash none | 3.0 | 6.0 | $0.017 | 0/2 | 61.2s | |
| #202 | GPT-5.6 Terra none | OpenAI | 2.9 | 6.0 | $0.280 | 0/2 | 7.02s |
| #203 | Gemini 3 PRO Preview medium | 1.5 | 6.0 | $0.385 | 0/1 | 10.4s | |
| #205 | Qwen3.5-Flash none | Qwen | 2.9 | 6.0 | $0.073 | 0/2 | 243.6s |
| #206 | Qwen3.5-35B-A3B none | Qwen | 3.8 | 5.9 | $0.076 | 0/2 | 128.3s |