AI BENCHY 分类
通用智能 排名
看看哪些 AI 模型在 通用智能 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↓.
| 排名 | 模型 | 公司 | 通用智能 得分 | 分数 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|
| #83 | Step 3.5 Flash none | Stepfun | 4.0 | 6.6 | 0/1 | 14.4s |
| #84 | Grok 4.20 Multi Agent Beta medium | X AI | 5.8 | 6.6 | 0/1 | 6.40s |
| #86 | Grok 4.1 Fast medium | X AI | 4.2 | 6.5 | 0/1 | 16.2s |
| #87 | Gemini 3.1 Flash Lite minimal | 4.0 | 6.4 | 0/1 | 791ms | |
| #88 | Qwen3.7 Plus none | Qwen | 5.3 | 6.4 | 0/1 | 1.33s |
| #89 | Hy3 preview low | Tencent | 3.0 | 6.4 | 0/1 | 0ms |
| #90 | Gemini 3.1 Flash Lite none | 4.0 | 6.4 | 0/1 | 992ms | |
| #92 | Laguna M.1 medium | Poolside | 3.0 | 6.4 | 0/1 | 0ms |
| #93 | Qwen3.6 Plus Preview medium | Qwen | 3.0 | 6.3 | 0/1 | 0ms |
| #94 | GPT-5 Nano medium | OpenAI | 4.1 | 6.3 | 0/1 | 17.5s |
| #95 | Qwen3.5 Plus 2026-02-15 none | Qwen | 4.4 | 6.3 | 0/1 | 2.26s |
| #96 | Ring-2.6-1T none | Inclusionai | 4.3 | 6.2 | 0/1 | 15.6s |
| #97 | Gemini 2.5 Flash none | 5.0 | 6.2 | 0/1 | 615ms | |
| #99 | gpt-oss-120b medium | OpenAI | 4.3 | 6.1 | 0/1 | 7.90s |
| #100 | Grok Build 0.1 none | X AI | 4.3 | 6.0 | 0/1 | 12.5s |