常识问答 排名
看看哪些 AI 模型在 常识问答 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 响应时间(平均) ↓.
364/364
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 常识问答 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #271 | Hy4 preview low | Tencent | 3.0 | 5.6 | $1.745 | 0/1 | 597.4s |
| #36 | Qwen3.8 Max (0902) high | Qwen | 3.0 | 8.9 | $2.736 | 0/1 | 532.6s |
| #66 | MiMo-V2.6-Pro medium | Xiaomi | 2.8 | 8.4 | $0.477 | 0/1 | 527.1s |
| #78 | Qwen3.8 2.4T A95B low | Qwen | 3.0 | 8.1 | $2.672 | 0/1 | 422.5s |
| #204 | Space Bunny Alpha xhigh | Stealth | 3.0 | 6.5 | $0.000 | 0/1 | 367.8s |
| #134 | MiMo-V2.6-Flash medium | Xiaomi | 3.0 | 7.4 | $0.190 | 0/1 | 357.3s |
| #133 | Qwen3.8 2.4T A95B high | Qwen | 3.0 | 7.4 | $2.357 | 0/1 | 348.0s |
| #130 | Kimi K2.7 Code medium | Moonshot AI | 3.0 | 7.4 | $0.671 | 0/1 | 341.8s |
| #250 | Space Bunny Alpha low | Stealth | 3.0 | 5.9 | $0.000 | 0/1 | 340.9s |
| #253 | North Mini Code medium | Cohere | 3.0 | 5.7 | $0.000 | 0/1 | 305.0s |
| #65 | Qwen3.8 27B high | Qwen | 3.0 | 8.4 | ~$0.287 | 0/1 | 264.0s |
| #328 | Granite 4.2 8B high | IBM Granite | 3.0 | 4.6 | $0.135 | 0/1 | 252.5s |
| #84 | DeepSeek V4 Flash 0731 low | DeepSeek | 3.0 | 8.0 | $0.138 | 0/1 | 246.9s |
| #161 | Space Bunny Alpha high | Stealth | 3.0 | 7.0 | $0.000 | 0/1 | 234.6s |
| #245 | Mimo V2 Omni medium | Xiaomi | 3.0 | 5.9 | $0.683 | 0/1 | 234.2s |