常识问答 排名
看看哪些 AI 模型在 常识问答 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 响应时间(平均) ↑.
364/364
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 常识问答 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #200 | Qwen3.5 Plus 2026-02-15 none | Qwen | 3.0 | 6.6 | $0.073 | 0/1 | 1.11s |
| #236 | Gemini 2.5 Flash none | 3.0 | 6.0 | $0.017 | 0/1 | 1.15s | |
| #142 | Qwen3.7 Plus none | Qwen | 3.0 | 7.3 | $0.106 | 0/1 | 1.21s |
| #232 | Gemma 4 31B none | 3.0 | 6.1 | $0.016 | 0/1 | 1.25s | |
| #252 | Solar Pro 4 none | Upstage | 3.0 | 5.8 | $0.017 | 0/1 | 1.29s |
| #275 | Mimo V2 Omni none | Xiaomi | 3.0 | 5.5 | $0.021 | 0/1 | 1.30s |
| #278 | DeepSeek V4.1 Flash none | DeepSeek | 3.0 | 5.4 | $0.135 | 0/1 | 1.32s |
| #248 | GPT-5.4 Mini none | OpenAI | 3.0 | 5.9 | $0.095 | 0/1 | 1.33s |
| #195 | Gemini 3.1 Flash Lite Preview low | 3.0 | 6.6 | $0.646 | 0/1 | 1.35s | |
| #259 | Kimi K2.6 none | Moonshot AI | 3.0 | 5.7 | $0.233 | 0/1 | 1.36s |
| #148 | GPT-6 Sol none | OpenAI | 3.0 | 7.2 | $0.280 | 0/1 | 1.45s |
| #192 | Claude Opus 4.7 none | Anthropic | 3.0 | 6.6 | $0.505 | 0/1 | 1.46s |
| #197 | Gemini 3.1 Flash Lite low | 3.0 | 6.6 | $0.621 | 0/1 | 1.46s | |
| #267 | Mimo V2 PRO none | Xiaomi | 3.0 | 5.6 | $0.045 | 0/1 | 1.63s |
| #193 | Gemini 3.5 Flash Lite low | 4.7 | 6.6 | $0.138 | 0/1 | 1.65s |