常识问答 排名
看看哪些 AI 模型在 常识问答 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↓.
250/250
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 常识问答 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #136 | Claude Sonnet 5 none | Anthropic | 3.0 | 6.3 | $0.548 | 0/1 | 4.31s |
| #137 | MiMo-V2-Flash medium | Xiaomi | 3.0 | 6.3 | $0.043 | 0/1 | 1.96s |
| #138 | Qwen3.5-Flash medium | Qwen | 3.0 | 6.2 | $0.139 | 0/1 | 49.0s |
| #139 | Gemma 4 31B none | 3.0 | 6.2 | $0.018 | 0/1 | 1.25s | |
| #140 | Seed-2.0-Lite none | Bytedance Seed | 3.0 | 6.2 | $0.066 | 0/1 | 1.96s |
| #141 | GPT-5.6 Luna low | OpenAI | 3.0 | 6.2 | $0.025 | 0/1 | 4.86s |
| #142 | Gemini 2.5 Flash none | 3.0 | 6.2 | $0.017 | 0/1 | 1.15s | |
| #143 | Qwen3.5-35B-A3B medium | Qwen | 3.0 | 6.2 | $0.837 | 0/1 | 177.4s |
| #144 | Gemini 3.1 Flash Lite minimal | 3.0 | 6.1 | $0.047 | 0/1 | 724ms | |
| #145 | gpt-oss-120b medium | OpenAI | 3.0 | 6.1 | $0.019 | 0/1 | 26.5s |
| #146 | Qwen3.7 Flash none | Qwen | 3.0 | 6.1 | $0.019 | 0/1 | 766ms |
| #147 | Gemini 3.1 Flash Lite none | 3.0 | 6.1 | $0.046 | 0/1 | 733ms | |
| #148 | Inkling low | Thinkingmachines | 3.0 | 6.1 | $0.187 | 0/1 | 3.12s |
| #149 | Qwen3.6 Flash none | Qwen | 3.0 | 6.1 | $0.062 | 0/1 | 649ms |
| #150 | Qwen3.5-Flash none | Qwen | 3.0 | 6.1 | $0.073 | 0/1 | 588ms |