常识问答 排名
看看哪些 AI 模型在 常识问答 上表现最好,哪些更稳定,以及差距主要出现在哪里。
250/250
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 常识问答 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #31 | Qwen3.6 Max Preview medium | Qwen | 3.0 | 8.4 | $1.129 | 0/1 | 60.6s |
| #32 | Grok 4.5 low | X AI | 3.0 | 8.4 | $0.935 | 0/1 | 14.0s |
| #33 | GPT-5.2 medium | OpenAI | 3.0 | 8.4 | $0.951 | 0/1 | 28.2s |
| #34 | Inkling Small high | Thinkingmachines | 3.0 | 8.4 | $0.412 | 0/1 | 49.3s |
| #35 | Grok 4.5 medium | X AI | 3.0 | 8.3 | $1.928 | 0/1 | 74.4s |
| #36 | Claude Sonnet 5 medium | Anthropic | 3.0 | 8.3 | $0.922 | 0/1 | 7.06s |
| #37 | Muse Spark 1.1 low | Meta | 3.0 | 8.3 | $0.647 | 0/1 | 8.17s |
| #38 | Gemini 2.5 Flash medium | 3.0 | 8.2 | $0.643 | 0/1 | 2.76s | |
| #39 | DeepSeek V4 Flash 0731 low | DeepSeek | 3.0 | 8.2 | $0.034 | 0/1 | 246.9s |
| #40 | GPT-5 Mini medium | OpenAI | 3.0 | 8.1 | $0.237 | 0/1 | 9.99s |
| #41 | Muse Spark 1.1 high | Meta | 3.0 | 8.1 | $1.694 | 0/1 | 22.9s |
| #42 | Inkling high | Thinkingmachines | 3.0 | 8.0 | $1.006 | 0/1 | 153.6s |
| #43 | Step 3.7 Flash medium | Stepfun | 3.0 | 8.0 | $0.515 | 0/1 | 114.0s |
| #44 | GPT-5.2 Chat none | OpenAI | 3.0 | 8.0 | $0.604 | 0/1 | 6.89s |
| #45 | GLM 5.2 high | Z.ai | 3.0 | 8.0 | $0.466 | 0/1 | 127.8s |