常识问答 排名
看看哪些 AI 模型在 常识问答 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 测试正确 ↑.
364/364
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 常识问答 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #65 | Qwen3.8 27B high | Qwen | 3.0 | 8.4 | ~$0.287 | 0/1 | 264.0s |
| #66 | MiMo-V2.6-Pro medium | Xiaomi | 2.8 | 8.4 | $0.477 | 0/1 | 527.1s |
| #67 | Seed 2.1 Turbo medium | Bytedance Seed | 3.0 | 8.4 | $1.951 | 0/1 | 91.0s |
| #68 | GPT-6 Sol low | OpenAI | 4.7 | 8.4 | $0.273 | 0/1 | 3.67s |
| #69 | Inkling Small high | Thinkingmachines | 3.0 | 8.4 | $0.398 | 0/1 | 49.3s |
| #70 | GLM 5.3 FlashX max | Z.ai | 3.0 | 8.3 | $0.508 | 0/1 | 22.4s |
| #71 | DeepSeek V4.1 Flash max | DeepSeek | 3.0 | 8.3 | $0.379 | 0/1 | 98.5s |
| #72 | Muse Spark 1.1 low | Meta | 3.0 | 8.3 | $0.673 | 0/1 | 8.17s |
| #73 | GPT-6 Luna high | OpenAI | 3.0 | 8.3 | $0.054 | 0/1 | 4.90s |
| #74 | Claude Fable 5.1 medium | Anthropic | 2.8 | 8.3 | $2.909 | 0/1 | 24.3s |
| #75 | Gemini 2.5 Flash medium | 3.0 | 8.2 | $0.644 | 0/1 | 2.76s | |
| #76 | Muse Spark 1.3 low | Meta | 3.0 | 8.2 | $0.689 | 0/1 | 23.4s |
| #77 | Claude Sonnet 5 medium | Anthropic | 3.0 | 8.2 | $0.922 | 0/1 | 7.06s |
| #78 | Qwen3.8 2.4T A95B low | Qwen | 3.0 | 8.1 | $2.672 | 0/1 | 422.5s |
| #79 | GPT-5 Mini medium | OpenAI | 3.0 | 8.1 | $0.241 | 0/1 | 9.99s |