常识问答 排名
看看哪些 AI 模型在 常识问答 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 响应时间(平均) ↓.
250/250
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 常识问答 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #37 | Muse Spark 1.1 low | Meta | 3.0 | 8.3 | $0.647 | 0/1 | 8.17s |
| #187 | Laguna S 2.1 medium | Poolside | 3.0 | 5.4 | $0.053 | 0/1 | 7.11s |
| #36 | Claude Sonnet 5 medium | Anthropic | 3.0 | 8.3 | $0.922 | 0/1 | 7.06s |
| #11 | Claude Opus 5 medium | Anthropic | 3.0 | 9.2 | $1.486 | 0/1 | 7.03s |
| #7 | GPT-5.6 Sol high | OpenAI | 4.7 | 9.4 | $1.234 | 0/1 | 6.97s |
| #191 | Laguna S 2.1 high | Poolside | 3.0 | 5.4 | $0.114 | 0/1 | 6.94s |
| #44 | GPT-5.2 Chat none | OpenAI | 3.0 | 8.0 | $0.604 | 0/1 | 6.89s |
| #67 | GPT-5.6 Luna medium | OpenAI | 3.0 | 7.6 | $0.036 | 0/1 | 6.64s |
| #28 | Claude Opus 5 low | Anthropic | 3.0 | 8.6 | $1.121 | 0/1 | 6.48s |
| #1 | Gemini 3.6 Flash high | 10.0 | 10.0 | $1.305 | 1/1 | 6.35s | |
| #9 | Gemini 3.1 Pro Preview medium | 10.0 | 9.2 | $1.361 | 1/1 | 6.27s | |
| #19 | Claude Opus 4.8 medium | Anthropic | 3.0 | 8.8 | $1.931 | 0/1 | 6.14s |
| #73 | GPT-5.6 Terra low | OpenAI | 3.0 | 7.5 | $0.208 | 0/1 | 5.95s |
| #200 | Mistral Small 4 medium | Mistral | 3.0 | 5.1 | $0.096 | 0/1 | 5.92s |
| #103 | DeepSeek V4 Pro none | DeepSeek | 3.0 | 6.9 | $0.096 | 0/1 | 5.76s |