常识问答 排名
看看哪些 AI 模型在 常识问答 上表现最好,哪些更稳定,以及差距主要出现在哪里。 排序方式: 响应时间(平均) ↑.
364/364
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 常识问答 得分 | 分数 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #189 | Gemini 3.5 Flash minimal | 3.0 | 6.7 | $0.300 | 0/1 | 1.76s | |
| #342 | MiMo-V2-Flash none | Xiaomi | 3.0 | 4.0 | $0.025 | 0/1 | 1.82s |
| #234 | Nemotron 3 Ultra none | NVIDIA | 3.0 | 6.1 | $0.084 | 0/1 | 1.83s |
| #284 | DeepSeek V4 Flash 0731 none | DeepSeek | 3.0 | 5.4 | $0.021 | 0/1 | 1.85s |
| #41 | Gemini 3.5 Flash low | 10.0 | 8.8 | $0.449 | 1/1 | 1.88s | |
| #282 | MiMo-V2.5-Pro none | Xiaomi | 3.0 | 5.4 | $0.068 | 0/1 | 1.89s |
| #158 | GPT-5.6 Sol none | OpenAI | 3.0 | 7.0 | $0.201 | 0/1 | 1.95s |
| #216 | MiMo-V2-Flash medium | Xiaomi | 3.0 | 6.3 | $0.043 | 0/1 | 1.96s |
| #219 | Seed-2.0-Lite none | Bytedance Seed | 3.0 | 6.2 | $0.066 | 0/1 | 1.96s |
| #206 | Qwen3.6 Max Preview none | Qwen | 3.0 | 6.4 | $0.228 | 0/1 | 1.97s |
| #256 | Inkling Small low | Thinkingmachines | 3.0 | 5.7 | $0.055 | 0/1 | 2.00s |
| #235 | Trinity Large Thinking low | Arcee AI | 3.0 | 6.0 | $0.625 | 0/1 | 2.10s |
| #249 | Seed 2.1 Turbo none | Bytedance Seed | 3.0 | 5.9 | $0.092 | 0/1 | 2.12s |
| #263 | GLM 5V Turbo none | Z.ai | 3.0 | 5.6 | $0.052 | 0/1 | 2.23s |
| #294 | Granite 4.2 8B medium | IBM Granite | 3.0 | 5.2 | $0.008 | 0/1 | 2.24s |