常识问答:无答案
常识问答
无答案
看看哪些 AI 模型在 常识问答 上最容易遇到 无答案,更快找出薄弱点。
13/13
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 无答案 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #12 | Grok 4.5 high | X AI | 1 | 3.0 | $1.707 | 0/1 | 60.6s |
| #14 | Claude Opus 4.8 medium | Anthropic | 1 | 3.0 | $1.931 | 0/1 | 6.14s |
| #17 | Claude Fable 5 medium | Anthropic | 1 | 3.0 | $3.478 | 0/1 | 25.6s |
| #29 | Step 3.7 Flash medium | Stepfun | 1 | 3.0 | $0.515 | 0/1 | 114.0s |
| #33 | Kimi K3 max | Moonshot AI | 1 | 3.0 | $3.112 | 0/1 | 19.7s |
| #38 | GLM 5.2 medium | Z.ai | 1 | 3.0 | $0.222 | 0/1 | 34.2s |
| #41 | Claude Opus 4.8 low | Anthropic | 1 | 3.0 | $2.077 | 0/1 | 5.48s |
| #47 | MiniMax M3 medium | Minimax | 1 | 3.0 | $0.286 | 0/1 | 100.8s |
| #66 | Claude Opus 4.8 none | Anthropic | 1 | 3.0 | $1.166 | 0/1 | 3.41s |
| #67 | Step 3.7 Flash low | Stepfun | 1 | 3.0 | $0.454 | 0/1 | 124.8s |
| #86 | Step 3.7 Flash high | Stepfun | 1 | 3.0 | $1.207 | 0/1 | 149.3s |
| #97 | LongCat 2.0 high | Meituan | 1 | 3.0 | $0.469 | 0/1 | 99.4s |
| #112 | Claude Sonnet 5 none | Anthropic | 1 | 3.0 | $0.548 | 0/1 | 4.31s |