谜题求解:答案错误
谜题求解
答案错误
看看哪些 AI 模型在 谜题求解 上最容易遇到 答案错误,更快找出薄弱点。
142/142
筛选模型
没有模型匹配当前搜索和筛选条件。
| 排名 | 模型 | 公司 | 答案错误 次数 | 分类得分 | 总成本 | 测试正确 | 响应时间(平均) |
|---|---|---|---|---|---|---|---|
| #125 | Qwen3.5-Flash none | Qwen | 3 | 3.1 | $0.073 | 0/3 | 10.9s |
| #137 | North Mini Code medium | Cohere | 3 | 3.3 | $0.000 | 0/3 | 19.7s |
| #144 | KAT-Coder-Air V2.5 high | Kwaipilot | 3 | 3.5 | $0.077 | 0/3 | 2.47s |
| #149 | KAT-Coder-Air V2.5 medium | Kwaipilot | 3 | 3.6 | $0.048 | 0/3 | 1.87s |
| #155 | Kimi K2.5 none | Moonshot AI | 3 | 3.0 | $0.127 | 0/3 | 4.04s |
| #160 | Laguna XS 2.1 none | Poolside | 3 | 3.0 | $0.008 | 0/3 | 1.01s |
| #166 | Qwen3 Coder Next none | Qwen | 3 | 3.0 | $0.025 | 0/3 | 24.3s |
| #182 | KAT-Coder-Air V2.5 none | Kwaipilot | 3 | 2.9 | $0.067 | 0/3 | 1.84s |
| #189 | Mercury 2 none | Inception | 3 | 3.1 | $0.030 | 0/3 | 535ms |
| #203 | Grok 4.1 Fast none | X AI | 3 | 3.0 | $0.008 | 0/3 | 1.10s |
| #29 | Step 3.7 Flash medium | Stepfun | 2 | 5.7 | $0.515 | 1/3 | 6.19s |
| #51 | Nemotron 3 Ultra medium | NVIDIA | 2 | 5.5 | $0.774 | 1/3 | 3.54s |
| #53 | GPT-5.4 Nano medium | OpenAI | 2 | 4.1 | $0.138 | 0/3 | 3.79s |
| #60 | LongCat 2.0 medium | Meituan | 2 | 5.4 | $0.478 | 1/3 | 8.84s |
| #62 | KAT-Coder-Pro V2.5 low | Kwaipilot | 2 | 6.4 | $0.387 | 1/3 | 3.11s |