AI BENCHY
Advertise here

AI BENCHY 分类失败

谜题求解:答案错误

谜题求解
答案错误

看看哪些 AI 模型在 谜题求解 上最容易遇到 答案错误,更快找出薄弱点。

显示的模型数

15

失败总数

147

受影响最多的模型

Qwen3.5-Flash 3
排名 模型 公司 答案错误 次数 分类得分 测试正确 响应时间(平均)
#124 Kimi K2.6 none Moonshot AI 2 3.1 0/3 1.40s
#127 Grok 4.20 none X AI 2 5.3 1/3 473ms
#128 Qwen3.6 Flash none Qwen 2 3.5 0/3 1.21s
#131 Qwen3.5-122B-A10B none Qwen 2 3.8 0/3 1.00s
#132 Mistral Small 4 medium Mistral 2 3.4 0/3 2.17s
#137 Elephant Alpha none Openrouter 2 4.2 0/3 807ms
#138 Ling-2.6-flash none Inclusionai 2 2.9 0/3 6.51s
#142 Mistral Small 4 none Mistral 2 3.1 0/3 399ms
#145 Laguna M.1 none Poolside 2 3.0 0/3 891ms
#147 GPT-4o-mini none OpenAI 2 3.5 0/3 1.21s
#149 Nemotron 3 Nano Omni 30b A3b Reasoning medium NVIDIA 2 2.9 0/3 1.40s
#150 Qwen3 Coder Next medium Qwen 2 3.0 0/3 1.25s
#151 Trinity Large Preview none Arcee AI 2 3.6 0/3 1.97s
#152 MiMo-V2-Flash none Xiaomi 2 5.3 1/3 1.86s
#154 Qwen3.5-9B none Qwen 2 3.2 0/3 621ms

按 答案错误 次数 排名的顶级模型

答案错误 次数 对比 分数

按 响应时间(平均) 排名的顶级模型

按 预估浪费成本 排名的顶级模型