AI BENCHY
Your ad here

AI BENCHY 失败分析

答案错误 失败

看看哪些 AI 模型最常遇到 答案错误,让你在选择前先发现稳定性风险。

显示的模型数

15

失败总数

572

受影响最多的模型

GPT-4o-mini 13
排名 模型 公司 答案错误 次数 分数 测试正确 响应时间(平均)
#75 GLM 5.1 none Z.ai 10 5.6 5/18 4.33s
#77 GLM 5 Turbo none Z.ai 10 5.5 6/18 2.94s
#79 Grok 4.20 Beta none X AI 10 5.3 4/18 1.19s
#86 GPT-5.4 Mini none OpenAI 10 5.1 5/18 1.17s
#88 Nemotron 3 Super none NVIDIA 10 5.1 4/18 8.54s
#90 Qwen3.5-9B none Qwen 10 4.8 4/18 1.47s
#49 Qwen3.5 Plus 2026-02-15 none Qwen 9 6.8 9/18 2.60s
#53 GLM 5 none Z.ai 9 6.6 9/18 4.23s
#59 Qwen3.5-Flash none Qwen 9 6.2 8/18 3.25s
#63 Qwen3.5-35B-A3B none Qwen 9 6.1 7/18 3.82s
#65 MiMo-V2-Pro none Xiaomi 9 6.0 7/18 2.39s
#72 Hunter Alpha none OpenRouter 9 5.7 6/18 4.58s
#81 Elephant medium Openrouter 9 5.2 5/18 1.27s
#82 Grok 4.20 none X AI 9 5.2 5/18 1.11s
#85 Elephant none Openrouter 9 5.2 5/18 1.23s

按 答案错误 次数 排名的顶级模型

答案错误 次数 对比 分数

按 响应时间(平均) 排名的顶级模型