AI BENCHY
Your ad here

AI BENCHY 失败分析

答案错误 失败

看看哪些 AI 模型最常遇到 答案错误,让你在选择前先发现稳定性风险。 排序方式: 响应时间(平均) ↓.

显示的模型数

15

失败总数

572

受影响最多的模型

Qwen3.5-9B 1
排名 模型 公司 答案错误 次数 分数 测试正确 响应时间(平均)
#50 Hunter Alpha medium OpenRouter 4 6.7 8/18 10.3s
#47 Grok 4.20 medium X AI 3 7.0 9/18 10.3s
#87 Qwen3 Coder Next none Qwen 12 5.1 4/18 10.2s
#25 Grok 4.20 Beta medium X AI 3 8.0 12/18 9.81s
#56 Grok 4.20 Multi Agent Beta medium X AI 3 6.4 7/18 9.80s
#12 Gemini 3 PRO Preview medium Google 3 8.4 14/18 9.06s
#88 Nemotron 3 Super none NVIDIA 10 5.1 4/18 8.54s
#28 GPT-5.2 Chat none OpenAI 5 7.9 12/18 6.84s
#60 Gemma 4 26B A4B none Google 7 6.2 7/18 6.59s
#5 Gemini 3 Flash Preview low Google 3 8.8 15/18 6.01s
#36 GPT-5.3 Chat none OpenAI 5 7.7 11/18 5.88s
#73 Mistral Small 4 medium Mistral 8 5.7 5/18 5.64s
#78 Trinity Large Preview none Arcee AI 11 5.3 5/18 5.07s
#42 Claude Sonnet 4.6 none Anthropic 3 7.4 11/18 4.98s
#72 Hunter Alpha none OpenRouter 9 5.7 6/18 4.58s

按 答案错误 次数 排名的顶级模型

答案错误 次数 对比 分数

按 响应时间(平均) 排名的顶级模型