编程 x 答案错误排名

AI BENCHY 分类失败

看看哪些 AI 模型在编程上最容易遇到答案错误，更快找出薄弱点。

显示的模型数

失败总数

230

受影响最多的模型

Qwen3.6 Flash 3

失败原因

答案错误230 API 错误43 超时23 无答案18 未遵循指令16 额外格式12

分类

领域专项367 反AI技巧270 编程230 谜题求解172 常识问答149 综合58 指令遵循56 通用智能49 数据解析与提取36 工具调用3

134/134

排名	模型	公司	答案错误次数	分类得分	总成本	测试正确	响应时间（平均）
#59	Qwen3.6 Flash medium	Qwen	3	5.0	$0.288	0/3	42.9s
总测试数 3 错误测试数 3 总成本 $0.288 响应时间（平均） 42.9s
#115	Qwen3.6 Max Preview none	Qwen	3	3.8	$0.075	0/3	3.12s
总测试数 3 错误测试数 3 总成本 $0.075 响应时间（平均） 3.12s
#117	GLM 5 none	Z.ai	3	4.0	$0.027	0/3	5.12s
总测试数 3 错误测试数 3 总成本 $0.027 响应时间（平均） 5.12s
#122	Qwen3.5 Plus 2026-02-15 none	Qwen	3	4.3	$0.016	0/3	2.05s
总测试数 3 错误测试数 3 总成本 $0.016 响应时间（平均） 2.05s
#123	North Mini Code medium	Cohere	3	4.5	$0.000	0/3	320.4s
总测试数 3 错误测试数 3 总成本 $0.000 响应时间（平均） 320.4s
#131	Claude Sonnet 5 none	Anthropic	3	4.6	$0.287	0/3	3.67s
总测试数 3 错误测试数 3 总成本 $0.287 响应时间（平均） 3.67s
#133	GLM 5.1 none	Z.ai	3	3.9	$0.057	0/3	4.96s
总测试数 3 错误测试数 3 总成本 $0.057 响应时间（平均） 4.96s
#134	DeepSeek V4 Flash none	DeepSeek	3	4.2	$0.007	0/3	17.1s
总测试数 3 错误测试数 3 总成本 $0.007 响应时间（平均） 17.1s
#140	GLM 5 Turbo none	Z.ai	3	3.9	$0.047	0/3	2.41s
总测试数 3 错误测试数 3 总成本 $0.047 响应时间（平均） 2.41s
#141	Laguna XS 2.1 none	Poolside	3	4.3	$0.003	0/3	623ms
总测试数 3 错误测试数 3 总成本 $0.003 响应时间（平均） 623ms
#142	GPT-5.6 Luna none	OpenAI	3	3.8	$0.047	0/3	980ms
总测试数 3 错误测试数 3 总成本 $0.047 响应时间（平均） 980ms
#144	Qwen3.5-122B-A10B none	Qwen	3	3.7	$0.020	0/3	2.77s
总测试数 3 错误测试数 3 总成本 $0.020 响应时间（平均） 2.77s
#148	Mistral Small 4 none	Mistral	3	3.7	$0.007	0/3	901ms
总测试数 3 错误测试数 3 总成本 $0.007 响应时间（平均） 901ms
#149	Qwen3 Coder Next none	Qwen	3	4.6	$0.009	0/3	2.22s
总测试数 3 错误测试数 3 总成本 $0.009 响应时间（平均） 2.22s
#150	North Mini Code none	Cohere	3	3.9	$0.000	0/3	22.0s
总测试数 3 错误测试数 3 总成本 $0.000 响应时间（平均） 22.0s

筛选模型

按答案错误次数排名的顶级模型

答案错误次数对比分数

按响应时间（平均）排名的顶级模型

按预估浪费成本排名的顶级模型

编程：答案错误

筛选模型

按 答案错误 次数 排名的顶级模型

答案错误 次数 对比 分数

按 响应时间（平均） 排名的顶级模型

按 预估浪费成本 排名的顶级模型

按答案错误次数排名的顶级模型

答案错误次数对比分数

按响应时间（平均）排名的顶级模型

按预估浪费成本排名的顶级模型