反AI技巧 x 答案错误排名

看看哪些 AI 模型在反AI技巧上最容易遇到答案错误，更快找出薄弱点。

显示的模型数

失败总数

293

受影响最多的模型

Seed-2.0-Lite 4

失败原因

答案错误293 未遵循指令33 额外格式20 API 错误14 无答案4 超时4

分类

领域专项421 反AI技巧293 编程259 谜题求解204 常识问答172 综合69 通用智能62 指令遵循61 数据解析与提取41 工具调用3

140/140

排名	模型	公司	答案错误次数	分类得分	总成本	测试正确	响应时间（平均）
#188	KAT-Coder-Air V2.5 none	Kwaipilot	3	5.3	$0.067	1/4	2.68s
总测试数 4 错误测试数 3 总成本 $0.067 响应时间（平均） 2.68s
#193	Qwen3 Coder Next medium	Qwen	3	3.5	$0.032	0/4	8.64s
总测试数 4 错误测试数 4 总成本 $0.032 响应时间（平均） 8.64s
#198	Laguna M.1 none	Poolside	3	3.4	$0.009	0/4	705ms
总测试数 4 错误测试数 4 总成本 $0.009 响应时间（平均） 705ms
#203	Grok 4.20 none	X AI	3	4.8	$0.057	1/4	501ms
总测试数 4 错误测试数 3 总成本 $0.057 响应时间（平均） 501ms
#209	Grok 4.1 Fast none	X AI	3	3.2	$0.008	0/4	1.07s
总测试数 4 错误测试数 4 总成本 $0.008 响应时间（平均） 1.07s
#216	LFM2-24B-A2B none	Liquid	3	2.5	$0.001	0/3	471ms
总测试数 3 错误测试数 3 总成本 $0.001 响应时间（平均） 471ms
#27	Muse Spark 1.1 low	Meta	2	7.9	$0.647	2/4	4.36s
总测试数 4 错误测试数 2 总成本 $0.647 响应时间（平均） 4.36s
#50	DeepSeek V4 Pro high	DeepSeek	2	5.7	$0.200	1/4	25.7s
总测试数 4 错误测试数 3 总成本 $0.200 响应时间（平均） 25.7s
#51	MiniMax M3 medium	Minimax	2	5.5	$0.286	1/4	14.9s
总测试数 4 错误测试数 3 总成本 $0.286 响应时间（平均） 14.9s
#56	Kimi K2.7 Code medium	Moonshot AI	2	7.3	$0.740	2/4	11.6s
总测试数 4 错误测试数 2 总成本 $0.740 响应时间（平均） 11.6s
#63	Qwen3.7 Max none	Qwen	2	6.5	$0.197	2/4	1.08s
总测试数 4 错误测试数 2 总成本 $0.197 响应时间（平均） 1.08s
#66	KAT-Coder-Pro V2.5 low	Kwaipilot	2	6.9	$0.387	2/4	4.20s
总测试数 4 错误测试数 2 总成本 $0.387 响应时间（平均） 4.20s
#73	KAT-Coder-Pro V2.5 high	Kwaipilot	2	7.0	$0.482	2/4	3.17s
总测试数 4 错误测试数 2 总成本 $0.482 响应时间（平均） 3.17s
#75	Qwen3.7 Plus none	Qwen	2	6.5	$0.106	2/4	1.38s
总测试数 4 错误测试数 2 总成本 $0.106 响应时间（平均） 1.38s
#86	DeepSeek V4 Pro none	DeepSeek	2	3.2	$0.096	0/4	4.02s
总测试数 4 错误测试数 4 总成本 $0.096 响应时间（平均） 4.02s

筛选模型

按答案错误次数排名的顶级模型

答案错误次数对比分数

按响应时间（平均）排名的顶级模型

按预估浪费成本排名的顶级模型

反AI技巧：答案错误

筛选模型

按 答案错误 次数 排名的顶级模型

答案错误 次数 对比 分数

按 响应时间（平均） 排名的顶级模型

按 预估浪费成本 排名的顶级模型

按答案错误次数排名的顶级模型

答案错误次数对比分数

按响应时间（平均）排名的顶级模型

按预估浪费成本排名的顶级模型