AI BENCHY 对比

已对比模型

摘要

Qwen3.7 Max vs Qwen3.7 Plus vs Claude Opus 4.7 基准对比Qwen3.7 Max 在分数上以 9.4 领先。 Qwen3.7 Max 在可靠性上以 10.0 领先。 Qwen3.7 Plus 的总成本最低，为 $0.177。 Claude Opus 4.7 最快，为 4.73s。

推荐模型: Claude Opus 4.7 - 它的得分接近这里的最高分（8.7 vs 9.4），同时响应速度比本次比较中的其他模型快约 5.8 倍。

基准结果生成自 AI BENCHY 测试套件，时间：: 2026-06-12

指标	Qwen3.7 Max Qwen3.7 Max medium 发布日期: 2026-05-22	Qwen3.7 Plus Qwen3.7 Plus medium 发布日期: 2026-06-03	Claude Opus 4.7 Claude Opus 4.7 medium 发布日期: 2026-04-16

指标	Qwen3.7 Max Qwen3.7 Max medium 发布日期: 2026-05-22	Qwen3.7 Plus Qwen3.7 Plus medium 发布日期: 2026-06-03	Claude Opus 4.7 Claude Opus 4.7 medium 发布日期: 2026-04-16
分数	9.4	8.2	8.7
排名	#4	#28	#17
可靠性	10.0	10.0	10.0
一致性	9.6	9.1	9.6
测试正确
尝试通过率	88.9%	77.8%	82.5%
不稳定测试	1	2	1
总运行次数	63	63	63
每个结果成本	5.517	1.474	3.991
总成本	$0.523	$0.177	$0.679
输入价格	$1.250 / 1M	$0.320 / 1M	$5.000 / 1M
输出价格	$3.750 / 1M	$1.280 / 1M	$25.000 / 1M
总输入令牌	42,360	40,939	65,406
输出令牌	2,129	2,125	11,858
推理令牌	122,959	125,754	2,198
响应时间（平均）	16.02s	38.95s	4.73s
响应时间（最大）	59.98s	178.04s	23.18s
响应时间（总计）	336.51s	817.85s	94.51s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#4 Qwen3.7 Max

medium

Cost: $0.017
Time: 68.8s
Tokens: 4,526 tok

#28 Qwen3.7 Plus

medium

Cost: $0.018
Time: 193.2s
Tokens: 10,821 tok

#17 Claude Opus 4.7

medium

Cost: $0.059
Time: 26.8s
Tokens: 2,475 tok

按分数排名的模型

分数 vs 总成本

响应时间（平均）

分数 vs 响应时间（平均）

总输出令牌

分数 vs 总输出令牌

类别细分

反AI技巧	分数	一致性	尝试通过率	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.7 Max	10.0	10.0	100.0%	6.36s	672	222	8,742
Qwen3.7 Plus	10.0	10.0	100.0%	8.58s	672	195	5,065
Claude Opus 4.7	8.3	10.0	75.0%	1.85s	894	348	0

编程	分数	一致性	尝试通过率	不稳定测试	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.7 Max	10.0	10.0	100.0%	0	35.31s	7,893	423	34,808
Qwen3.7 Plus	6.1	6.6	55.6%	1	108.60s	6,472	414	43,576
Claude Opus 4.7	7.6	7.2	77.8%	1	12.96s	10,635	7,629	1,114

综合	分数	一致性	尝试通过率	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.7 Max	10.0	10.0	100.0%	19.60s	14,934	366	8,405
Qwen3.7 Plus	10.0	10.0	100.0%	65.24s	14,934	366	10,132
Claude Opus 4.7	10.0	10.0	100.0%	21.45s	24,501	2,369	1,084

数据解析与提取	分数	一致性	尝试通过率	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.7 Max	10.0	10.0	100.0%	8.80s	7,782	270	6,254
Qwen3.7 Plus	10.0	10.0	100.0%	21.75s	7,782	270	6,713
Claude Opus 4.7	10.0	10.0	100.0%	2.37s	10,533	324	0

领域专项	分数	一致性	尝试通过率	不稳定测试	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.7 Max	5.9	7.2	55.6%	1	24.94s	771	61	31,793
Qwen3.7 Plus	3.6	7.2	22.2%	1	45.35s	771	57	27,073
Claude Opus 4.7	7.7	10.0	66.7%	0	1.17s	630	51	0

通用智能	分数	一致性	尝试通过率	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.7 Max	10.0	10.0	100.0%	11.70s	516	135	4,457
Qwen3.7 Plus	10.0	10.0	100.0%	25.48s	516	123	3,998
Claude Opus 4.7	10.0	10.0	100.0%	2.87s	723	256	0

指令遵循	分数	一致性	尝试通过率	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.7 Max	10.0	10.0	100.0%	7.46s	699	102	5,452
Qwen3.7 Plus	10.0	10.0	100.0%	16.13s	699	102	5,013
Claude Opus 4.7	10.0	10.0	100.0%	1.57s	939	114	0

谜题求解	分数	一致性	尝试通过率	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.7 Max	10.0	10.0	100.0%	8.84s	696	259	8,908
Qwen3.7 Plus	10.0	10.0	100.0%	16.38s	696	280	7,312
Claude Opus 4.7	10.0	10.0	100.0%	2.43s	939	370	0

工具调用	分数	一致性	尝试通过率	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.7 Max	10.0	10.0	100.0%	6.63s	8,193	267	1,220
Qwen3.7 Plus	10.0	10.0	100.0%	15.02s	8,193	292	1,831
Claude Opus 4.7	10.0	10.0	100.0%	4.17s	15,339	373	0

常识问答	分数	一致性	尝试通过率	响应时间（平均）	输入令牌	输出令牌	推理令牌
Qwen3.7 Max	3.0	10.0	0.0%	33.37s	204	24	12,920
Qwen3.7 Plus	3.0	10.0	0.0%	91.07s	204	26	15,041
Claude Opus 4.7	3.0	10.0	0.0%	2.25s	273	24	0

快速对比

切换对比组合

GPT-5.5lowvsQwen3.7 Maxmedium DeepSeek V4 FlashhighvsQwen3.7 Plusmedium Gemini 3.5 FlashlowvsQwen3.7 Maxmedium Claude Opus 4.7mediumvsGPT-5.2 Chatnone GPT-5.2 ChatnonevsQwen3.7 Plusmedium Claude Opus 4.7mediumvsDeepSeek V4 Flashhigh Gemini 3.5 FlashhighvsQwen3.7 Maxmedium Qwen3.7 PlusmediumvsStep 3.7 Flashlow Claude Opus 4.7mediumvsGemini 3.5 Flashlow Claude Opus 4.7mediumvsGPT-5.5low GPT-5.3 ChatnonevsQwen3.7 Plusmedium Gemini 3 Flash PreviewlowvsQwen3.7 Plusmedium