导航
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Opus 4.7 vs Anthropic: Claude Sonnet 4.6

Claude Opus 4.7 (medium) 平均分领先,为 8.7 vs 7.8Claude Opus 4.7 (medium) benchmark 成本更低,为 $1.477 vs $2.057Claude Opus 4.7 (medium) 更快,为 7.61s vs 25.91s,通过率为 83.3% vs 66.7%

推荐模型Claude Opus 4.7 (medium)它在这里得分最高(8.7),同时响应速度比Claude Sonnet 4.6 (medium)快约 3.4 倍。

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-07-20

指标 Claude Opus 4.7 Claude Opus 4.7 medium 发布日期: 2026-04-16 Claude Sonnet 4.6 Claude Sonnet 4.6 medium 发布日期: 2026-02-17
分数 8.7 7.8
排名 #15 #40
可靠性 10.0 10.0
一致性 9.6 9.2
测试正确
尝试通过率 83.3% 66.7%
不稳定测试 1 2
总运行次数 66 66
每个结果成本 8.201 14.692
总成本 $1.477 $2.057
输入价格 $5.000 / 1M $3.000 / 1M
输出价格 $25.000 / 1M $15.000 / 1M
总输入令牌 145,252 106,292
输出令牌 24,948 80,748
推理令牌 5,042 35,117
响应时间(平均) 7.61s 25.91s
响应时间(最大) 65.40s 140.96s
响应时间(总计) 159.91s 362.78s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 Claude Opus 4.7

medium
成本
$0.059
时间
26.8s
令牌
2,475 tok

#40 Claude Sonnet 4.6

medium
无效SVG
成本
$0.000
时间
300.0s
令牌
0 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686

快速对比

切换对比组合