导航
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

已对比模型

Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium) 基准对比: Gemini 3.1 Pro Preview (medium) 在分数上以 9.2 领先。 Claude Opus 4.6 (medium) 在可靠性上以 10.0 领先。 GPT-5.3-Codex (medium) 的总成本最低,为 $0.920GPT-5.3-Codex (medium) 最快,为 16.96s

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-08-07

排名
#60
总输出令牌
100,601
响应时间(平均)
34.27s
总成本
$3.059
排名
#56
总输出令牌
115,865
响应时间(平均)
25.91s
总成本
$2.057
排名
#18
总输出令牌
55,525
响应时间(平均)
16.96s
总成本
$0.920
排名
#9
总输出令牌
97,958
响应时间(平均)
21.47s
总成本
$1.361
推荐模型 GPT-5.3-Codex (medium)

它的得分接近这里的最高分(8.9 vs 9.2),同时成本比本次比较中的其他模型低约 2.3 倍。

详细对比

指标 Claude Opus 4.6 Claude Opus 4.6 medium 发布日期: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium 发布日期: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium 发布日期: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium 发布日期: 2026-02-19
分数 7.7 7.8 8.9 9.2
排名 #60 #56 #18 #9
可靠性 10.0 10.0 10.0 10.0
一致性 8.8 9.2 8.6 10.0
基准测试覆盖率 22/22 项测试 · 66/66 次尝试 22/22 项测试 · 66/66 次尝试 22/22 项测试 · 66/66 次尝试 22/22 项测试 · 66/66 次尝试
测试正确
尝试通过率 63.6% 66.7% 83.3% 90.9%
不稳定测试 3 2 4 0
总运行次数 66 66 66 66
每个结果成本 23.524 14.692 5.748 6.801
总成本 $3.059 $2.057 $0.920 $1.361
输入价格 $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
输出价格 $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
总输入令牌 108,615 106,292 81,268 92,287
输出令牌 72,286 80,748 6,251 5,232
推理令牌 28,315 35,117 49,274 92,726
响应时间(平均) 34.27s 25.91s 16.96s 21.47s
响应时间(最大) 151.51s 140.96s 100.93s 88.68s
响应时间(总计) 513.99s 362.78s 373.19s 322.08s

模型生成展示

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 Claude Opus 4.6

medium
无效SVG
成本
$0.000
时间
300.0s
令牌
0 tok

#56 Claude Sonnet 4.6

medium
无效SVG
成本
$0.000
时间
300.0s
令牌
0 tok

#18 GPT-5.3-Codex

medium
成本
$0.049
时间
54.9s
令牌
3,580 tok

#9 Gemini 3.1 Pro Preview

medium
成本
$0.115
时间
87.2s
令牌
9,629 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

快速对比

切换对比组合