导航
AI BENCHY
Advertise here

Nemotron 3 Ultra (medium) vs Qwen3.7 Plus (medium)

Qwen3.7 Plus (medium) 平均分领先,为 7.9 vs 7.5Qwen3.7 Plus (medium) benchmark 成本更低,为 $0.267 vs $0.774Nemotron 3 Ultra (medium) 更快,为 32.21s vs 51.51s,通过率为 68.2% vs 75.8%

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-07-28

排名
#59
总输出令牌
185,978
响应时间(平均)
32.21s
总成本
$0.774
排名
#43
总输出令牌
179,429
响应时间(平均)
51.51s
总成本
$0.267
推荐模型 Qwen3.7 Plus (medium)

它在这里得分最高(7.9),同时成本比Nemotron 3 Ultra (medium)低约 2.9 倍。

详细对比

指标 Nemotron 3 Ultra Nemotron 3 Ultra medium 发布日期: 2026-06-04 免费可用 Qwen3.7 Plus Qwen3.7 Plus medium 发布日期: 2026-06-03
分数 7.5 7.9
排名 #59 #43
可靠性 9.8 10.0
一致性 8.5 8.9
测试正确
尝试通过率 68.2% 75.8%
不稳定测试 4 3
总运行次数 66 66
每个结果成本 0.000 2.072
总成本 $0.774 $0.267
输入价格 $0.600 / 1M $0.320 / 1M
输出价格 $3.600 / 1M $1.280 / 1M
总输入令牌 233,488 115,233
输出令牌 57,916 6,162
推理令牌 128,062 173,267
响应时间(平均) 32.21s 51.51s
响应时间(最大) 392.56s 315.30s
响应时间(总计) 708.65s 1133.15s

模型生成展示

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#59 Nemotron 3 Ultra

medium
无效SVG
成本
$0.000
时间
300.0s
令牌
0 tok

#43 Qwen3.7 Plus

medium
成本
$0.018
时间
193.2s
令牌
10,821 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Nemotron 3 Ultra 8.4 7.4 88.9% 1 26.53s 7,686 2,854 17,725
Qwen3.7 Plus 6.1 6.6 55.6% 1 108.60s 6,472 414 43,576

快速对比

切换对比组合