导航
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

已对比模型

Nemotron 3 Super (medium) vs Qwen3.5-122B-A10B (medium) vs Elephant Alpha (medium) vs gpt-oss-120b (medium) 基准对比: Qwen3.5-122B-A10B (medium) 在分数上以 7.1 领先。 Qwen3.5-122B-A10B (medium) 在可靠性上以 10.0 领先。 Elephant Alpha (medium) 的总成本最低,为 $0.000Elephant Alpha (medium) 最快,为 1.27s

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-09-04

排名
#217
总输出令牌
115,574
响应时间(平均)
52.31s
总成本
$0.050
排名
#127
总输出令牌
487,519
响应时间(平均)
65.67s
总成本
$1.207
排名
#295
总输出令牌
2,596
响应时间(平均)
1.27s
总成本
$0.000
排名
#189
总输出令牌
98,282
响应时间(平均)
20.81s
总成本
$0.020
推荐模型 gpt-oss-120b (medium)

它提供了最佳整体取舍:得分有竞争力(6.1),成本低于本次比较中的其他模型,响应时间也较均衡。

详细对比

指标 Nemotron 3 Super Nemotron 3 Super medium 发布日期: 2026-03-11 免费可用 Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium 发布日期: 2026-02-24 Elephant Alpha Elephant Alpha medium 发布日期: 2026-04-14 gpt-oss-120b gpt-oss-120b medium 发布日期: 2025-08-05
分数 5.7 7.1 4.3 6.1
排名 #217 #127 #295 #189
可靠性 9.1 10.0 不适用 10.0
一致性 8.9 8.5 9.2 8.0
尝试次数 66/66 66/66 63/66 66/66
测试正确
尝试通过率 40.9% 71.2% 28.8% 50.0%
不稳定测试 3 4 1 5
总运行次数 66 66 63 66
每个结果成本 0.004 8.446 0.000 0.224
总成本 $0.050 $1.207 $0.000 $0.020
输入价格 $0.085 / 1M $0.290 / 1M $0.000 / 1M $0.037 / 1M
输出价格 $0.400 / 1M $2.400 / 1M $0.000 / 1M $0.170 / 1M
总输入令牌 81,438 124,780 33,744 108,767
输出令牌 17,674 47,694 2,596 29,378
推理令牌 97,900 439,825 0 68,904
响应时间(平均) 52.31s 65.67s 1.27s 20.81s
响应时间(最大) 431.98s 519.30s 3.70s 68.16s
响应时间(总计) 1046.21s 1444.68s 22.82s 332.88s
参数量 120B 总计 (12B 激活) 122B 总计 (10B 激活) 104B 总计 (7.4B 激活) 117B 总计 (5.1B 激活)
开放状态 权重可用 开源 开源 开源

模型生成展示

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#217 Nemotron 3 Super

medium
成本
$0.000
时间
272.6s
令牌
5,296 tok

#127 Qwen3.5-122B-A10B

medium
成本
$0.019
时间
48.7s
令牌
6,034 tok

#295 Elephant Alpha

medium
Elephant Alpha was a stealth model revealed on April 21st as Ling-2.6-flash. Find it here: https://openrouter.ai/inclusionai/ling-2.6-flash:free
成本
$0.000
时间
0.1s
令牌
0 tok

#189 gpt-oss-120b

medium
成本
$0.001
时间
26.7s
令牌
555 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Nemotron 3 Super 3.1 10.0 0.0% 0 147.32s 2,275 797 4,424
Qwen3.5-122B-A10B 6.0 7.2 55.6% 1 114.48s 7,630 8,057 82,578
Elephant Alpha 3.7 7.8 11.1% 1 1.30s 813 365 0
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

快速对比

切换对比组合