नेविगेशन
AI BENCHY
Advertise here

Claude Sonnet 5 vs gpt-oss-120b (medium)

average score लगभग बराबर है: 6.1 vs 6.1. gpt-oss-120b (medium) की benchmark लागत कम है: $0.020 vs $0.548. Claude Sonnet 5 तेज है: 6.05s vs 20.81s, pass rates 40.9% vs 50.0%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-29

रैंक
#170
कुल आउटपुट टोकन
22,508
प्रतिक्रिया समय (औसत)
6.05s
कुल लागत
$0.548
रैंक
#173
कुल आउटपुट टोकन
98,282
प्रतिक्रिया समय (औसत)
20.81s
कुल लागत
$0.020
अनुशंसित मॉडल gpt-oss-120b (medium)

It has the best score here (6.1), while costing about 28.8x less than Claude Sonnet 5.

विस्तृत तुलना

मेट्रिक Claude Sonnet 5 Claude Sonnet 5 none रिलीज़: 2026-06-30 gpt-oss-120b gpt-oss-120b medium रिलीज़: 2025-08-05
स्कोर 6.1 6.1
रैंक #170 #173
विश्वसनीयता 10.0 10.0
संगति 8.7 8.0
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 40.9% 50.0%
अस्थिर टेस्ट 4 5
कुल रन 66 66
प्रति परिणाम लागत 7.817 0.224
कुल लागत $0.548 $0.020
इनपुट कीमत $2.000 / 1M $0.037 / 1M
आउटपुट कीमत $10.000 / 1M $0.170 / 1M
कुल इनपुट टोकन 161,032 108,767
आउटपुट टोकन 22,508 29,378
रीजनिंग टोकन 0 68,904
प्रतिक्रिया समय (औसत) 6.05s 20.81s
प्रतिक्रिया समय (अधिकतम) 33.39s 68.16s
प्रतिक्रिया समय (कुल) 132.99s 332.88s
पैरामीटर ~1T कुल (~100B सक्रिय) 117B कुल (5.1B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#170 Claude Sonnet 5

none
लागत
$0.061
समय
53.7s
टोकन
6,172 tok

#173 gpt-oss-120b

medium
लागत
$0.001
समय
26.7s
टोकन
555 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 5 4.6 7.9 22.2% 1 3.67s 10,590 1,864 0
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

त्वरित तुलना

तुलना जोड़ी बदलें