नेविगेशन
AI BENCHY
Advertise here

gpt-oss-120b (medium) vs Qwen3.5-Flash (medium)

average score लगभग बराबर है: 6.1 vs 6.1. gpt-oss-120b (medium) की benchmark लागत कम है: $0.019 vs $0.142. gpt-oss-120b (medium) तेज है: 20.81s vs 84.44s, pass rates 50.0% vs 65.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-15

रैंक
#169
कुल आउटपुट टोकन
98,282
प्रतिक्रिया समय (औसत)
20.81s
कुल लागत
$0.019
रैंक
#172
कुल आउटपुट टोकन
512,846
प्रतिक्रिया समय (औसत)
84.44s
कुल लागत
$0.142
अनुशंसित मॉडल gpt-oss-120b (medium)

It has the best score here (6.1), while costing about 7.7x less than Qwen3.5-Flash (medium).

विस्तृत तुलना

मेट्रिक gpt-oss-120b gpt-oss-120b medium रिलीज़: 2025-08-05 Qwen3.5-Flash Qwen3.5-Flash medium रिलीज़: 2026-02-24
स्कोर 6.1 6.1
रैंक #169 #172
विश्वसनीयता 10.0 10.0
संगति 8.0 7.8
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 50.0% 65.2%
अस्थिर टेस्ट 5 6
कुल रन 66 66
प्रति परिणाम लागत 0.224 1.491
कुल लागत $0.019 $0.142
इनपुट कीमत $0.030 / 1M $0.065 / 1M
आउटपुट कीमत $0.170 / 1M $0.260 / 1M
कुल इनपुट टोकन 108,767 118,508
आउटपुट टोकन 29,378 35,457
रीजनिंग टोकन 68,904 477,389
प्रतिक्रिया समय (औसत) 20.81s 84.44s
प्रतिक्रिया समय (अधिकतम) 68.16s 515.38s
प्रतिक्रिया समय (कुल) 332.88s 1773.20s
पैरामीटर 117B कुल (5.1B सक्रिय) ~35B कुल (~3B सक्रिय)
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#169 gpt-oss-120b

medium
लागत
$0.001
समय
26.7s
टोकन
555 tok

#172 Qwen3.5-Flash

medium
लागत
$0.002
समय
25.8s
टोकन
4,294 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973
Qwen3.5-Flash 3.7 7.2 22.2% 1 58.87s 6,685 302 90,081

त्वरित तुलना

तुलना जोड़ी बदलें