नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

gpt-oss-120b (medium) vs Qwen3.7 Flash

average score लगभग बराबर है: 6.1 vs 6.1. Qwen3.7 Flash की benchmark लागत कम है: $0.019 vs $0.019. Qwen3.7 Flash तेज है: 10.06s vs 21.91s, pass rates 50.0% vs 36.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-28

रैंक
#135
कुल आउटपुट टोकन
97,816
प्रतिक्रिया समय (औसत)
21.91s
कुल लागत
$0.019
रैंक
#136
कुल आउटपुट टोकन
90,507
प्रतिक्रिया समय (औसत)
10.06s
कुल लागत
$0.019
अनुशंसित मॉडल Qwen3.7 Flash

It has the best score here (6.1), while responding about 2.2x faster than gpt-oss-120b (medium).

विस्तृत तुलना

मेट्रिक gpt-oss-120b gpt-oss-120b medium रिलीज़: 2025-08-05 Qwen3.7 Flash Qwen3.7 Flash none रिलीज़: 2026-07-28
स्कोर 6.1 6.1
रैंक #135 #136
विश्वसनीयता 10.0 10.0
संगति 8.0 9.2
सही परीक्षण
प्रति प्रयास पास दर 50.0% 36.4%
अस्थिर टेस्ट 5 2
कुल रन 66 66
प्रति परिणाम लागत 0.221 0.262
कुल लागत $0.019 $0.019
इनपुट कीमत $0.037 / 1M $0.030 / 1M
आउटपुट कीमत $0.170 / 1M $0.130 / 1M
कुल इनपुट टोकन 108,747 218,731
आउटपुट टोकन 29,772 90,507
रीजनिंग टोकन 68,044 0
प्रतिक्रिया समय (औसत) 21.91s 10.06s
प्रतिक्रिया समय (अधिकतम) 68.16s 186.24s
प्रतिक्रिया समय (कुल) 328.70s 221.34s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#135 gpt-oss-120b

medium
लागत
$0.001
समय
26.7s
टोकन
555 tok

#136 Qwen3.7 Flash

none
लागत
$0.001
समय
34.0s
टोकन
4,814 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973
Qwen3.7 Flash 5.5 10.0 33.3% 0 1.55s 7,911 855 0

त्वरित तुलना

तुलना जोड़ी बदलें