नेव्हिगेशन
Advertise here

gpt-oss-120b (medium) vs Qwen3.7 Flash

average score जवळपास समान आहे: 6.1 vs 6.1. Qwen3.7 Flash चा benchmark खर्च कमी आहे: $0.019 vs $0.020. Qwen3.7 Flash वेगवान आहे: 10.05s vs 20.81s, pass rates 50.0% vs 36.4%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-09-10

तुलना केलेली मॉडेल्स

क्रमांक
#198
एकूण आउटपुट टोकन्स
98,282
प्रतिसाद वेळ (सरासरी)
20.81s
एकूण खर्च
$0.020
क्रमांक
#199
एकूण आउटपुट टोकन्स
90,507
प्रतिसाद वेळ (सरासरी)
10.05s
एकूण खर्च
$0.019
शिफारस केलेले मॉडेल Qwen3.7 Flash

It has the best score here (6.1), while responding about 2.1x faster than gpt-oss-120b (medium).

तपशीलवार तुलना

मेट्रिक gpt-oss-120b gpt-oss-120b medium प्रकाशन: 2025-08-05 Qwen3.7 Flash Qwen3.7 Flash none प्रकाशन: 2026-07-28
स्कोअर 6.1 6.1
क्रमांक #198 #199
विश्वसनीयता 10.0 10.0
सुसंगतता 8.0 9.2
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 50.0% 36.4%
अस्थिर चाचण्या 5 2
एकूण रन 66 66
प्रति निकाल खर्च 0.224 0.262
एकूण खर्च $0.020 $0.019
इनपुट किंमत $0.037 / 1M $0.030 / 1M
आउटपुट किंमत $0.170 / 1M $0.130 / 1M
एकूण इनपुट टोकन्स 108,767 218,740
आउटपुट टोकन्स 29,378 90,507
रिझनिंग टोकन्स 68,904 0
प्रतिसाद वेळ (सरासरी) 20.81s 10.05s
प्रतिसाद वेळ (कमाल) 68.16s 186.24s
प्रतिसाद वेळ (एकूण) 332.88s 221.13s
पॅरामीटर्स 117B एकूण (5.1B सक्रिय) ~35B एकूण (~3B सक्रिय)
उपलब्धता मुक्त स्रोत बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#198 gpt-oss-120b

medium
खर्च
$0.001
वेळ
26.7s
टोकन्स
555 tok

#199 Qwen3.7 Flash

none
खर्च
$0.001
वेळ
34.0s
टोकन्स
4,814 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973
Qwen3.7 Flash 5.5 10.0 33.3% 0 1.55s 7,911 855 0

झटपट तुलना

तुलना जोडी बदला