AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#91

gpt-oss-120b

OpenAI रिलीज़: 2025-08-05 परीक्षण किया गया: 2026-04-21 12:42 openai/gpt-oss-120b::none
117B कुल (5.1B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

gpt-oss-120b AI BENCHY पर 5.2 स्कोर करता है और #91 पर है। इसकी reliability लागू नहीं, pass rate 38.9%, कुल लागत $0.009, और औसत response time 11.96s है।

gpt-oss-120b को अलग क्या बनाता है: यह समान मॉडलों की तुलना में काफ़ी तेज है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
117B कुल (5.1B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
Apache-2.0

संगति

7.9

विश्वसनीयता

लागू नहीं

कुल आउटपुट टोकन

44,652

कुल इनपुट टोकन

0

इनपुट कीमत

$0.000 / 1M

आउटपुट कीमत

$0.000 / 1M

कैश पढ़ने की कीमत

लागू नहीं

कैश लिखने की कीमत

लागू नहीं

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

सही परीक्षण

गलत टेस्ट: 14

प्रति प्रयास पास दर: 38.9%

अस्थिर टेस्ट

5

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

11.96s

प्रतिक्रिया समय (अधिकतम): 68.97s

प्रतिक्रिया समय (कुल): 179.34s

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-05-08 15:31 सूट बदला गया 3.7 10.0 $0.010 ↓ तुलना करें
2026-04-21 12:42 पहला दर्ज रन 5.2 लागू नहीं $0.009 वर्तमान रन

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-04-21 12:42 · पहला दर्ज रन54/54 प्रयास5.27.9लागू नहीं4/18544,6520$0.00911.96s
2026-05-08 15:31 · सूट बदला गया57/57 प्रयास3.77.810.06/19251,6649,081$0.01021.61s
अंतर—+1.5+0.1-2+3-7012-9081-$0.001-9656ms

बेंचमार्क कवरेज अलग है: 54/54 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 57/57 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 6.6 8.0
कोडिंग 4.3 1.1
संयुक्त 3.0 10.0
डेटा पार्सिंग और निष्कर्षण 6.5 10.0
डोमेन-विशिष्ट 3.0 10.0
Samanya Buddhimatta 4.6 10.0
निर्देश पालन 8.4 6.9
पहेली समाधान 4.5 4.8
टूल कॉलिंग 3.0 10.0

तुलना किए गए मॉडल