सारांश
gpt-oss-120b AI BENCHY पर 5.2 स्कोर करता है और #91 पर है। इसकी reliability लागू नहीं, pass rate 38.9%, कुल लागत $0.009, और औसत response time 11.96s है।
gpt-oss-120b को अलग क्या बनाता है: यह समान मॉडलों की तुलना में काफ़ी तेज है।
मॉडल विवरण
शोध की तारीख: 2026-08-12
- पैरामीटर
- 117B कुल (5.1B सक्रिय)
- आर्किटेक्चर
- MoE
- उपलब्धता
- मुक्त स्रोत
- लाइसेंस
- Apache-2.0
5.2
संगति
7.9
लागू नहीं
$0.009
कुल आउटपुट टोकन
44,652
कुल इनपुट टोकन
0
इनपुट कीमत
$0.000 / 1M
आउटपुट कीमत
$0.000 / 1M
कैश पढ़ने की कीमत
लागू नहीं
कैश लिखने की कीमत
लागू नहीं
कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।
अस्थिर टेस्ट
5
अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।
रन इतिहास
| परीक्षण किया गया | स्कोर | विश्वसनीयता | सही परीक्षण | कुल लागत | तुलना करें |
|---|---|---|---|---|---|
| 2026-05-08 15:31 सूट बदला गया | 3.7 | 10.0 | $0.010 ↓ | तुलना करें | |
| 2026-04-21 12:42 पहला दर्ज रन | 5.2 | लागू नहीं | $0.009 | वर्तमान रन |
रन तुलना
| रन | बेंचमार्क कवरेज | स्कोर | संगति | विश्वसनीयता | सही परीक्षण | अस्थिर टेस्ट | कुल आउटपुट टोकन | कुल इनपुट टोकन | कुल लागत | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-04-21 12:42 · पहला दर्ज रन | 54/54 प्रयास | 5.2 | 7.9 | लागू नहीं | 4/18 | 5 | 44,652 | 0 | $0.009 | 11.96s |
| 2026-05-08 15:31 · सूट बदला गया | 57/57 प्रयास | 3.7 | 7.8 | 10.0 | 6/19 | 2 | 51,664 | 9,081 | $0.010 | 21.61s |
| अंतर | — | +1.5 | +0.1 | -2 | +3 | -7012 | -9081 | -$0.001 | -9656ms |
बेंचमार्क कवरेज अलग है: 54/54 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 57/57 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।
इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।
चार्ट
पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।
स्कोर vs कुल लागत
प्रतिक्रिया समय (औसत)
स्कोर vs प्रतिक्रिया समय (औसत)
कुल आउटपुट टोकन
स्कोर vs कुल आउटपुट टोकन
त्वरित तुलना
श्रेणी विवरण
| श्रेणी | स्कोर | संगति | सही परीक्षण |
|---|---|---|---|
| एंटी-एआई ट्रिक्स | 6.6 | 8.0 | |
| कोडिंग | 4.3 | 1.1 | |
| संयुक्त | 3.0 | 10.0 | |
| डेटा पार्सिंग और निष्कर्षण | 6.5 | 10.0 | |
| डोमेन-विशिष्ट | 3.0 | 10.0 | |
| Samanya Buddhimatta | 4.6 | 10.0 | |
| निर्देश पालन | 8.4 | 6.9 | |
| पहेली समाधान | 4.5 | 4.8 | |
| टूल कॉलिंग | 3.0 | 10.0 |