#73

gpt-oss-120b

OpenAI रिलीज़: 2025-08-05 परीक्षण किया गया: 2026-04-21 12:42 openai/gpt-oss-120b::medium

(medium) (none)

सारांश

gpt-oss-120b AI BENCHY पर 5.8 स्कोर करता है और #73 पर है। इसकी reliability लागू नहीं, pass rate 51.9%, कुल लागत $0.011, और औसत response time 16.08s है।

gpt-oss-120b को अलग क्या बनाता है: इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

स्कोर

5.8

संगति

7.2

विश्वसनीयता

लागू नहीं

कुल लागत (वर्तमान कीमत)

$0.011

कुल आउटपुट टोकन

50,372

कुल इनपुट टोकन

इनपुट कीमत

$0.000 / 1M

आउटपुट कीमत

$0.000 / 1M

सही परीक्षण

गलत टेस्ट: 11

प्रति प्रयास पास दर: 51.9%

अस्थिर टेस्ट

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

16.08s

प्रतिक्रिया समय (अधिकतम): 50.92s

प्रतिक्रिया समय (कुल): 176.88s

गलत उत्तर: 7 निर्देशों का पालन नहीं किया: 4

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#73 gpt-oss-120b

medium

लागत: $0.001
समय: 26.7s
टोकन: 555 tok

रन इतिहास

परीक्षण किया गया	स्कोर	विश्वसनीयता	कुल लागत	तुलना करें
2026-06-04 13:44 नया टेस्ट जोड़ा गया	6.1	10.0	$0.013 ↓	तुलना करें
2026-05-22 00:18 सूट बदला गया	5.6	10.0	$0.012	तुलना करें
2026-04-21 12:42 पहला दर्ज रन	5.8	लागू नहीं	$0.011	वर्तमान रन

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

स्कोर के अनुसार शीर्ष मॉडल

स्कोर vs कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी	स्कोर	संगति
एंटी-एआई ट्रिक्स	6.7	9.9
कोडिंग	4.3	1.1
संयुक्त	10.0	10.0
डेटा पार्सिंग और निष्कर्षण	6.4	5.9
डोमेन-विशिष्ट	2.9	4.4
Samanya Buddhimatta	4.3	10.0
निर्देश पालन	9.9	10.0
पहेली समाधान	3.2	4.7
टूल कॉलिंग	9.8	10.0

gpt-oss-120b

Hamster playing table tennis

#73 gpt-oss-120b

चार्ट

स्कोर के अनुसार शीर्ष मॉडल

स्कोर vs कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

तुलना किए गए मॉडल