#81

gpt-oss-120b

OpenAI रिलीज़: 2025-08-05 परीक्षण किया गया: 2026-06-04 13:44 openai/gpt-oss-120b::medium

(medium) (none)

सारांश

gpt-oss-120b AI BENCHY पर 6.7 स्कोर करता है और #81 पर है। इसकी reliability 10.0, pass rate 52.4%, कुल लागत $0.011, और औसत response time 22.28s है।

gpt-oss-120b को अलग क्या बनाता है: इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

स्कोर

6.7

संगति

8.0

विश्वसनीयता

10.0

कुल लागत (वर्तमान कीमत)

$0.011 ↓ -20.5%

परीक्षण के समय: $0.013

कुल आउटपुट टोकन

70,246

कुल इनपुट टोकन

39,084

इनपुट कीमत

$0.030 / 1M

आउटपुट कीमत

$0.150 / 1M

सही परीक्षण

गलत टेस्ट: 12

प्रति प्रयास पास दर: 52.4%

अस्थिर टेस्ट

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

22.28s

प्रतिक्रिया समय (अधिकतम): 68.16s

प्रतिक्रिया समय (कुल): 311.96s

गलत उत्तर: 9 निर्देशों का पालन नहीं किया: 3

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#81 gpt-oss-120b

medium

लागत: $0.001
समय: 26.7s
टोकन: 555 tok

रन इतिहास

परीक्षण किया गया	स्कोर	विश्वसनीयता	कुल लागत	तुलना करें
2026-06-04 13:44 नया टेस्ट जोड़ा गया	6.1	10.0	$0.013 ↓	वर्तमान रन
2026-05-22 00:18 सूट बदला गया	5.6	10.0	$0.012	तुलना करें
2026-04-21 12:42 पहला दर्ज रन	5.8	लागू नहीं	$0.011	तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख	इनपुट कीमत	आउटपुट कीमत
2026-06-04 15:40	$0.039 / 1M	$0.180 / 1M
2026-06-29 01:00	$0.030 / 1M	$0.150 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

स्कोर के अनुसार शीर्ष मॉडल

स्कोर vs कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी	स्कोर	संगति
एंटी-एआई ट्रिक्स	6.7	9.9
कोडिंग	5.9	7.0
संयुक्त	10.0	10.0
डेटा पार्सिंग और निष्कर्षण	6.4	5.9
डोमेन-विशिष्ट	2.9	4.4
Samanya Buddhimatta	4.3	10.0
निर्देश पालन	9.9	10.0
पहेली समाधान	5.3	7.2
टूल कॉलिंग	9.8	10.0
सामान्य ज्ञान	3.0	10.0

gpt-oss-120b

Hamster playing table tennis

#81 gpt-oss-120b

चार्ट

स्कोर के अनुसार शीर्ष मॉडल

स्कोर vs कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

तुलना किए गए मॉडल