#81

gpt-oss-120b

OpenAI रिलीज़: 2025-08-05 परीक्षण किया गया: 2026-06-04 13:44 openai/gpt-oss-120b::medium

(medium) (none)

सारांश

gpt-oss-120b AI BENCHY पर 6.7 स्कोर करता है और #81 पर है। इसकी reliability 10.0, pass rate 52.4%, कुल लागत $0.011, और औसत response time 22.28s है।

gpt-oss-120b को अलग क्या बनाता है: इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

स्कोर

6.7

संगति

8.0

विश्वसनीयता

10.0

कुल लागत (वर्तमान कीमत)

$0.011 ↓ -20.5%

परीक्षण के समय: $0.013

कुल आउटपुट टोकन

70,246

कुल इनपुट टोकन

39,084

इनपुट कीमत

$0.030 / 1M

आउटपुट कीमत

$0.150 / 1M

सही परीक्षण

गलत टेस्ट: 12

प्रति प्रयास पास दर: 52.4%

अस्थिर टेस्ट

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

22.28s

प्रतिक्रिया समय (अधिकतम): 68.16s

प्रतिक्रिया समय (कुल): 311.96s

गलत उत्तर: 9 निर्देशों का पालन नहीं किया: 3

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#81 gpt-oss-120b

medium

लागत: $0.001
समय: 26.7s
टोकन: 555 tok

रन इतिहास

परीक्षण किया गया	स्कोर	विश्वसनीयता	कुल लागत	तुलना करें
2026-06-04 13:44 नया टेस्ट जोड़ा गया	6.1	10.0	$0.013 ↓	वर्तमान रन
2026-05-22 00:18 सूट बदला गया	5.6	10.0	$0.012	तुलना करें
2026-04-21 12:42 पहला दर्ज रन	5.8	लागू नहीं	$0.011	तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रन	स्कोर	संगति	विश्वसनीयता	सही परीक्षण	अस्थिर टेस्ट	कुल आउटपुट टोकन	कुल इनपुट टोकन	कुल लागत	प्रतिक्रिया समय (औसत)
2026-06-04 13:44 · वर्तमान रन	6.7	8.0	10.0	9/21	5	70,246	39,084	$0.011	22.28s
2026-04-21 12:42 · पहला दर्ज रन	5.8	7.2	लागू नहीं	7/18	6	50,372	0	$0.011	16.08s
अंतर	+0.8	+0.8		+2	-1	+19874	+39084	-$0.001	+6203ms

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख	इनपुट कीमत	आउटपुट कीमत
2026-06-04 15:40	$0.039 / 1M	$0.180 / 1M
2026-06-29 01:00	$0.030 / 1M	$0.150 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी	स्कोर	संगति
एंटी-एआई ट्रिक्स	6.7	9.9
कोडिंग	5.9	7.0
संयुक्त	10.0	10.0
डेटा पार्सिंग और निष्कर्षण	6.4	5.9
डोमेन-विशिष्ट	2.9	4.4
Samanya Buddhimatta	4.3	10.0
निर्देश पालन	9.9	10.0
पहेली समाधान	5.3	7.2
टूल कॉलिंग	9.8	10.0
सामान्य ज्ञान	3.0	10.0

gpt-oss-120b

Hamster playing table tennis

#81 gpt-oss-120b

चार्ट

स्कोर के अनुसार शीर्ष मॉडल

स्कोर vs कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

तुलना किए गए मॉडल