AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#81

gpt-oss-120b

OpenAI रिलीज़: 2025-08-05 परीक्षण किया गया: 2026-06-04 13:44 openai/gpt-oss-120b::medium
(medium) (none)

सारांश

gpt-oss-120b AI BENCHY पर 6.7 स्कोर करता है और #81 पर है। इसकी reliability 10.0, pass rate 52.4%, कुल लागत $0.011, और औसत response time 22.28s है।

gpt-oss-120b को अलग क्या बनाता है: इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

संगति

8.0

कुल लागत (वर्तमान कीमत)

$0.011 ↓ -20.5%

परीक्षण के समय: $0.013

कुल आउटपुट टोकन

70,246

कुल इनपुट टोकन

39,084

इनपुट कीमत

$0.030 / 1M

आउटपुट कीमत

$0.150 / 1M

सही परीक्षण

गलत टेस्ट: 12

प्रति प्रयास पास दर: 52.4%

अस्थिर टेस्ट

5

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

22.28s

प्रतिक्रिया समय (अधिकतम): 68.16s

प्रतिक्रिया समय (कुल): 311.96s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#81 gpt-oss-120b

medium
लागत
$0.001
समय
26.7s
टोकन
555 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-06-04 13:44 नया टेस्ट जोड़ा गया 6.1 10.0 $0.013 वर्तमान रन
2026-05-22 00:18 सूट बदला गया 5.6 10.0 $0.012 तुलना करें
2026-04-21 12:42 पहला दर्ज रन 5.8 लागू नहीं $0.011 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-06-04 15:40 $0.039 / 1M $0.180 / 1M
2026-06-29 01:00 $0.030 / 1M $0.150 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 6.7 9.9
कोडिंग 5.9 7.0
संयुक्त 10.0 10.0
डेटा पार्सिंग और निष्कर्षण 6.4 5.9
डोमेन-विशिष्ट 2.9 4.4
Samanya Buddhimatta 4.3 10.0
निर्देश पालन 9.9 10.0
पहेली समाधान 5.3 7.2
टूल कॉलिंग 9.8 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल