Advertise here
#147

GPT-5.4 Nano

OpenAI प्रकाशन: 2026-03-17 चाचणी तारीख: 2026-05-22 00:19 openai/gpt-5.4-nano::none
~120B एकूण (~5B सक्रिय)MoEबंद स्रोतअंदाजित
(medium) (none)

सारांश

GPT-5.4 Nano AI BENCHY वर 4.5 स्कोर करते आणि #147 वर आहे. याची reliability 10.0, pass rate 30.0%, एकूण खर्च $0.010, आणि सरासरी response time 1.33s आहे.

GPT-5.4 Nano खास का आहे: या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे. समान मॉडेल्सच्या तुलनेत हे लक्षणीय वेगवान आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

अंदाजित
पॅरामीटर्स
~120B एकूण (~5B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
परवाना
-

सार्वजनिक पुराव्यावर आधारित सर्वोत्तम अंदाज; प्रदात्याने सर्व मूल्ये जाहीर केलेली नाहीत.

सुसंगतता

7.6

एकूण आउटपुट टोकन्स

2,804

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.200 / 1M

आउटपुट किंमत

$1.250 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 17

प्रति प्रयत्न पास दर: 30.0%

अस्थिर चाचण्या

6

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

1.33s

प्रतिसाद वेळ (कमाल): 3.84s

प्रतिसाद वेळ (एकूण): 26.66s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#147 GPT-5.4 Nano

none
खर्च
$0.008
वेळ
46.1s
टोकन्स
5,735 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:16 पुन्हा चाचणी 4.8 10.0 $0.041 तुलना करा
2026-07-16 22:35 नवीन चाचणी जोडली 4.8 10.0 $0.041 तुलना करा
2026-06-04 13:45 नवीन चाचणी जोडली 4.7 10.0 $0.011 तुलना करा
2026-05-22 00:19 सूट बदलला 4.5 10.0 $0.010 सध्याची रन
2026-04-11 01:44 पहिली नोंदलेली रन 4.5 लागू नाही $0.009 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-22 00:19 · सूट बदलला60/60 प्रयत्न4.57.610.03/2062,8040$0.0101.33s
2026-04-11 01:44 · पहिली नोंदलेली रन54/54 प्रयत्न4.57.1लागू नाही2/1872,7620$0.0091.40s
फरक0.0+0.5+1-1+420+$0.001-64ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 3.5 8.0
कोडिंग 5.4 6.8
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 6.5 10.0
डोमेन-विशिष्ट 2.9 4.4
Samanya Buddhimatta 3.8 2.5
सूचनांचे पालन 6.3 10.0
कोडी सोडवणे 3.7 7.2
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स