AI BENCHY
Advertise here
#21

GPT-5.4

OpenAI प्रकाशन: 2026-03-05 चाचणी तारीख: 2026-06-04 13:46 openai/gpt-5.4::medium
(medium) (none)

सारांश

GPT-5.4 AI BENCHY वर 8.0 स्कोर करते आणि #21 वर आहे. याची reliability 10.0, pass rate 76.2%, एकूण खर्च $1.210, आणि सरासरी response time 22.35s आहे.

सुसंगतता

8.6

एकूण आउटपुट टोकन्स

74,949

एकूण इनपुट टोकन्स

34,108

इनपुट किंमत

$2.500 / 1M

आउटपुट किंमत

$15.000 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 7

प्रति प्रयत्न पास दर: 76.2%

अस्थिर चाचण्या

4

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

22.35s

प्रतिसाद वेळ (कमाल): 100.41s

प्रतिसाद वेळ (एकूण): 469.29s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#21 GPT-5.4

medium
खर्च
$0.214
वेळ
199.6s
टोकन्स
14,349 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-07-16 22:34 नवीन चाचणी जोडली 8.5 10.0 $1.533 तुलना करा
2026-06-04 13:46 नवीन चाचणी जोडली 8.0 10.0 $1.210 सध्याची रन
2026-05-22 00:19 सूट बदलला 7.9 10.0 $1.140 तुलना करा
2026-04-11 01:44 पहिली नोंदलेली रन 8.2 लागू नाही $0.832 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

किंमत इतिहास

OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.

तारीख इनपुट किंमत आउटपुट किंमत
2026-06-04 14:42 $2.500 / 1M $15.000 / 1M

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 8.3 10.0
कोडिंग 8.8 7.8
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 4.7 3.1
सूचनांचे पालन 10.0 10.0
कोडी सोडवणे 8.2 7.2
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स