Advertise here
#223

Claude Opus 4.6

Anthropic प्रकाशन: 2026-02-05 चाचणी तारीख: 2026-08-14 02:08 anthropic/claude-opus-4.6::medium
~5T एकूण (~500B सक्रिय)MoEबंद स्रोतअंदाजित

सारांश

Claude Opus 4.6 AI BENCHY वर 6.3 स्कोर करते आणि #223 वर आहे. याची reliability 10.0, pass rate 60.9%, एकूण खर्च $2.961, आणि सरासरी response time 32.23s आहे.

Claude Opus 4.6 खास का आहे: हे संयुक्त मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर स्वायत्त एजंट कार्ये हा सर्वात कमकुवत भाग आहे, rank #16.

संग्रहित मॉडेल: हे मॉडेल आता अपडेट केले जाणार नाही आणि नवीन चाचण्यांवर तपासले जाणार नाही.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

अंदाजित
पॅरामीटर्स
~5T एकूण (~500B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
परवाना
-

सार्वजनिक पुराव्यावर आधारित सर्वोत्तम अंदाज; प्रदात्याने सर्व मूल्ये जाहीर केलेली नाहीत.

सुसंगतता

8.5

एकूण आउटपुट टोकन्स

96,722

एकूण इनपुट टोकन्स

108,573

इनपुट किंमत

$5.000 / 1M

आउटपुट किंमत

$25.000 / 1M

कॅश वाचण्याची किंमत

$0.500 / 1M

कॅश लिहिण्याची किंमत

$6.250 / 1M

कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.

बरोबर चाचण्या

चुकीच्या चाचण्या: 9

प्रति प्रयत्न पास दर: 60.9%

अस्थिर चाचण्या

3

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

32.23s

प्रतिसाद वेळ (कमाल): 151.51s

प्रतिसाद वेळ (एकूण): 515.65s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#223 Claude Opus 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:08 पुन्हा चाचणी 6.3 10.0 $2.961 सध्याची रन
2026-07-16 22:31 नवीन चाचणी जोडली 7.7 10.0 $3.059 तुलना करा
2026-06-04 13:45 नवीन चाचणी जोडली 7.0 10.0 $2.053 तुलना करा
2026-05-22 00:17 सूट बदलला 7.2 10.0 $1.896 तुलना करा
2026-04-11 01:44 पहिली नोंदलेली रन 7.6 लागू नाही $1.446 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-08-14 02:08 · सध्याची रन66/69 प्रयत्न6.38.510.013/22396,722108,573$2.96132.23s
2026-04-11 01:44 · पहिली नोंदलेली रन54/54 प्रयत्न7.69.1लागू नाही12/18248,7670$1.44621.08s
फरक—-1.3-0.6+1+1+47955+108573+$1.516+11152ms

बेंचमार्क कव्हरेज वेगळे आहे: 66/69 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

किंमत इतिहास

OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.

तारीख इनपुट किंमत आउटपुट किंमत कॅश वाचण्याची किंमत कॅश लिहिण्याची किंमत
2026-08-14 12:51 $5.000 / 1M $25.000 / 1M लागू नाही लागू नाही
2026-10-01 18:33 $5.000 / 1M $25.000 / 1M $0.500 / 1M $6.250 / 1M

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
स्वायत्त एजंट कार्ये 0.0 0.0
अँटी-एआय युक्त्या 6.4 5.8
कोडिंग 5.7 7.1
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 3.0 10.0
Samanya Buddhimatta 10.0 10.0
सूचनांचे पालन 10.0 10.0
कोडी सोडवणे 7.7 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स