Advertise here
#243

Claude Sonnet 4.6

Anthropic रिलीज़: 2026-02-17 परीक्षण किया गया: 2026-08-14 02:00 anthropic/claude-sonnet-4.6::none
~1T कुल (~100B सक्रिय)MoEबंद स्रोतअनुमानित
(medium) (none)

सारांश

Claude Sonnet 4.6 AI BENCHY पर 6.0 स्कोर करता है और #243 पर है। इसकी reliability 10.0, pass rate 55.1%, कुल लागत $0.661, और औसत response time 7.67s है।

Claude Sonnet 4.6 को अलग क्या बनाता है: यह संयुक्त में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि स्वायत्त एजेंट कार्य इसकी सबसे कमजोर जगह है, जहाँ यह #17 पर है।

संग्रहीत मॉडल: इस मॉडल को अब अपडेट नहीं किया जाएगा और नए परीक्षणों में टेस्ट नहीं किया जाएगा।

मॉडल विवरण

शोध की तारीख: 2026-08-12

अनुमानित
पैरामीटर
~1T कुल (~100B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
लाइसेंस
-

सार्वजनिक साक्ष्यों पर आधारित सर्वोत्तम अनुमान; प्रदाता ने सभी मान जारी नहीं किए हैं।

संगति

9.3

कुल आउटपुट टोकन

19,362

कुल इनपुट टोकन

123,273

इनपुट कीमत

$3.000 / 1M

आउटपुट कीमत

$15.000 / 1M

कैश पढ़ने की कीमत

$0.300 / 1M

कैश लिखने की कीमत

$3.750 / 1M

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

सही परीक्षण

गलत टेस्ट: 10

प्रति प्रयास पास दर: 55.1%

अस्थिर टेस्ट

1

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

7.67s

प्रतिक्रिया समय (अधिकतम): 51.18s

प्रतिक्रिया समय (कुल): 122.78s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#243 Claude Sonnet 4.6

none
लागत
$0.038
समय
27.3s
टोकन
2,598 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 02:00 दोबारा परीक्षण 6.0 10.0 $0.661 वर्तमान रन
2026-07-16 22:21 नया टेस्ट जोड़ा गया 7.3 10.0 $0.661 तुलना करें
2026-06-04 13:40 नया टेस्ट जोड़ा गया 6.8 10.0 $0.316 तुलना करें
2026-05-22 00:12 सूट बदला गया 7.0 10.0 $0.306 तुलना करें
2026-04-11 01:44 पहला दर्ज रन 7.4 लागू नहीं $0.262 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-08-14 02:00 · वर्तमान रन66/69 प्रयास6.09.310.012/22119,362123,273$0.6617.67s
2026-05-22 00:12 · सूट बदला गया60/60 प्रयास7.09.710.011/2019,4530$0.3065.33s
अंतर—-1.0-0.40.0+10+9909+123273+$0.355+2344ms

बेंचमार्क कवरेज अलग है: 66/69 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 60/60 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत कैश पढ़ने की कीमत कैश लिखने की कीमत
2026-08-14 12:51 $3.000 / 1M $15.000 / 1M लागू नहीं लागू नहीं
2026-10-01 18:33 $3.000 / 1M $15.000 / 1M $0.300 / 1M $3.750 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
स्वायत्त एजेंट कार्य 0.0 0.0
एंटी-एआई ट्रिक्स 4.8 10.0
कोडिंग 5.5 10.0
संयुक्त 9.8 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 7.7 10.0
Samanya Buddhimatta 6.1 3.1
निर्देश पालन 6.5 10.0
पहेली समाधान 7.7 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल