#76 Claude Sonnet 4.6
none- लागत
- $0.038
- समय
- 27.3s
- टोकन
- 2,598 tok
सारांश
Claude Sonnet 4.6 AI BENCHY पर 6.8 स्कोर करता है और #76 पर है। इसकी reliability 10.0, pass rate 55.6%, कुल लागत $0.316, और औसत response time 5.04s है।
Claude Sonnet 4.6 को अलग क्या बनाता है: यह डोमेन-विशिष्ट में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि एंटी-एआई ट्रिक्स इसकी सबसे कमजोर जगह है, जहाँ यह #18 पर है। यह समान मॉडलों की तुलना में काफ़ी तेज है।
संग्रहीत मॉडल: इस मॉडल को अब अपडेट नहीं किया जाएगा और नए परीक्षणों में टेस्ट नहीं किया जाएगा।
शोध की तारीख: 2026-08-12
सार्वजनिक साक्ष्यों पर आधारित सर्वोत्तम अनुमान; प्रदाता ने सभी मान जारी नहीं किए हैं।
6.8
संगति
9.7
10.0
$0.316
कुल आउटपुट टोकन
9,465
कुल इनपुट टोकन
57,886
इनपुट कीमत
$3.000 / 1M
आउटपुट कीमत
$15.000 / 1M
कैश पढ़ने की कीमत
लागू नहीं
कैश लिखने की कीमत
लागू नहीं
कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।
अस्थिर टेस्ट
1
अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
रन इतिहास
| परीक्षण किया गया | स्कोर | विश्वसनीयता | सही परीक्षण | कुल लागत | तुलना करें |
|---|---|---|---|---|---|
| 2026-08-14 02:00 दोबारा परीक्षण | 7.3 | 10.0 | $0.661 | तुलना करें | |
| 2026-07-16 22:21 नया टेस्ट जोड़ा गया | 7.3 | 10.0 | $0.661 | तुलना करें | |
| 2026-06-04 13:40 नया टेस्ट जोड़ा गया | 6.8 | 10.0 | $0.316 | वर्तमान रन | |
| 2026-05-22 00:12 सूट बदला गया | 7.0 | 10.0 | $0.306 | तुलना करें | |
| 2026-04-11 01:44 पहला दर्ज रन | 7.4 | लागू नहीं | $0.262 | तुलना करें |
इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।
रन तुलना
| रन | बेंचमार्क कवरेज | स्कोर | संगति | विश्वसनीयता | सही परीक्षण | अस्थिर टेस्ट | कुल आउटपुट टोकन | कुल इनपुट टोकन | कुल लागत | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-06-04 13:40 · नया टेस्ट जोड़ा गया | 63/63 प्रयास | 6.8 | 9.7 | 10.0 | 11/21 | 1 | 9,465 | 57,886 | $0.316 | 5.04s |
| 2026-07-16 22:21 · नया टेस्ट जोड़ा गया | 66/66 प्रयास | 7.3 | 9.7 | 10.0 | 12/22 | 1 | 19,362 | 123,264 | $0.661 | 8.12s |
| अंतर | — | -0.5 | 0.0 | 0.0 | -1 | 0 | -9897 | -65378 | -$0.345 | -3076ms |
बेंचमार्क कवरेज अलग है: 63/63 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 66/66 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।
इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।
कीमत का इतिहास
OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।
| तारीख | इनपुट कीमत | आउटपुट कीमत | कैश पढ़ने की कीमत | कैश लिखने की कीमत |
|---|---|---|---|---|
| 2026-06-04 14:42 | $3.000 / 1M | $15.000 / 1M | लागू नहीं | लागू नहीं |
पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।
| श्रेणी | स्कोर | संगति | सही परीक्षण |
|---|---|---|---|
| एंटी-एआई ट्रिक्स | 4.8 | 10.0 | |
| कोडिंग | 5.5 | 10.0 | |
| संयुक्त | 9.5 | 10.0 | |
| डेटा पार्सिंग और निष्कर्षण | 10.0 | 10.0 | |
| डोमेन-विशिष्ट | 7.7 | 10.0 | |
| Samanya Buddhimatta | 6.1 | 3.1 | |
| निर्देश पालन | 6.5 | 10.0 | |
| पहेली समाधान | 7.7 | 10.0 | |
| टूल कॉलिंग | 10.0 | 10.0 | |
| सामान्य ज्ञान | 3.0 | 10.0 |