AI BENCHY तुलना

Anthropic: Claude Sonnet 4.6 vs xAI: Grok 4.3

सारांश

Claude Sonnet 4.6 vs Grok 4.3 benchmark तुलना: Grok 4.3 average score में आगे है: 7.7 vs 7.3. Claude Sonnet 4.6 की benchmark लागत कम है: $0.316 vs $0.614. Claude Sonnet 4.6 तेज है: 5.04s vs 47.51s, pass rates 55.6% vs 71.4%.

अनुशंसित मॉडल: Claude Sonnet 4.6 - Its score stays close to the best score here (7.3 vs 7.7), while costing about 1.9x less than Grok 4.3.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-12

मेट्रिक	Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17	Grok 4.3 Grok 4.3 medium रिलीज़: 2026-05-01

मेट्रिक	Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17	Grok 4.3 Grok 4.3 medium रिलीज़: 2026-05-01
स्कोर	7.3	7.7
रैंक	#56	#40
विश्वसनीयता	10.0	10.0
संगति	9.7	8.5
सही परीक्षण
प्रति प्रयास पास दर	55.6%	71.4%
अस्थिर टेस्ट	1	4
कुल रन	63	63
प्रति परिणाम लागत	2.870	4.724
कुल लागत	$0.316	$0.614
इनपुट कीमत	$3.000 / 1M	$1.250 / 1M
आउटपुट कीमत	$15.000 / 1M	$2.500 / 1M
कुल इनपुट टोकन	57,886	44,472
आउटपुट टोकन	9,465	1,981
रीजनिंग टोकन	0	221,382
प्रतिक्रिया समय (औसत)	5.04s	47.51s
प्रतिक्रिया समय (अधिकतम)	23.84s	216.69s
प्रतिक्रिया समय (कुल)	70.60s	997.68s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#56 Claude Sonnet 4.6

none

Cost: $0.038
Time: 27.3s
Tokens: 2,598 tok

#40 xAI: Grok 4.3

medium

Cost: $0.009
Time: 19.0s
Tokens: 3,661 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	4.8	10.0	25.0%	0		2.94s	636	1,214	0
Grok 4.3	10.0	10.0	100.0%	0		8.83s	2,010	88	8,207

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	5.5	10.0	33.3%	0		5.19s	8,522	2,127	0
Grok 4.3	5.9	7.7	44.4%	1		41.23s	8,340	1,028	31,226

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	9.5	10.0	100.0%	0		23.84s	26,024	3,766	0
Grok 4.3	10.0	10.0	100.0%	0		63.99s	12,909	234	15,301

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		3.43s	8,574	252	0
Grok 4.3	10.0	10.0	100.0%	0		18.97s	7,761	180	9,546

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	7.7	10.0	66.7%	0		3.54s	759	413	0
Grok 4.3	5.3	7.2	44.4%	1		181.74s	1,764	14	111,300

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	6.1	3.1	66.7%	1		2.56s	513	192	0
Grok 4.3	5.4	2.5	66.7%	1		24.70s	825	70	5,020

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	6.5	10.0	50.0%	0		1.96s	690	90	0
Grok 4.3	9.8	10.0	100.0%	0		18.58s	1,362	57	8,713

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	7.7	10.0	66.7%	0		2.53s	663	533	0
Grok 4.3	5.9	7.2	55.6%	1		22.52s	1,689	128	14,468

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	10.0	10.0	100.0%	0		4.11s	11,301	447	0
Grok 4.3	10.0	10.0	100.0%	0		17.66s	7,263	168	4,615

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Sonnet 4.6	3.0	10.0	0.0%	0		4.67s	204	431	0
Grok 4.3	3.0	10.0	0.0%	0		44.47s	549	14	12,986

त्वरित तुलना

तुलना जोड़ी बदलें