AI BENCHY तुलना

Anthropic: Claude Opus 4.6 vs MoonshotAI: Kimi K2.6

सारांश

Claude Opus 4.6 vs Kimi K2.6 benchmark तुलना: Kimi K2.6 average score में आगे है: 7.8 vs 7.7. Kimi K2.6 की benchmark लागत कम है: $0.888 vs $2.053. Claude Opus 4.6 तेज है: 25.89s vs 71.67s, pass rates 61.9% vs 65.1%.

अनुशंसित मॉडल: Kimi K2.6 - It has the best score here (7.8), while costing about 2.3x less than Claude Opus 4.6.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-02

मेट्रिक	Claude Opus 4.6 Claude Opus 4.6 medium रिलीज़: 2026-02-05	Kimi K2.6 Kimi K2.6 medium रिलीज़: 2026-04-20 निःशुल्क उपलब्ध

मेट्रिक	Claude Opus 4.6 Claude Opus 4.6 medium रिलीज़: 2026-02-05	Kimi K2.6 Kimi K2.6 medium रिलीज़: 2026-04-20 निःशुल्क उपलब्ध
स्कोर	7.7	7.8
रैंक	#40	#36
विश्वसनीयता	10.0	10.0
संगति	8.8	8.6
सही परीक्षण
प्रति प्रयास पास दर	61.9%	65.1%
अस्थिर टेस्ट	3	3
कुल रन	63	63
प्रति परिणाम लागत	17.103	8.358
कुल लागत	$2.053	$0.888
इनपुट कीमत	$5.000 / 1M	$0.660 / 1M
आउटपुट कीमत	$25.000 / 1M	$3.410 / 1M
कुल इनपुट टोकन	53,227	29,450
आउटपुट टोकन	47,446	102,923
रीजनिंग टोकन	24,000	254,094
प्रतिक्रिया समय (औसत)	25.89s	71.67s
प्रतिक्रिया समय (अधिकतम)	83.40s	406.78s
प्रतिक्रिया समय (कुल)	362.49s	1433.36s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#40 Claude Opus 4.6

medium

अमान्य SVG

लागत: $0.000
समय: 300.0s
टोकन: 0 tok

#36 MoonshotAI: Kimi K2.6

medium

लागत: $0.013
समय: 103.4s
टोकन: 3,620 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	6.4	5.8	66.7%	2		7.45s	840	986	1,071
Kimi K2.6	7.0	8.0	66.7%	1		11.59s	618	7,115	8,934

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	5.7	7.1	44.4%	1		30.10s	8,522	13,057	4,121
Kimi K2.6	5.7	8.6	33.3%	0		214.42s	2,925	9,970	77,189

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	10.0	10.0	100.0%	0		76.66s	20,685	8,178	5,194
Kimi K2.6	10.0	10.0	100.0%	0		40.96s	11,271	711	13,876

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	10.0	10.0	100.0%	0		7.37s	8,676	691	757
Kimi K2.6	10.0	10.0	100.0%	0		20.38s	7,014	316	11,305

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	3.0	10.0	0.0%	0		83.40s	674	14,642	8,687
Kimi K2.6	5.3	7.2	44.4%	1		202.38s	326	47,035	98,262

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	10.0	10.0	100.0%	0		5.04s	564	188	292
Kimi K2.6	10.0	10.0	100.0%	0		17.83s	477	3,981	4,472

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	10.0	10.0	100.0%	0		2.43s	792	266	467
Kimi K2.6	10.0	10.0	100.0%	0		12.53s	669	3,977	5,269

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	7.7	10.0	66.7%	0		4.71s	816	532	630
Kimi K2.6	6.0	7.4	55.6%	1		25.06s	651	13,860	17,599

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	10.0	10.0	100.0%	0		9.73s	11,454	861	329
Kimi K2.6	10.0	10.0	100.0%	0		8.92s	5,286	248	1,011

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Claude Opus 4.6	3.0	10.0	0.0%	0		63.24s	204	8,045	2,452
Kimi K2.6	3.0	10.0	0.0%	0		130.27s	213	15,710	16,177

त्वरित तुलना

तुलना जोड़ी बदलें

Claude Opus 4.6mediumvsStep 3.7 Flashlow Claude Opus 4.8lowvsKimi K2.6mediumनिःशुल्क उपलब्ध Kimi K2.6mediumनिःशुल्क उपलब्धvsStep 3.7 Flashlow Claude Opus 4.6mediumvsDeepSeek V4 Prohigh DeepSeek V4 ProhighvsKimi K2.6mediumनिःशुल्क उपलब्ध Claude Opus 4.6mediumvsGPT-5.3 Chatnone Kimi K2.6mediumनिःशुल्क उपलब्धvsGPT-5.3 Chatnone Claude Opus 4.6mediumvsGemini 3 Flash Previewlow Gemini 3 Flash PreviewlowvsKimi K2.6mediumनिःशुल्क उपलब्ध Claude Sonnet 4.6nonevsKimi K2.6mediumनिःशुल्क उपलब्ध DeepSeek V4 FlashhighvsKimi K2.6mediumनिःशुल्क उपलब्ध Claude Opus 4.6mediumvsDeepSeek V4 Pronone