AI BENCHY तुलना

MoonshotAI: Kimi K2.5 vs OpenAI: GPT-5.5

सारांश

Kimi K2.5 vs GPT-5.5 benchmark तुलना: GPT-5.5 average score में आगे है: 9.3 vs 7.5. Kimi K2.5 की benchmark लागत कम है: $0.348 vs $0.907. GPT-5.5 तेज है: 9.76s vs 98.43s, pass rates 68.3% vs 85.7%.

अनुशंसित मॉडल: GPT-5.5 - It has the best score here (9.3), while responding about 10.1x faster than Kimi K2.5.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-02

मेट्रिक	Kimi K2.5 Kimi K2.5 medium रिलीज़: 2026-01-27	GPT-5.5 GPT-5.5 low रिलीज़: 2026-04-24

मेट्रिक	Kimi K2.5 Kimi K2.5 medium रिलीज़: 2026-01-27	GPT-5.5 GPT-5.5 low रिलीज़: 2026-04-24
स्कोर	7.5	9.3
रैंक	#45	#4
विश्वसनीयता	10.0	10.0
संगति	6.9	10.0
सही परीक्षण
प्रति प्रयास पास दर	68.3%	85.7%
अस्थिर टेस्ट	8	0
कुल रन	63	63
प्रति परिणाम लागत	3.704	5.035
कुल लागत	$0.348	$0.907
इनपुट कीमत	$0.375 / 1M	$5.000 / 1M
आउटपुट कीमत	$2.025 / 1M	$30.000 / 1M
कुल इनपुट टोकन	34,312	34,209
आउटपुट टोकन	48,379	2,046
रीजनिंग टोकन	157,747	22,460
प्रतिक्रिया समय (औसत)	98.43s	9.76s
प्रतिक्रिया समय (अधिकतम)	281.00s	56.19s
प्रतिक्रिया समय (कुल)	1378.03s	204.92s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#45 MoonshotAI: Kimi K2.5

medium

लागत: $0.030
समय: 58.6s
टोकन: 8,683 tok

#4 GPT-5.5

low

लागत: $0.068
समय: 37.0s
टोकन: 2,339 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Kimi K2.5	7.3	5.8	83.3%	2		51.38s	634	2,789	8,880
GPT-5.5	10.0	10.0	100.0%	0		4.41s	606	238	1,020

कोडिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Kimi K2.5	6.1	4.6	66.7%	2		217.49s	6,935	5,705	74,693
GPT-5.5	10.0	10.0	100.0%	0		15.04s	7,302	423	6,402

संयुक्त	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Kimi K2.5	10.0	10.0	100.0%	0		71.37s	11,280	703	3,713
GPT-5.5	10.0	10.0	100.0%	0		9.56s	11,019	303	717

डेटा पार्सिंग और निष्कर्षण	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Kimi K2.5	10.0	10.0	100.0%	0		49.78s	7,020	563	7,940
GPT-5.5	10.0	10.0	100.0%	0		3.28s	7,140	228	157

डोमेन-विशिष्ट	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Kimi K2.5	3.5	4.4	33.3%	2		137.29s	485	20,753	30,564
GPT-5.5	5.3	10.0	33.3%	0		28.05s	723	69	11,609

Samanya Buddhimatta	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Kimi K2.5	6.5	3.4	66.7%	1		69.73s	480	3,815	4,262
GPT-5.5	10.0	10.0	100.0%	0		5.17s	477	133	245

निर्देश पालन	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Kimi K2.5	10.0	10.0	100.0%	0		92.47s	675	5,371	6,547
GPT-5.5	9.9	10.0	100.0%	0		3.74s	660	93	415

पहेली समाधान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Kimi K2.5	5.3	7.3	44.4%	1		43.23s	659	8,426	12,692
GPT-5.5	10.0	10.0	100.0%	0		4.74s	642	279	954

टूल कॉलिंग	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Kimi K2.5	10.0	10.0	100.0%	0		31.74s	5,933	242	812
GPT-5.5	10.0	10.0	100.0%	0		4.96s	5,445	250	101

सामान्य ज्ञान	स्कोर	संगति	प्रति प्रयास पास दर	अस्थिर टेस्ट	सही परीक्षण	प्रतिक्रिया समय (औसत)	इनपुट टोकन	आउटपुट टोकन	रीजनिंग टोकन
Kimi K2.5	3.0	10.0	0.0%	0		83.95s	211	12	7,644
GPT-5.5	3.0	10.0	0.0%	0		10.06s	195	30	840

त्वरित तुलना

तुलना जोड़ी बदलें

Kimi K2.5mediumvsGPT-5.3 Chatnone GPT-5.5lowvsQwen3.7 Maxmedium DeepSeek V4 ProhighvsKimi K2.5medium Claude Fable 5mediumvsGPT-5.5low Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Kimi K2.5mediumvsStep 3.7 Flashlow Gemini 3 Flash PreviewlowvsKimi K2.5medium Claude Opus 4.8lowvsKimi K2.5medium Gemini 3.5 FlashmediumvsGPT-5.5low Claude Sonnet 4.6nonevsKimi K2.5medium Gemini 3 Flash PreviewmediumvsGPT-5.5low Claude Opus 4.8nonevsKimi K2.5medium