AI BENCHY Compare

MoonshotAI: Kimi K2.5 vs OpenAI: GPT-5.2

Last updated at: 2026-05-19

Metric	Kimi K2.5 Kimi K2.5 medium Release: 2026-01-27	GPT-5.2 GPT-5.2 medium Release: 2025-12-11

Metric	Kimi K2.5 Kimi K2.5 medium Release: 2026-01-27	GPT-5.2 GPT-5.2 medium Release: 2025-12-11
Score	6.8	7.2
Rank	#76	#65
Reliability	10.0	10.0
Consistency	7.0	8.2
Tests Correct
Attempt pass rate	68.4%	68.4%
Flaky tests	7	4
Total Runs	57	57
Cost per result	2.616	3.609
Total Cost	$0.236	$0.397
Input Price	$0.400 / 1M	$1.750 / 1M
Output Price	$1.900 / 1M	$14.000 / 1M
Output Tokens	42,188	2,731
Reasoning Tokens	92,514	22,200
Response Time (avg)	73.39s	15.22s
Response Time (max)	150.77s	77.80s
Response Time (total)	880.65s	182.59s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Kimi K2.5	7.3	5.8	83.3%	2		51.38s	2,789	8,880
GPT-5.2	6.5	8.0	58.3%	1		7.81s	567	2,002

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Kimi K2.5	4.7	1.6	66.7%	1		150.77s	1,269	9,749
GPT-5.2	10.0	10.0	100.0%	0		15.12s	467	2,166

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Kimi K2.5	10.0	10.0	100.0%	0		71.37s	703	3,713
GPT-5.2	10.0	10.0	100.0%	0		14.06s	291	1,757

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Kimi K2.5	10.0	10.0	100.0%	0		49.78s	563	7,940
GPT-5.2	10.0	10.0	100.0%	0		3.15s	234	420

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Kimi K2.5	3.5	4.4	33.3%	2		137.29s	20,753	30,564
GPT-5.2	5.9	7.2	55.6%	1		77.80s	42	10,342

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Kimi K2.5	6.5	3.4	66.7%	1		69.73s	3,815	4,262
GPT-5.2	3.7	9.7	0.0%	0		4.32s	162	269

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Kimi K2.5	10.0	10.0	100.0%	0		92.47s	5,371	6,547
GPT-5.2	9.9	10.0	100.0%	0		3.12s	94	614

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Kimi K2.5	5.3	7.3	44.4%	1		45.40s	6,671	12,403
GPT-5.2	7.6	7.3	77.8%	1		5.47s	609	938

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Kimi K2.5	10.0	10.0	100.0%	0		31.74s	242	812
GPT-5.2	4.7	1.6	66.7%	1		10.30s	239	469

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
Kimi K2.5	3.0	10.0	0.0%	0		83.95s	12	7,644
GPT-5.2	3.0	10.0	0.0%	0		28.18s	26	3,223

Quick Compare

Switch Comparison Pair

Gemini 3.1 Flash LiteminimalvsKimi K2.5medium Claude Sonnet 4.6nonevsGPT-5.2medium Ring-2.6-1TnonevsGPT-5.2medium GPT-5.2mediumvsQwen3.6 Max Previewnone DeepSeek V4 ProhighvsKimi K2.5medium Gemma 4 31BnoneFree AvailablevsKimi K2.5medium Kimi K2.5mediumvsGPT-5.5none Gemini 3.1 Flash LitenonevsKimi K2.5medium Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none Gemma 4 31BnoneFree AvailablevsGPT-5.2medium DeepSeek V4 FlashhighFree AvailablevsGPT-5.2medium DeepSeek V4 ProhighvsGPT-5.2medium