AI BENCHY Compare

OpenAI: GPT-5.5 vs Xiaomi: MiMo-V2.5-Pro

Last updated at: 2026-05-08

Metric	GPT-5.5 GPT-5.5 medium Release: 2026-04-24	MiMo-V2.5-Pro MiMo-V2.5-Pro medium Release: 2026-04-22

Metric	GPT-5.5 GPT-5.5 medium Release: 2026-04-24	MiMo-V2.5-Pro MiMo-V2.5-Pro medium Release: 2026-04-22
Score	8.9	8.1
Rank	#4	#18
Reliability	10.0	10.0
Consistency	9.1	9.2
Tests Correct
Attempt pass rate	87.7%	74.1%
Flaky tests	2	2
Total Runs	57	54
Cost per result	18.365	1.661
Total Cost	$2.939	$0.200
Input Price	$5.000 / 1M	$1.000 / 1M
Output Price	$30.000 / 1M	$3.000 / 1M
Output Tokens	1,950	2,790
Reasoning Tokens	91,386	52,001
Response Time (avg)	33.02s	16.23s
Response Time (max)	332.10s	84.22s
Response Time (total)	627.45s	292.10s

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		4.66s	250	1,335
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		3.26s	323	1,179

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		9.09s	318	1,391
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		32.58s	543	7,485

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		19.29s	312	2,841
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		53.36s	348	11,870

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		4.18s	234	593
MiMo-V2.5-Pro	7.3	5.8	83.3%	1		18.81s	260	8,383

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	5.3	7.2	44.4%	1		164.14s	67	79,625
MiMo-V2.5-Pro	5.3	10.0	33.3%	0		37.87s	275	17,023

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		4.16s	138	223
MiMo-V2.5-Pro	5.5	10.0	0.0%	0		4.02s	155	163

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		3.36s	93	538
MiMo-V2.5-Pro	9.9	10.0	100.0%	0		2.77s	82	803

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		6.78s	250	2,254
MiMo-V2.5-Pro	6.7	7.9	55.6%	1		5.16s	493	2,187

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	10.0	10.0	100.0%	0		10.57s	258	832
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		16.87s	311	2,908

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Output Tokens	Reasoning Tokens
GPT-5.5	2.8	1.6	33.3%	1		37.86s	30	1,754
MiMo-V2.5-Pro	-	-	-	-	-	-	-	-

Quick Compare

Switch Comparison Pair

Gemini 3 Flash PreviewlowvsGPT-5.5medium Gemini 3 Flash PreviewnonevsMiMo-V2.5-Promedium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2.5-Promedium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2.5-Promedium GPT-5.2 ChatnonevsMiMo-V2.5-Promedium Gemini 3.1 Flash LitelowvsMiMo-V2.5-Promedium GPT-5.3 ChatnonevsMiMo-V2.5-Promedium DeepSeek V4 FlashhighvsMiMo-V2.5-Promedium Gemini 3 Flash PreviewlowvsMiMo-V2.5-Promedium GPT-5.5lowvsMiMo-V2.5-Promedium Qwen3.6 Max PreviewnonevsMiMo-V2.5-Promedium Claude Sonnet 4.6nonevsMiMo-V2.5-Promedium