AI BENCHY Compare

OpenAI: GPT-5.4 Nano vs Xiaomi: MiMo-V2.5-Pro

Summary

GPT-5.4 Nano vs MiMo-V2.5-Pro benchmark comparison: GPT-5.4 Nano leads on average score with 7.5 vs 7.4. MiMo-V2.5-Pro has the lower benchmark cost at $0.106 vs $0.107. GPT-5.4 Nano is faster at 11.95s vs 26.13s, with pass rates of 63.5% vs 68.3%.

Recommended model: GPT-5.4 Nano - It has the best score here (7.5), while responding about 2.2x faster than MiMo-V2.5-Pro.

Last updated at: 2026-06-18

Metric	GPT-5.4 Nano GPT-5.4 Nano medium Release: 2026-03-17	MiMo-V2.5-Pro MiMo-V2.5-Pro medium Release: 2026-04-22

Metric	GPT-5.4 Nano GPT-5.4 Nano medium Release: 2026-03-17	MiMo-V2.5-Pro MiMo-V2.5-Pro medium Release: 2026-04-22
Score	7.5	7.4
Rank	#46	#51
Reliability	10.0	10.0
Consistency	8.4	8.5
Tests Correct
Attempt pass rate	63.5%	68.3%
Flaky tests	4	4
Total Runs	63	63
Cost per result	0.969	2.541
Total Cost	$0.107	$0.106
Input Price	$0.200 / 1M	$0.435 / 1M
Output Price	$1.250 / 1M	$0.870 / 1M
Total Input Tokens	35,434	40,854
Output Tokens	3,014	5,015
Reasoning Tokens	76,520	97,742
Response Time (avg)	11.95s	26.13s
Response Time (max)	94.06s	130.77s
Response Time (total)	250.98s	548.65s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#46 GPT-5.4 Nano

medium

Cost: $0.007
Time: 24.6s
Tokens: 4,943 tok

#51 MiMo-V2.5-Pro

medium

Invalid SVG

Cost: $0.000
Time: 300.0s
Tokens: 0 tok

Top Models by Score

Score vs Total Cost

Response Time (avg)

Score vs Response Time (avg)

Total Output Tokens

Score vs Total Output Tokens

Category Breakdown

Anti-AI Tricks	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.4 Nano	8.3	10.0	75.0%	0		4.52s	606	683	2,254
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		3.26s	621	323	1,179

Coding	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.4 Nano	6.1	4.7	66.7%	2		19.12s	7,305	516	20,778
MiMo-V2.5-Pro	6.2	4.7	66.7%	2		92.07s	6,543	780	51,218

Combined	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.4 Nano	9.8	10.0	100.0%	0		24.13s	12,345	349	5,719
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		53.36s	15,060	348	11,870

Data parsing and extraction	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.4 Nano	10.0	10.0	100.0%	0		2.54s	7,140	234	516
MiMo-V2.5-Pro	7.3	5.8	83.3%	1		18.81s	7,746	260	8,383

Domain specific	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.4 Nano	5.9	7.2	55.6%	1		38.18s	619	60	43,325
MiMo-V2.5-Pro	5.3	10.0	33.3%	0		37.87s	630	275	17,023

General Intelligence	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.4 Nano	4.5	10.0	0.0%	0		4.15s	477	179	443
MiMo-V2.5-Pro	5.5	10.0	0.0%	0		4.02s	492	155	163

Instructions following	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.4 Nano	9.8	10.0	100.0%	0		1.88s	660	95	521
MiMo-V2.5-Pro	9.9	10.0	100.0%	0		2.77s	672	82	803

Puzzle Solving	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.4 Nano	4.1	7.2	22.2%	1		3.79s	642	594	1,408
MiMo-V2.5-Pro	6.7	7.9	55.6%	1		5.31s	660	540	2,181

Tool Calling	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.4 Nano	10.0	10.0	100.0%	0		7.71s	5,445	234	382
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		16.87s	8,220	311	2,908

Trivia	Score	Consistency	Attempt pass rate	Flaky tests	Tests Correct	Response Time (avg)	Input Tokens	Output Tokens	Reasoning Tokens
GPT-5.4 Nano	3.0	10.0	0.0%	0		4.81s	195	70	1,174
MiMo-V2.5-Pro	3.0	10.0	0.0%	0		12.46s	210	1,941	2,014

Quick Compare

Switch Comparison Pair

Gemini 3 Flash PreviewlowvsMiMo-V2.5-Promedium GPT-5.3 ChatnonevsMiMo-V2.5-Promedium DeepSeek V4 ProhighvsGPT-5.4 Nanomedium Claude Sonnet 4.6nonevsMiMo-V2.5-Promedium Gemini 3 Flash PreviewlowvsGPT-5.4 Nanomedium Claude Opus 4.8nonevsMiMo-V2.5-Promedium GPT-5.4 NanomediumvsStep 3.7 Flashlow DeepSeek V4 ProhighvsMiMo-V2.5-Promedium Claude Sonnet 4.6nonevsGPT-5.4 Nanomedium DeepSeek V4 PrononevsMiMo-V2.5-Promedium Qwen3.7 PlusnonevsMiMo-V2.5-Promedium MiMo-V2.5-PromediumvsGLM 5.2none