AI BENCHY Compare

OpenAI: GPT-5.4 vs Xiaomi: MiMo-V2.5-Pro

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-05-22

Métrica	GPT-5.4 GPT-5.4 medium Lanzamiento: 2026-03-05	MiMo-V2.5-Pro MiMo-V2.5-Pro medium Lanzamiento: 2026-04-22

Métrica	GPT-5.4 GPT-5.4 medium Lanzamiento: 2026-03-05	MiMo-V2.5-Pro MiMo-V2.5-Pro medium Lanzamiento: 2026-04-22
Puntuación	7.9	7.6
Rango	#27	#40
Fiabilidad	10.0	10.0
Consistencia	8.5	8.9
Pruebas correctas
Tasa de aciertos por intento	75.0%	68.3%
Pruebas inestables	4	3
Ejecuciones totales	60	60
Costo por resultado	8.767	2.407
Costo total	$1.140	$0.289
Precio de entrada	$2.500 / 1M	$1.000 / 1M
Precio de salida	$15.000 / 1M	$3.000 / 1M
Tokens de salida	2,222	4,957
Tokens de razonamiento	68,503	80,301
Tiempo de respuesta (promedio)	22.31s	21.77s
Tiempo de respuesta (máximo)	100.41s	130.77s
Tiempo de respuesta (total)	446.15s	435.33s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.4	8.3	10.0	75.0%	0		4.11s	240	1,511
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		3.26s	323	1,179

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.4	8.2	6.7	83.3%	1		54.98s	412	19,995
MiMo-V2.5-Pro	7.0	6.2	66.7%	1		81.67s	769	33,771

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.4	10.0	10.0	100.0%	0		20.57s	301	3,543
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		53.36s	348	11,870

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.4	10.0	10.0	100.0%	0		5.32s	234	804
MiMo-V2.5-Pro	7.3	5.8	83.3%	1		18.81s	260	8,383

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.4	5.3	7.2	44.4%	1		74.27s	61	34,748
MiMo-V2.5-Pro	5.3	10.0	33.3%	0		37.87s	275	17,023

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.4	4.7	3.1	33.3%	1		4.92s	145	321
MiMo-V2.5-Pro	5.5	10.0	0.0%	0		4.02s	155	163

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.4	10.0	10.0	100.0%	0		3.11s	93	897
MiMo-V2.5-Pro	9.9	10.0	100.0%	0		2.77s	82	803

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.4	8.2	7.2	88.9%	1		9.13s	442	3,832
MiMo-V2.5-Pro	6.7	7.9	55.6%	1		5.16s	493	2,187

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.4	10.0	10.0	100.0%	0		13.28s	264	1,031
MiMo-V2.5-Pro	10.0	10.0	100.0%	0		16.87s	311	2,908

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
GPT-5.4	3.0	10.0	0.0%	0		13.95s	30	1,821
MiMo-V2.5-Pro	3.0	10.0	0.0%	0		12.46s	1,941	2,014

Comparación rápida

Cambiar par de comparación

GPT-5.4mediumvsQwen3.7 Maxnone Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2.5-Promedium GPT-5.2 ChatnonevsMiMo-V2.5-Promedium Gemini 3 Flash PreviewnonevsMiMo-V2.5-Promedium Gemini 3.5 FlashminimalvsGPT-5.4medium Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2.5-Promedium Gemini 3.1 Flash LitelowvsMiMo-V2.5-Promedium GPT-5.3 ChatnonevsMiMo-V2.5-Promedium DeepSeek V4 FlashhighDisponible gratisvsMiMo-V2.5-Promedium Gemini 3 Flash PreviewnonevsGPT-5.4medium Qwen3.7 MaxnonevsMiMo-V2.5-Promedium Gemini 3.1 Flash Lite PreviewlowvsGPT-5.4medium