AI BENCHY Compare

Modelos comparados

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-04-04

Métrica	Hunter Alpha Hunter Alpha medium Lanzamiento: 2026-03-11	MiMo-V2-Pro MiMo-V2-Pro medium Lanzamiento: 2026-03-18	Hunter Alpha Hunter Alpha none Lanzamiento: 2026-03-11	MiMo-V2-Pro MiMo-V2-Pro none Lanzamiento: 2026-03-18

Métrica	Hunter Alpha Hunter Alpha medium Lanzamiento: 2026-03-11	MiMo-V2-Pro MiMo-V2-Pro medium Lanzamiento: 2026-03-18	Hunter Alpha Hunter Alpha none Lanzamiento: 2026-03-11	MiMo-V2-Pro MiMo-V2-Pro none Lanzamiento: 2026-03-18
Puntuación	7.0	8.0	5.9	5.8
Rango	#43	#24	#63	#65
Consistencia	7.2	8.5	8.1	8.5
Pruebas correctas
Tasa de aciertos por intento	68.6%	76.5%	49.0%	45.1%
Pruebas inestables	6	3	4	3
Ejecuciones totales	51	45	51	51
Costo por resultado	0.000	1.110	0.000	0.659
Costo total	$0.000	$0.123	$0.000	$0.040
Precio de entrada	$0.000 / 1M	$1.000 / 1M	$0.000 / 1M	$1.000 / 1M
Precio de salida	$0.000 / 1M	$3.000 / 1M	$0.000 / 1M	$3.000 / 1M
Tokens de salida	4,724	1,875	2,278	1,721
Tokens de razonamiento	17,921	26,959	0	0
Tiempo de respuesta (promedio)	10.33s	9.78s	4.58s	2.31s
Tiempo de respuesta (máximo)	30.53s	64.71s	15.17s	6.58s
Tiempo de respuesta (total)	175.60s	156.45s	77.92s	39.25s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Hunter Alpha	7.3	5.8	83.3%	2		4.75s	479	1,103
MiMo-V2-Pro	10.0	10.0	100.0%	0		3.06s	223	1,107
Hunter Alpha	3.5	8.0	16.7%	1		3.81s	779	0
MiMo-V2-Pro	3.5	8.0	16.7%	1		1.80s	315	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Hunter Alpha	4.7	1.6	66.7%	1		30.53s	792	3,456
MiMo-V2-Pro	4.7	1.6	66.7%	1		64.71s	380	14,186
Hunter Alpha	3.0	10.0	0.0%	0		15.17s	379	0
MiMo-V2-Pro	3.0	10.0	0.0%	0		6.58s	333	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Hunter Alpha	10.0	10.0	100.0%	0		23.16s	1,488	8,017
MiMo-V2-Pro	7.3	5.8	83.3%	1		17.20s	260	7,484
Hunter Alpha	10.0	10.0	100.0%	0		8.49s	249	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		1.39s	249	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Hunter Alpha	3.0	10.0	0.0%	0		10.52s	892	2,406
MiMo-V2-Pro	5.3	10.0	33.3%	0		6.00s	155	1,048
Hunter Alpha	5.3	10.0	33.3%	0		2.33s	27	0
MiMo-V2-Pro	5.3	7.2	44.4%	1		1.78s	26	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Hunter Alpha	7.0	3.7	66.7%	1		6.44s	116	260
MiMo-V2-Pro	10.0	10.0	100.0%	0		4.06s	198	424
Hunter Alpha	6.1	3.1	66.7%	1		2.71s	91	0
MiMo-V2-Pro	4.3	9.9	0.0%	0		2.44s	125	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Hunter Alpha	9.9	10.0	100.0%	0		4.18s	208	465
MiMo-V2-Pro	9.9	10.0	100.0%	0		3.36s	83	667
Hunter Alpha	6.4	10.0	50.0%	0		2.82s	69	0
MiMo-V2-Pro	6.5	10.0	50.0%	0		2.51s	69	0

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Hunter Alpha	6.1	4.7	66.7%	2		5.36s	441	1,310
MiMo-V2-Pro	7.0	7.2	55.6%	1		4.71s	313	1,179
Hunter Alpha	5.8	4.4	66.7%	2		3.06s	349	0
MiMo-V2-Pro	6.0	7.1	55.6%	1		1.83s	327	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Hunter Alpha	10.0	10.0	100.0%	0		17.33s	308	904
MiMo-V2-Pro	10.0	10.0	100.0%	0		8.19s	263	864
Hunter Alpha	10.0	10.0	100.0%	0		6.02s	335	0
MiMo-V2-Pro	10.0	10.0	100.0%	0		4.39s	277	0

Comparación rápida

Cambiar par de comparación

MiniMax M2.5mediumDisponible gratisvsHunter Alphanone Gemini 3 Flash PreviewnonevsMiMo-V2-Promedium Gemini 3.1 Flash Lite PreviewlowvsMiMo-V2-Promedium MiniMax M2.5mediumDisponible gratisvsMiMo-V2-Pronone gpt-oss-120bmediumDisponible gratisvsHunter Alphanone Gemini 3.1 Flash Lite PreviewnonevsMiMo-V2-Promedium GPT-5.2 ChatnonevsMiMo-V2-Promedium Mistral Small 4mediumvsMiMo-V2-Pronone Hunter AlphamediumvsQwen3.5 Plus 2026-02-15none gpt-oss-120bmediumDisponible gratisvsMiMo-V2-Pronone Gemma 4 31BnonevsHunter Alphamedium Hunter AlphamediumvsGLM 5none