AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs MiniMax: MiniMax M3

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-06-01

Métrica	Claude Opus 4.8 Claude Opus 4.8 none Lanzamiento: 2026-05-28	MiniMax M3 MiniMax M3 medium Lanzamiento: 2026-06-01

Métrica	Claude Opus 4.8 Claude Opus 4.8 none Lanzamiento: 2026-05-28	MiniMax M3 MiniMax M3 medium Lanzamiento: 2026-06-01
Puntuación	7.3	7.3
Rango	#66	#65
Fiabilidad	10.0	9.6
Consistencia	9.2	8.4
Pruebas correctas
Tasa de aciertos por intento	65.0%	68.3%
Pruebas inestables	2	6
Ejecuciones totales	60	60
Costo por resultado	4.324	1.083
Costo total	$0.519	$0.120
Precio de entrada	$5.000 / 1M	$0.300 / 1M
Precio de salida	$25.000 / 1M	$1.200 / 1M
Tokens de salida	8,098	46,884
Tokens de razonamiento	0	85,935
Tiempo de respuesta (promedio)	3.51s	68.44s
Tiempo de respuesta (máximo)	17.73s	431.03s
Tiempo de respuesta (total)	70.19s	1300.32s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	6.5	10.0	50.0%	0		3.40s	1,472	0
MiniMax M3	5.5	3.7	66.7%	3		14.95s	874	3,414

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	6.8	10.0	50.0%	0		3.59s	1,323	0
MiniMax M3	7.5	10.0	66.7%	1		185.58s	4,071	26,059

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	9.5	10.0	100.0%	0		17.73s	3,259	0
MiniMax M3	10.0	10.0	100.0%	0		65.30s	1,306	6,253

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	7.3	5.8	83.3%	1		1.77s	308	0
MiniMax M3	10.0	10.0	100.0%	0		14.92s	514	3,164

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	5.3	7.2	44.4%	1		1.66s	61	0
MiniMax M3	6.0	10.0	44.4%	1		233.13s	16,254	19,070

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	10.0	10.0	100.0%	0		3.48s	230	0
MiniMax M3	5.1	3.4	33.3%	1		33.25s	2,487	2,523

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	9.9	10.0	100.0%	0		1.37s	95	0
MiniMax M3	9.8	10.0	100.0%	0		6.14s	103	920

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	7.7	10.0	66.7%	0		2.74s	783	0
MiniMax M3	7.9	9.9	66.7%	0		49.91s	11,946	13,761

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	10.0	10.0	100.0%	0		5.35s	355	0
MiniMax M3	10.0	10.0	100.0%	0		11.91s	281	555

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	3.0	10.0	0.0%	0		3.41s	212	0
MiniMax M3	3.0	10.0	0.0%	0		100.80s	9,048	10,216

Comparación rápida

Cambiar par de comparación

Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Claude Opus 4.8nonevsRing-2.6-1Tmedium Claude Opus 4.8nonevsGPT-5.4 Minimedium Claude Opus 4.8nonevsGPT-5.2medium Ring-2.6-1TnonevsMiniMax M3medium MiniMax M3mediumvsStep 3.7 Flashlow Claude Opus 4.8nonevsGLM 5V Turbomedium Claude Opus 4.8nonevsStep 3.5 Flashmedium Claude Opus 4.8nonevsGPT-5.4 Nanomedium Claude Opus 4.8nonevsKimi K2.6mediumDisponible gratis MiniMax M3mediumvsGPT-5.3 Chatnone Claude Opus 4.8nonevsStep 3.7 Flashlow