AI BENCHY Compare

StepFun: Step 3.7 Flash vs xAI: Grok 4.3

Resumen

Comparación benchmark de Step 3.7 Flash vs Grok 4.3: Grok 4.3 lidera en puntuación media con 7.7 vs 7.1. Grok 4.3 tiene menor coste de benchmark con $0.614 vs $1.148. Grok 4.3 es más rápido con 47.51s vs 64.46s, con tasas de acierto de 63.5% vs 71.4%.

Modelo recomendado: Grok 4.3 - Tiene la mejor puntuación aquí (7.7) y cuesta aproximadamente 1.9x menos que Step 3.7 Flash.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-06-12

Métrica	Step 3.7 Flash Step 3.7 Flash high Lanzamiento: 2026-05-29	Grok 4.3 Grok 4.3 medium Lanzamiento: 2026-05-01

Métrica	Step 3.7 Flash Step 3.7 Flash high Lanzamiento: 2026-05-29	Grok 4.3 Grok 4.3 medium Lanzamiento: 2026-05-01
Puntuación	7.1	7.7
Rango	#63	#40
Fiabilidad	10.0	10.0
Consistencia	8.2	8.5
Pruebas correctas
Tasa de aciertos por intento	63.5%	71.4%
Pruebas inestables	4	4
Ejecuciones totales	63	63
Costo por resultado	10.434	4.724
Costo total	$1.148	$0.614
Precio de entrada	$0.200 / 1M	$1.250 / 1M
Precio de salida	$1.150 / 1M	$2.500 / 1M
Total de tokens de entrada	38,391	44,472
Tokens de salida	991,355	1,981
Tokens de razonamiento	0	221,382
Tiempo de respuesta (promedio)	64.46s	47.51s
Tiempo de respuesta (máximo)	364.99s	216.69s
Tiempo de respuesta (total)	1353.57s	997.68s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#63 Step 3.7 Flash

high

Cost: $0.007
Time: 63.6s
Tokens: 6,030 tok

#40 xAI: Grok 4.3

medium

Cost: $0.009
Time: 19.0s
Tokens: 3,661 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Step 3.7 Flash	10.0	10.0	100.0%	0		13.40s	696	42,656	0
Grok 4.3	10.0	10.0	100.0%	0		8.83s	2,010	88	8,207

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Step 3.7 Flash	4.0	6.0	22.2%	1		206.21s	6,057	327,340	0
Grok 4.3	5.9	7.7	44.4%	1		41.23s	8,340	1,028	31,226

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Step 3.7 Flash	10.0	10.0	100.0%	0		13.01s	13,638	8,802	0
Grok 4.3	10.0	10.0	100.0%	0		63.99s	12,909	234	15,301

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Step 3.7 Flash	10.0	10.0	100.0%	0		14.72s	7,368	23,113	0
Grok 4.3	10.0	10.0	100.0%	0		18.97s	7,761	180	9,546

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Step 3.7 Flash	4.1	4.4	44.5%	2		149.64s	783	410,502	0
Grok 4.3	5.3	7.2	44.4%	1		181.74s	1,764	14	111,300

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Step 3.7 Flash	5.5	10.0	0.0%	0		4.17s	510	2,862	0
Grok 4.3	5.4	2.5	66.7%	1		24.70s	825	70	5,020

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Step 3.7 Flash	9.8	10.0	100.0%	0		1.52s	705	2,010	0
Grok 4.3	9.8	10.0	100.0%	0		18.58s	1,362	57	8,713

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Step 3.7 Flash	5.3	7.2	44.4%	1		10.22s	711	25,422	0
Grok 4.3	5.9	7.2	55.6%	1		22.52s	1,689	128	14,468

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Step 3.7 Flash	10.0	10.0	100.0%	0		2.79s	7,701	1,172	0
Grok 4.3	10.0	10.0	100.0%	0		17.66s	7,263	168	4,615

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Step 3.7 Flash	3.0	10.0	0.0%	0		149.34s	222	147,476	0
Grok 4.3	3.0	10.0	0.0%	0		44.47s	549	14	12,986

Comparación rápida

Cambiar par de comparación

Step 3.7 FlashhighvsGLM 5.1medium Step 3.7 FlashhighvsMiMo-V2-Flashmedium Step 3.7 FlashlowvsGrok 4.3medium Qwen3.7 PlusnonevsStep 3.7 Flashhigh Kimi K2.7 CodemediumvsStep 3.7 Flashhigh Gemma 4 26B A4BmediumDisponible gratisvsStep 3.7 Flashhigh Gemini 3.5 FlashnonevsStep 3.7 Flashhigh Claude Opus 4.8nonevsStep 3.7 Flashhigh Step 3.7 FlashhighvsGLM 5V Turbomedium Gemini 3 Flash PreviewnonevsStep 3.7 Flashhigh GPT-5.3 ChatnonevsGrok 4.3medium Claude Sonnet 4.6nonevsStep 3.7 Flashhigh