AI BENCHY Compare

Qwen: Qwen3.5-35B-A3B vs StepFun: Step 3.7 Flash

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-05-29

Métrica	Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium Lanzamiento: 2026-02-24	Step 3.7 Flash Step 3.7 Flash high Lanzamiento: 2026-05-29

Métrica	Qwen3.5-35B-A3B Qwen3.5-35B-A3B medium Lanzamiento: 2026-02-24	Step 3.7 Flash Step 3.7 Flash high Lanzamiento: 2026-05-29
Puntuación	7.3	7.1
Rango	#68	#74
Fiabilidad	10.0	10.0
Consistencia	7.5	8.2
Pruebas correctas
Tasa de aciertos por intento	73.3%	65.8%
Pruebas inestables	6	4
Ejecuciones totales	60	60
Costo por resultado	4.865	8.723
Costo total	$0.536	$0.960
Precio de entrada	$0.139 / 1M	$0.200 / 1M
Precio de salida	$1.000 / 1M	$1.150 / 1M
Tokens de salida	31,242	828,084
Tokens de razonamiento	330,546	0
Tiempo de respuesta (promedio)	69.66s	49.43s
Tiempo de respuesta (máximo)	409.98s	192.75s
Tiempo de respuesta (total)	1393.17s	988.58s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		21.13s	798	42,652
Step 3.7 Flash	10.0	10.0	100.0%	0		13.40s	42,656	0

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Qwen3.5-35B-A3B	6.5	10.0	50.0%	0		244.54s	14,456	88,431
Step 3.7 Flash	3.6	4.6	25.0%	1		126.82s	164,069	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Qwen3.5-35B-A3B	4.7	1.6	66.7%	1		75.34s	775	12,485
Step 3.7 Flash	10.0	10.0	100.0%	0		13.01s	8,802	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Qwen3.5-35B-A3B	7.3	5.9	83.3%	1		59.33s	235	19,493
Step 3.7 Flash	10.0	10.0	100.0%	0		14.72s	23,113	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Qwen3.5-35B-A3B	4.1	4.4	44.5%	2		88.34s	41	46,368
Step 3.7 Flash	4.1	4.4	44.5%	2		149.64s	410,502	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Qwen3.5-35B-A3B	2.8	1.6	33.3%	1		30.30s	20	3,753
Step 3.7 Flash	5.5	10.0	0.0%	0		4.17s	2,862	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		24.45s	97	17,361
Step 3.7 Flash	9.8	10.0	100.0%	0		1.52s	2,010	0

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Qwen3.5-35B-A3B	8.2	7.2	88.9%	1		33.13s	3,592	26,585
Step 3.7 Flash	5.3	7.2	44.4%	1		10.22s	25,422	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Qwen3.5-35B-A3B	10.0	10.0	100.0%	0		4.65s	309	1,365
Step 3.7 Flash	10.0	10.0	100.0%	0		2.79s	1,172	0

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Qwen3.5-35B-A3B	3.0	10.0	0.0%	0		177.35s	10,919	72,053
Step 3.7 Flash	3.0	10.0	0.0%	0		149.34s	147,476	0

Comparación rápida

Cambiar par de comparación

Claude Opus 4.8nonevsQwen3.5-35B-A3Bmedium Ring-2.6-1TnonevsQwen3.5-35B-A3Bmedium GPT-5 MinimediumvsStep 3.7 Flashhigh GPT-5.4 NanomediumvsStep 3.7 Flashhigh Seed-2.0-MinimediumvsStep 3.7 Flashhigh Qwen3.6 Max PreviewnonevsStep 3.7 Flashhigh Claude Opus 4.6mediumvsStep 3.7 Flashhigh Step 3.7 FlashhighvsMiMo-V2-Flashmedium Ring-2.6-1TnonevsStep 3.7 Flashhigh Ring-2.6-1TmediumvsStep 3.7 Flashhigh Claude Sonnet 4.6nonevsStep 3.7 Flashhigh DeepSeek V3.2mediumvsStep 3.7 Flashhigh