Qwen3.7 Plus vs Grok 4.20 (medium)

Modelo recomendado Qwen3.7 Plus

Tiene la mejor puntuación aquí (7.2) y cuesta aproximadamente 7.3x menos que Grok 4.20 (medium).

Comparación detallada

Métrica	Qwen3.7 Plus Qwen3.7 Plus none Lanzamiento: 2026-06-03	Grok 4.20 Grok 4.20 medium Lanzamiento: 2026-03-31

Métrica	Qwen3.7 Plus Qwen3.7 Plus none Lanzamiento: 2026-06-03	Grok 4.20 Grok 4.20 medium Lanzamiento: 2026-03-31
Puntuación	7.2	7.1
Rango	#81	#85
Fiabilidad	10.0	10.0
Consistencia	10.0	8.5
Pruebas correctas
Tasa de aciertos por intento	50.0%	63.6%
Pruebas inestables	0	4
Ejecuciones totales	66	66
Costo por resultado	1.014	9.709
Costo total	$0.106	$0.777
Precio de entrada	$0.320 / 1M	$1.250 / 1M
Precio de salida	$1.280 / 1M	$2.500 / 1M
Total de tokens de entrada	98,824	102,791
Tokens de salida	58,097	5,363
Tokens de razonamiento	0	253,977
Tiempo de respuesta (promedio)	12.09s	29.47s
Tiempo de respuesta (máximo)	206.03s	199.66s
Tiempo de respuesta (total)	265.89s	648.35s

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

none

medium

Categoría:

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.7 Plus	6.5	10.0	50.0%	0		1.38s	696	349	0
Grok 4.20	8.2	7.9	83.3%	1		3.95s	2,010	287	8,312

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.7 Plus	5.5	10.0	33.3%	0		2.15s	7,911	639	0
Grok 4.20	6.3	6.6	55.6%	1		109.93s	8,307	268	103,150

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.7 Plus	10.0	10.0	100.0%	0		117.70s	71,266	56,024	0
Grok 4.20	8.7	6.9	83.3%	1		42.25s	71,267	3,776	44,009

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.7 Plus	10.0	10.0	100.0%	0		1.43s	7,794	243	0
Grok 4.20	10.0	10.0	100.0%	0		4.17s	7,761	180	5,333

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.7 Plus	3.0	10.0	0.0%	0		868ms	789	18	0
Grok 4.20	5.3	10.0	33.3%	0		27.03s	1,764	375	49,339

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.7 Plus	5.3	10.0	0.0%	0		1.33s	522	78	0
Grok 4.20	3.9	2.6	33.3%	1		24.48s	825	65	6,440

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.7 Plus	6.3	10.0	50.0%	0		929ms	711	72	0
Grok 4.20	9.8	10.0	100.0%	0		4.26s	1,362	57	6,419

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.7 Plus	7.7	10.0	66.7%	0		1.71s	714	443	0
Grok 4.20	7.7	10.0	66.7%	0		6.22s	1,689	149	7,913

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.7 Plus	10.0	10.0	100.0%	0		3.54s	8,211	222	0
Grok 4.20	3.0	10.0	0.0%	0		13.68s	7,275	197	6,620

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Qwen3.7 Plus	3.0	10.0	0.0%	0		1.21s	210	9	0
Grok 4.20	3.0	10.0	0.0%	0		63.48s	531	9	16,442

Cambiar par de comparación