Navegación
AI BENCHY
Your ad here

AI BENCHY Compare

Qwen: Qwen3.5-9B vs xAI: Grok 4.20 Multi-Agent Beta

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-12

Métrica Qwen3.5-9B Qwen3.5-9B none Lanzamiento: 2026-03-02 Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Lanzamiento: 2026-03-12
Rango #60 #47
Puntaje prom. 3.4 4.9
Consistencia 10.0 7.1
Costo por resultado 0.111 97.178
Costo total $0.005 $4.859
Pruebas correctas
Tasa de aciertos por intento 25.0% 52.1%
Pruebas inestables 0 6
Ejecuciones totales 48 48
Tokens de salida 2,939 293,634
Tokens de razonamiento 0 291,260
Tiempo de respuesta (promedio) 1.06s 9.08s
Tiempo de respuesta (máximo) 5.91s 35.28s
Tiempo de respuesta (total) 16.95s 127.09s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntaje prom. vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntaje prom. vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-9B 10.0 9.9 0.0% 0 1.02s 576 0
Grok 4.20 Multi-Agent Beta 4.0 4.4 66.7% 2 3.77s 28,392 27,808
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-9B 10.0 10.0 0.0% 0 5.91s 1,255 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-9B 9.9 10.0 100.0% 0 847ms 249 0
Grok 4.20 Multi-Agent Beta 9.9 10.0 100.0% 0 5.54s 25,306 25,051
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-9B 10.0 10.0 0.0% 0 464ms 24 0
Grok 4.20 Multi-Agent Beta 10.0 7.2 11.1% 1 24.67s 164,609 163,647
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-9B 3.0 9.9 0.0% 0 552ms 99 0
Grok 4.20 Multi-Agent Beta 4.0 2.8 66.7% 1 6.40s 15,848 15,746
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-9B 5.5 10.0 50.0% 0 514ms 75 0
Grok 4.20 Multi-Agent Beta 9.0 10.0 50.0% 0 4.63s 25,457 25,322
Puzzle Solving Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-9B 10.0 9.9 0.0% 0 683ms 388 0
Grok 4.20 Multi-Agent Beta 6.3 5.1 77.8% 2 5.01s 34,022 33,686
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-9B 10.0 10.0 100.0% 0 1.27s 273 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0

Comparación rápida

Cambiar par de comparación