Navegación
AI BENCHY
Your ad here

AI BENCHY Compare

Qwen: Qwen3.5-27B vs xAI: Grok 4.20 Multi-Agent Beta

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-12

Métrica Qwen3.5-27B Qwen3.5-27B none Lanzamiento: 2026-02-24 Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Lanzamiento: 2026-03-12
Rango #46 #47
Puntaje prom. 4.9 4.9
Consistencia 9.1 7.1
Costo por resultado 0.302 97.178
Costo total $0.016 $4.859
Pruebas correctas
Tasa de aciertos por intento 37.5% 52.1%
Pruebas inestables 2 6
Ejecuciones totales 48 48
Tokens de salida 3,161 293,634
Tokens de razonamiento 0 291,260
Tiempo de respuesta (promedio) 1.75s 9.08s
Tiempo de respuesta (máximo) 9.39s 35.28s
Tiempo de respuesta (total) 28.05s 127.09s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntaje prom. vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntaje prom. vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-27B 4.0 10.0 33.3% 0 796ms 264 0
Grok 4.20 Multi-Agent Beta 4.0 4.4 66.7% 2 3.77s 28,392 27,808
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-27B 10.0 1.6 33.3% 1 9.39s 1,461 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-27B 9.9 10.0 100.0% 0 1.43s 243 0
Grok 4.20 Multi-Agent Beta 9.9 10.0 100.0% 0 5.54s 25,306 25,051
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-27B 10.0 10.0 0.0% 0 540ms 15 0
Grok 4.20 Multi-Agent Beta 10.0 7.2 11.1% 1 24.67s 164,609 163,647
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-27B 5.0 10.0 0.0% 0 2.51s 126 0
Grok 4.20 Multi-Agent Beta 4.0 2.8 66.7% 1 6.40s 15,848 15,746
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-27B 4.5 10.0 0.0% 0 815ms 69 0
Grok 4.20 Multi-Agent Beta 9.0 10.0 50.0% 0 4.63s 25,457 25,322
Puzzle Solving Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-27B 6.3 7.9 55.6% 1 1.37s 680 0
Grok 4.20 Multi-Agent Beta 6.3 5.1 77.8% 2 5.01s 34,022 33,686
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
Qwen3.5-27B 10.0 10.0 100.0% 0 3.54s 303 0
Grok 4.20 Multi-Agent Beta 10.0 10.0 0.0% 0 0ms 0 0

Comparación rápida

Cambiar par de comparación