Comparar Gráficos Metodología

Idioma:

❤️ Made by XCS

AI BENCHY Compare

Inception: Mercury 2 vs xAI: Grok 4.1 Fast

Comparar:

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-06

Métrica	Inception: Mercury 2 none Lanzamiento: 2026-02-24	xAI: Grok 4.1 Fast medium Lanzamiento: 2025-11-19
Puntaje prom.	3.4	6.4
Rango	#50	#28
Pruebas correctas
Consistencia	8.9	7.8
Costo por resultado	0.147	0.541
Costo total	$0.006	$0.049
Tasa de aciertos por intento	33.3%	71.1%
Pruebas inestables	2	4
common.totalRuns	45 (15 x 3)	45 (15 x 3)
Tokens de salida	1,144	1,056
Tokens de razonamiento	0	80,419
Tiempo de respuesta (promedio)	594ms	27.61s
Tiempo de respuesta (máximo)	1.27s	121.79s
Tiempo de respuesta (total)	8.91s	220.87s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntaje prom. vs Tiempo de respuesta (promedio)

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Inception: Mercury 2	10.0	10.0	0.0%	0		466ms	274	0
xAI: Grok 4.1 Fast	10.0	10.0	100.0%	0		5.65s	102	4,021

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Inception: Mercury 2	10.0	10.0	0.0%	0		606ms	131	0
xAI: Grok 4.1 Fast	10.0	10.0	100.0%	0		37.64s	261	12,272

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Inception: Mercury 2	5.5	5.9	83.3%	1		667ms	180	0
xAI: Grok 4.1 Fast	9.9	10.0	100.0%	0		6.63s	180	5,409

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Inception: Mercury 2	4.0	7.2	44.4%	1		534ms	46	0
xAI: Grok 4.1 Fast	4.0	4.4	66.7%	2		121.79s	11	37,657

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Inception: Mercury 2	5.5	10.0	50.0%	0		551ms	82	0
xAI: Grok 4.1 Fast	5.5	10.0	50.0%	0		5.30s	55	3,489

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Inception: Mercury 2	10.0	10.0	0.0%	0		533ms	234	0
xAI: Grok 4.1 Fast	4.0	7.2	44.4%	1		8.08s	187	6,086

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
Inception: Mercury 2	10.0	10.0	100.0%	0		1.27s	197	0
xAI: Grok 4.1 Fast	10.0	1.6	33.3%	1		27.71s	260	11,485

Comparación rápida

Cambiar par de comparación

Qwen3.5 Plus 2026-02-15nonevsGrok 4.1 Fastmedium Mercury 2nonevsQwen3 Coder Nextmedium Mercury 2nonevsGLM 4.7 Flashmedium Claude Sonnet 4.6nonevsGrok 4.1 Fastmedium Gemini 3 Flash PreviewnonevsGrok 4.1 Fastmedium Grok 4.1 FastmediumvsGLM 5none Gemini 3.1 Flash Lite PreviewnonevsGrok 4.1 Fastmedium GPT-5.3 ChatnonevsGrok 4.1 Fastmedium Gemini 3.1 Flash Lite PreviewlowvsGrok 4.1 Fastmedium Gemini 2.5 FlashnonevsGrok 4.1 Fastmedium DeepSeek V3.2nonevsGrok 4.1 Fastmedium GPT-5.2 ChatnonevsGrok 4.1 Fastmedium