AI BENCHY Compare

Nemotron 3 Ultra 550b A55b vs xAI: Grok Build 0.1

Resumen

Comparación benchmark de Nemotron 3 Ultra 550b A55b vs Grok Build 0.1: Nemotron 3 Ultra 550b A55b lidera en puntuación media con 8.1 vs 7.6. Nemotron 3 Ultra 550b A55b tiene menor coste de benchmark con $0.158 vs $0.927. Nemotron 3 Ultra 550b A55b es más rápido con 15.05s vs 49.90s, con tasas de acierto de 69.8% vs 61.9%.

Modelo recomendado: Nemotron 3 Ultra 550b A55b - Tiene la mejor puntuación aquí (8.1) y cuesta aproximadamente 5.9x menos que Grok Build 0.1.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-07-02

Métrica	Nemotron 3 Ultra 550b A55b Nemotron 3 Ultra 550b A55b medium Lanzamiento: 2026-06-04 Disponible gratis	Grok Build 0.1 Grok Build 0.1 medium Lanzamiento: 2026-05-21

Métrica	Nemotron 3 Ultra 550b A55b Nemotron 3 Ultra 550b A55b medium Lanzamiento: 2026-06-04 Disponible gratis	Grok Build 0.1 Grok Build 0.1 medium Lanzamiento: 2026-05-21
Puntuación	8.1	7.6
Rango	#26	#44
Fiabilidad	9.7	10.0
Consistencia	8.8	9.9
Pruebas correctas
Tasa de aciertos por intento	69.8%	61.9%
Pruebas inestables	3	0
Ejecuciones totales	63	63
Costo por resultado	0.000	7.124
Costo total	$0.158	$0.927
Precio de entrada	$0.500 / 1M	$1.000 / 1M
Precio de salida	$2.200 / 1M	$2.000 / 1M
Total de tokens de entrada	46,813	44,418
Tokens de salida	18,002	2,782
Tokens de razonamiento	53,091	438,018
Tiempo de respuesta (promedio)	15.05s	49.90s
Tiempo de respuesta (máximo)	43.93s	252.69s
Tiempo de respuesta (total)	316.09s	1047.92s

Generación showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#26 Nemotron 3 Ultra 550b A55b

medium

SVG inválido

Coste: $0.000
Tiempo: 300.0s
Tokens: 0 tok

#44 xAI: Grok Build 0.1

medium

Coste: $0.028
Tiempo: 81.3s
Tokens: 14,009 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Nemotron 3 Ultra 550b A55b	10.0	10.0	100.0%	0		8.62s	780	835	1,485
Grok Build 0.1	8.3	10.0	75.0%	0		7.43s	2,010	220	12,162

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Nemotron 3 Ultra 550b A55b	8.4	7.4	88.9%	1		26.53s	7,686	2,854	17,725
Grok Build 0.1	5.7	9.7	33.3%	0		108.46s	8,304	1,138	161,452

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Nemotron 3 Ultra 550b A55b	9.8	10.0	100.0%	0		43.93s	17,574	1,040	3,590
Grok Build 0.1	10.0	10.0	100.0%	0		32.81s	12,909	231	16,917

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Nemotron 3 Ultra 550b A55b	10.0	10.0	100.0%	0		5.68s	7,989	473	1,285
Grok Build 0.1	10.0	10.0	100.0%	0		10.72s	7,761	180	8,876

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Nemotron 3 Ultra 550b A55b	3.5	4.4	33.3%	2		24.90s	858	11,169	16,249
Grok Build 0.1	5.3	10.0	33.3%	0		158.00s	1,764	492	175,294

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Nemotron 3 Ultra 550b A55b	3.7	9.5	0.0%	0		2.52s	360	70	235
Grok Build 0.1	4.4	9.9	0.0%	0		18.41s	825	76	6,345

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Nemotron 3 Ultra 550b A55b	9.8	10.0	100.0%	0		6.35s	765	182	1,243
Grok Build 0.1	9.8	10.0	100.0%	0		12.36s	1,362	57	9,599

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Nemotron 3 Ultra 550b A55b	5.5	9.9	33.3%	0		3.54s	792	771	2,055
Grok Build 0.1	7.7	10.0	66.7%	0		18.26s	1,689	195	20,841

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Nemotron 3 Ultra 550b A55b	10.0	10.0	100.0%	0		7.72s	9,781	304	984
Grok Build 0.1	10.0	10.0	100.0%	0		13.12s	7,263	180	4,969

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Nemotron 3 Ultra 550b A55b	3.0	10.0	0.0%	0		38.47s	228	304	8,240
Grok Build 0.1	3.0	10.0	0.0%	0		53.51s	531	13	21,563

Comparación rápida

Cambiar par de comparación