AI BENCHY Compare

DeepSeek: DeepSeek V3.2 vs IBM: Granite 4.1 8B

Resumen

Comparación benchmark de DeepSeek V3.2 vs Granite 4.1 8B: DeepSeek V3.2 lidera en puntuación media con 5.3 vs 4.0. Granite 4.1 8B tiene menor coste de benchmark con $0.003 vs $0.017. Granite 4.1 8B es más rápido con 728ms vs 13.83s, con tasas de acierto de 39.7% vs 9.5%.

Modelo recomendado: Granite 4.1 8B - Ofrece el mejor equilibrio general: puntuación competitiva (4.0), menor coste que DeepSeek V3.2 y tiempo de respuesta equilibrado.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-06-12

Métrica	DeepSeek V3.2 DeepSeek V3.2 none Lanzamiento: 2025-12-01	Granite 4.1 8B Granite 4.1 8B none Lanzamiento: 2026-05-01

Métrica	DeepSeek V3.2 DeepSeek V3.2 none Lanzamiento: 2025-12-01	Granite 4.1 8B Granite 4.1 8B none Lanzamiento: 2026-05-01
Puntuación	5.3	4.0
Rango	#133	#163
Fiabilidad	10.0	10.0
Consistencia	7.6	10.0
Pruebas correctas
Tasa de aciertos por intento	39.7%	9.5%
Pruebas inestables	6	0
Ejecuciones totales	63	63
Costo por resultado	0.306	0.131
Costo total	$0.017	$0.003
Precio de entrada	$0.229 / 1M	$0.050 / 1M
Precio de salida	$0.344 / 1M	$0.100 / 1M
Total de tokens de entrada	55,997	46,285
Tokens de salida	11,165	2,911
Tokens de razonamiento	0	0
Tiempo de respuesta (promedio)	13.83s	728ms
Tiempo de respuesta (máximo)	115.89s	2.17s
Tiempo de respuesta (total)	290.43s	15.29s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#133 DeepSeek V3.2

none

Cost: $0.002
Time: 7.0s
Tokens: 1,046 tok

#163 IBM: Granite 4.1 8B

none

Cost: $0.001
Time: 3.2s
Tokens: 491 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
DeepSeek V3.2	3.2	8.0	8.3%	1		9.35s	494	1,073	0
Granite 4.1 8B	4.9	10.0	25.0%	0		844ms	645	903	0

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
DeepSeek V3.2	3.1	6.9	11.1%	1		14.54s	7,279	4,528	0
Granite 4.1 8B	4.5	10.0	0.0%	0		775ms	8,344	525	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
DeepSeek V3.2	6.5	10.0	0.0%	0		115.89s	29,843	2,887	0
Granite 4.1 8B	3.0	10.0	0.0%	0		1.88s	19,089	396	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
DeepSeek V3.2	6.3	5.8	66.7%	1		9.42s	7,890	1,710	0
Granite 4.1 8B	3.0	10.0	0.0%	0		575ms	7,617	195	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
DeepSeek V3.2	2.9	7.2	11.1%	1		4.17s	624	21	0
Granite 4.1 8B	3.0	10.0	0.0%	0		357ms	768	24	0

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
DeepSeek V3.2	4.7	1.6	66.7%	1		9.32s	314	43	0
Granite 4.1 8B	4.0	10.0	0.0%	0		499ms	528	115	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
DeepSeek V3.2	10.0	10.0	100.0%	0		1.52s	627	66	0
Granite 4.1 8B	3.6	9.9	0.0%	0		344ms	687	66	0

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
DeepSeek V3.2	7.6	7.2	77.8%	1		6.91s	424	298	0
Granite 4.1 8B	3.2	10.0	0.0%	0		608ms	672	432	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
DeepSeek V3.2	10.0	10.0	100.0%	0		11.85s	8,319	522	0
Granite 4.1 8B	10.0	10.0	100.0%	0		2.17s	7,719	243	0

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
DeepSeek V3.2	3.0	10.0	0.0%	0		17.23s	183	17	0
Granite 4.1 8B	3.0	10.0	0.0%	0		306ms	216	12	0

Comparación rápida

Cambiar par de comparación

DeepSeek V3.2nonevsMiniMax M2.7medium DeepSeek V3.2nonevsMistral Small 4medium Granite 4.1 8BnonevsQwen3.5-9Bmedium Granite 4.1 8BnonevsGLM 4.7 Flashmedium CobuddymediumvsDeepSeek V3.2none DeepSeek V3.2nonevsMiniMax M2.5medium DeepSeek V3.2nonevsQwen3 Coder Nextmedium Granite 4.1 8BnonevsQwen3 Coder Nextmedium Granite 4.1 8BnonevsMiniMax M2.5medium DeepSeek V3.2nonevsGemini 3.1 Flash Liteminimal CobuddymediumvsGranite 4.1 8Bnone DeepSeek V3.2nonevsGLM 4.7 Flashmedium