AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Google: Gemma 4 26B A4B

Resumen

Comparación benchmark de Claude Opus 4.8 vs Gemma 4 26B A4B: Claude Opus 4.8 lidera en puntuación media con 7.7 vs 7.2. Gemma 4 26B A4B tiene menor coste de benchmark con $0.045 vs $1.270. Claude Opus 4.8 es más rápido con 10.83s vs 63.41s, con tasas de acierto de 79.4% vs 69.8%.

Modelo recomendado: Gemma 4 26B A4B - Su puntuación se mantiene cerca de la mejor aquí (7.2 vs 7.7) y cuesta aproximadamente 28.9x menos que Claude Opus 4.8.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-07-02

Métrica	Claude Opus 4.8 Claude Opus 4.8 low Lanzamiento: 2026-05-28	Gemma 4 26B A4B Gemma 4 26B A4B medium Lanzamiento: 2026-04-03 Disponible gratis

Métrica	Claude Opus 4.8 Claude Opus 4.8 low Lanzamiento: 2026-05-28	Gemma 4 26B A4B Gemma 4 26B A4B medium Lanzamiento: 2026-04-03 Disponible gratis
Puntuación	7.7	7.2
Rango	#38	#61
Fiabilidad	10.0	10.0
Consistencia	8.8	9.2
Pruebas correctas
Tasa de aciertos por intento	79.4%	69.8%
Pruebas inestables	3	2
Ejecuciones totales	63	63
Costo por resultado	8.466	0.361
Costo total	$1.270	$0.045
Precio de entrada	$5.000 / 1M	$0.060 / 1M
Precio de salida	$25.000 / 1M	$0.330 / 1M
Total de tokens de entrada	60,946	40,252
Tokens de salida	31,771	28,000
Tokens de razonamiento	6,831	100,490
Tiempo de respuesta (promedio)	10.83s	63.41s
Tiempo de respuesta (máximo)	127.97s	369.32s
Tiempo de respuesta (total)	227.39s	1268.28s

Generación showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low

Coste: $0.031
Tiempo: 14.1s
Tokens: 1,345 tok

#61 Gemma 4 26B A4B

medium

SVG inválido

Coste: $0.000
Tiempo: 300.0s
Tokens: 0 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	10.0	10.0	100.0%	0		3.30s	834	793	371
Gemma 4 26B A4B	10.0	10.0	100.0%	0		6.20s	816	1,142	3,045

Programación	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	6.6	4.6	77.8%	2		7.58s	10,590	3,637	809
Gemma 4 26B A4B	2.9	10.0	0.0%	0		272.54s	5,062	14,838	44,567

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	9.8	10.0	100.0%	0		20.84s	23,500	2,216	1,081
Gemma 4 26B A4B	9.6	10.0	100.0%	0		73.55s	17,092	5,415	13,112

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	6.3	5.8	66.7%	1		2.27s	10,503	310	0
Gemma 4 26B A4B	10.0	10.0	100.0%	0		16.51s	8,334	1,567	2,827

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	5.3	10.0	33.3%	0		45.53s	975	23,311	3,908
Gemma 4 26B A4B	2.9	4.4	22.2%	2		23.62s	516	2,469	7,105

Inteligencia general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	10.0	10.0	100.0%	0		2.55s	708	231	0
Gemma 4 26B A4B	10.0	10.0	100.0%	0		29.76s	567	25	5,075

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	9.8	10.0	100.0%	0		2.78s	909	111	221
Gemma 4 26B A4B	10.0	10.0	100.0%	0		17.54s	777	887	4,470

Resolución de acertijos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	10.0	10.0	100.0%	0		3.01s	894	592	184
Gemma 4 26B A4B	10.0	10.0	100.0%	0		5.79s	801	410	2,128

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	10.0	10.0	100.0%	0		6.85s	11,775	370	35
Gemma 4 26B A4B	10.0	10.0	100.0%	0		9.01s	6,096	450	1,256

Cultura general	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de entrada	Tokens de salida	Tokens de razonamiento
Claude Opus 4.8	3.0	10.0	0.0%	0		5.48s	258	200	222
Gemma 4 26B A4B	3.0	10.0	0.0%	0		180.87s	191	797	16,905

Comparación rápida

Cambiar par de comparación

Claude Opus 4.8lowvsQwen3.5-122B-A10Bmedium Gemma 4 26B A4BmediumDisponible gratisvsQwen3.7 Plusnone DeepSeek V4 PrononevsGemma 4 26B A4BmediumDisponible gratis Claude Opus 4.8lowvsKimi K2.6mediumDisponible gratis Claude Opus 4.8lowvsGrok 4.3medium Claude Opus 4.8lowvsGemini 3.1 Flash Litemedium Claude Opus 4.8lowvsQwen3.5 Plus 2026-04-20medium Gemma 4 26B A4BmediumDisponible gratisvsGLM 5.2none Claude Opus 4.8lowvsGemini 3.1 Flash Lite Previewmedium Claude Opus 4.8nonevsGemma 4 26B A4BmediumDisponible gratis Gemma 4 26B A4BmediumDisponible gratisvsStep 3.7 Flashhigh Claude Opus 4.8lowvsQwen3.6 Plusmedium