AI BENCHY Compare

Google: Gemini 3.5 Flash vs IBM: Granite 4.1 8B

Resumo

Comparação benchmark Gemini 3.5 Flash vs Granite 4.1 8B: Gemini 3.5 Flash lidera na pontuação média com 9.8 vs 4.0. Granite 4.1 8B tem menor custo de benchmark com $0.003 vs $1.115. Granite 4.1 8B é mais rápido com 728ms vs 8.84s, com taxas de acerto de 96.8% vs 9.5%.

Modelo recomendado: Granite 4.1 8B - Oferece o melhor compromisso geral: pontuação competitiva (4.0), custo menor que Gemini 3.5 Flash e tempo de resposta equilibrado.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-12

Métrica	Gemini 3.5 Flash Gemini 3.5 Flash high Lançamento: 2026-05-19	Granite 4.1 8B Granite 4.1 8B none Lançamento: 2026-05-01

Métrica	Gemini 3.5 Flash Gemini 3.5 Flash high Lançamento: 2026-05-19	Granite 4.1 8B Granite 4.1 8B none Lançamento: 2026-05-01
Pontuação	9.8	4.0
Posição	#1	#163
Confiabilidade	10.0	10.0
Consistência	9.6	10.0
Testes corretos
Taxa de acerto por tentativa	96.8%	9.5%
Testes instáveis	1	0
Execuções totais	63	63
Custo por resultado	5.575	0.131
Custo total	$1.115	$0.003
Preço de entrada	$1.500 / 1M	$0.050 / 1M
Preço de saída	$9.000 / 1M	$0.100 / 1M
Total de tokens de entrada	37,594	46,285
Tokens de saída	1,975	2,911
Tokens de raciocínio	115,638	0
Tempo de resposta (médio)	8.84s	728ms
Tempo de resposta (máx.)	34.82s	2.17s
Tempo de resposta (total)	185.57s	15.29s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#1 Gemini 3.5 Flash

high

Cost: $0.208
Time: 118.2s
Tokens: 23,158 tok

#163 IBM: Granite 4.1 8B

none

Cost: $0.001
Time: 3.2s
Tokens: 491 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Gemini 3.5 Flash	10.0	10.0	100.0%	0		2.57s	492	174	4,997
Granite 4.1 8B	4.9	10.0	25.0%	0		844ms	645	903	0

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Gemini 3.5 Flash	10.0	10.0	100.0%	0		22.96s	8,118	456	47,129
Granite 4.1 8B	4.5	10.0	0.0%	0		775ms	8,344	525	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Gemini 3.5 Flash	10.0	10.0	100.0%	0		22.37s	12,873	351	16,323
Granite 4.1 8B	3.0	10.0	0.0%	0		1.88s	19,089	396	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Gemini 3.5 Flash	10.0	10.0	100.0%	0		6.43s	7,548	279	8,466
Granite 4.1 8B	3.0	10.0	0.0%	0		575ms	7,617	195	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Gemini 3.5 Flash	7.6	7.2	77.8%	1		14.09s	633	12	24,721
Granite 4.1 8B	3.0	10.0	0.0%	0		357ms	768	24	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.63s	486	115	1,650
Granite 4.1 8B	4.0	10.0	0.0%	0		499ms	528	115	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.35s	615	70	3,799
Granite 4.1 8B	3.6	9.9	0.0%	0		344ms	687	66	0

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.23s	558	241	4,940
Granite 4.1 8B	3.2	10.0	0.0%	0		608ms	672	432	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Gemini 3.5 Flash	9.8	10.0	100.0%	0		4.96s	6,115	265	1,608
Granite 4.1 8B	10.0	10.0	100.0%	0		2.17s	7,719	243	0

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Gemini 3.5 Flash	10.0	10.0	100.0%	0		3.94s	156	12	2,005
Granite 4.1 8B	3.0	10.0	0.0%	0		306ms	216	12	0

Comparação rápida

Trocar par de comparação

Granite 4.1 8BnonevsQwen3.5-9Bmedium Granite 4.1 8BnonevsGLM 4.7 Flashmedium Gemini 3.5 FlashhighvsQwen3.7 Maxmedium Gemini 3.5 FlashhighvsGPT-5.5low Claude Fable 5mediumvsGemini 3.5 Flashhigh Granite 4.1 8BnonevsQwen3 Coder Nextmedium Granite 4.1 8BnonevsMiniMax M2.5medium Gemini 3.5 FlashhighvsGPT-5.5medium Gemini 3.5 FlashhighvsGPT-5.3-Codexmedium CobuddymediumvsGranite 4.1 8Bnone Gemini 3.5 FlashhighvsQwen3.6 Max Previewmedium Claude Opus 4.8mediumvsGemini 3.5 Flashhigh