AI BENCHY Compare

Trinity Large Preview vs xAI: Grok 4.20

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-03

Métrica	Trinity Large Preview Trinity Large Preview none Lançamento: 2026-01-27	Grok 4.20 Grok 4.20 none Lançamento: 2026-03-31

Métrica	Trinity Large Preview Trinity Large Preview none Lançamento: 2026-01-27	Grok 4.20 Grok 4.20 none Lançamento: 2026-03-31
Pontuação	4.7	5.4
Posição	#148	#127
Confiabilidade	10.0	N/D
Consistência	9.3	10.0
Testes corretos
Taxa de acerto por tentativa	23.3%	33.3%
Testes instáveis	2	0
Execuções totais	60	54
Custo por resultado	0.017	1.570
Custo total	$0.008	$0.057
Preço de entrada	$0.243 / 1M	$1.250 / 1M
Preço de saída	$0.243 / 1M	$2.500 / 1M
Total de tokens de entrada	29,828	41,313
Tokens de saída	2,169	1,923
Tokens de raciocínio	0	0
Tempo de resposta (médio)	2.98s	1.11s
Tempo de resposta (máx.)	14.34s	6.04s
Tempo de resposta (total)	56.57s	19.96s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Trinity Large Preview	3.1	10.0	0.0%	0		2.07s	651	550	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	1,986	267	0

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Trinity Large Preview	4.0	6.6	16.7%	1		14.34s	738	397	0
Grok 4.20	3.4	9.3	0.0%	0		1.22s	1,074	312	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Trinity Large Preview	3.0	10.0	0.0%	0		8.91s	12,053	294	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	17,673	282	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Trinity Large Preview	10.0	10.0	100.0%	0		3.26s	6,900	186	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	7,749	207	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Trinity Large Preview	5.3	10.0	33.3%	0		877ms	738	25	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	1,746	325	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Trinity Large Preview	4.5	10.0	0.0%	0		873ms	498	104	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	819	83	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Trinity Large Preview	3.5	10.0	0.0%	0		822ms	678	63	0
Grok 4.20	6.3	10.0	50.0%	0		445ms	1,350	60	0

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Trinity Large Preview	3.6	7.7	11.1%	1		1.97s	669	265	0
Grok 4.20	5.3	10.0	33.3%	0		473ms	1,671	198	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	6,699	267	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	7,245	189	0

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Trinity Large Preview	3.0	10.0	0.0%	0		777ms	204	18	0
Grok 4.20	-	-	-	-	-	-	-	-	-

Comparação rápida

Trocar par de comparação

Trinity Large PreviewnonevsQwen3 Coder Nextmedium MiniMax M2.7mediumvsGrok 4.20none MiniMax M2.5mediumvsGrok 4.20none Mistral Small 4mediumvsGrok 4.20none Elephant AlphamediumvsGrok 4.20none Trinity Large PreviewnonevsGLM 4.7 Flashmedium CobuddymediumvsGrok 4.20none Owl AlphamediumvsGrok 4.20none Trinity Large PreviewnonevsQwen3.5-9Bmedium gpt-oss-120bmediumDisponível grátisvsGrok 4.20none Nemotron 3 SupermediumDisponível grátisvsGrok 4.20none Trinity Large PreviewnonevsElephant Alphamedium