AI BENCHY Compare

Inception: Mercury 2 vs inclusionAI: Ling-2.6-flash

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-03

Métrica	Mercury 2 Mercury 2 none Lançamento: 2026-02-24	Ling-2.6-flash Ling-2.6-flash none Lançamento: 2026-04-21

Métrica	Mercury 2 Mercury 2 none Lançamento: 2026-02-24	Ling-2.6-flash Ling-2.6-flash none Lançamento: 2026-04-21
Pontuação	4.6	5.2
Posição	#153	#135
Confiabilidade	10.0	10.0
Consistência	9.1	9.2
Testes corretos
Taxa de acerto por tentativa	25.0%	33.3%
Testes instáveis	2	2
Execuções totais	60	60
Custo por resultado	0.216	0.005
Custo total	$0.009	$0.001
Preço de entrada	$0.250 / 1M	$0.010 / 1M
Preço de saída	$0.750 / 1M	$0.030 / 1M
Total de tokens de entrada	25,515	40,718
Tokens de saída	3,001	2,878
Tokens de raciocínio	0	0
Tempo de resposta (médio)	614ms	9.34s
Tempo de resposta (máx.)	1.27s	35.34s
Tempo de resposta (total)	12.28s	177.48s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	3.0	10.0	0.0%	0		483ms	631	286	0
Ling-2.6-flash	6.8	8.1	58.3%	1		11.81s	726	573	0

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	3.5	9.4	0.0%	0		831ms	4,631	1,650	0
Ling-2.6-flash	6.5	10.0	50.0%	0		11.21s	813	381	0

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	3.0	10.0	0.0%	0		606ms	4,821	131	0
Ling-2.6-flash	3.0	10.0	0.0%	0		35.34s	20,818	1,069	0

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	7.3	5.9	83.3%	1		667ms	6,362	180	0
Ling-2.6-flash	6.5	10.0	50.0%	0		8.48s	8,004	246	0

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	5.3	7.2	44.4%	1		534ms	784	46	0
Ling-2.6-flash	3.0	10.0	0.0%	0		4.95s	810	24	0

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	4.8	10.0	0.0%	0		628ms	495	159	0
Ling-2.6-flash	4.0	10.0	0.0%	0		1.45s	540	109	0

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	6.5	10.0	50.0%	0		551ms	691	82	0
Ling-2.6-flash	9.8	10.0	100.0%	0		5.52s	732	81	0

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	3.1	10.0	0.0%	0		535ms	694	251	0
Ling-2.6-flash	2.9	7.2	11.1%	1		6.51s	729	151	0

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	10.0	10.0	100.0%	0		1.27s	6,193	197	0
Ling-2.6-flash	3.0	10.0	0.0%	0		18.80s	7,324	229	0

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Mercury 2	3.0	10.0	0.0%	0		548ms	213	19	0
Ling-2.6-flash	3.0	10.0	0.0%	0		1.06s	222	15	0

Comparação rápida

Trocar par de comparação

Ling-2.6-flashnonevsElephant Alphamedium Mercury 2nonevsQwen3 Coder Nextmedium Mercury 2nonevsGLM 4.7 Flashmedium Ling-2.6-flashnonevsMistral Small 4medium Ling-2.6-flashnonevsMiniMax M2.7medium Ling-2.6-flashnonevsMiniMax M2.5medium Mercury 2nonevsQwen3.5-9Bmedium Ling-2.6-flashnonevsQwen3 Coder Nextmedium CobuddymediumvsLing-2.6-flashnone Ling-2.6-flashnonevsOwl Alphamedium Mercury 2nonevsElephant Alphamedium Ling-2.6-flashnonevsGLM 4.7 Flashmedium