AI BENCHY Compare

StepFun: Step 3.7 Flash vs xAI: Grok 4.3

Resumo

Comparação benchmark Step 3.7 Flash vs Grok 4.3: Grok 4.3 lidera na pontuação média com 7.7 vs 7.1. Grok 4.3 tem menor custo de benchmark com $0.614 vs $1.148. Grok 4.3 é mais rápido com 47.51s vs 64.46s, com taxas de acerto de 63.5% vs 71.4%.

Modelo recomendado: Grok 4.3 - Tem a melhor pontuação aqui (7.7) e custa cerca de 1.9x menos que Step 3.7 Flash.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-12

Métrica	Step 3.7 Flash Step 3.7 Flash high Lançamento: 2026-05-29	Grok 4.3 Grok 4.3 medium Lançamento: 2026-05-01

Métrica	Step 3.7 Flash Step 3.7 Flash high Lançamento: 2026-05-29	Grok 4.3 Grok 4.3 medium Lançamento: 2026-05-01
Pontuação	7.1	7.7
Posição	#63	#40
Confiabilidade	10.0	10.0
Consistência	8.2	8.5
Testes corretos
Taxa de acerto por tentativa	63.5%	71.4%
Testes instáveis	4	4
Execuções totais	63	63
Custo por resultado	10.434	4.724
Custo total	$1.148	$0.614
Preço de entrada	$0.200 / 1M	$1.250 / 1M
Preço de saída	$1.150 / 1M	$2.500 / 1M
Total de tokens de entrada	38,391	44,472
Tokens de saída	991,355	1,981
Tokens de raciocínio	0	221,382
Tempo de resposta (médio)	64.46s	47.51s
Tempo de resposta (máx.)	364.99s	216.69s
Tempo de resposta (total)	1353.57s	997.68s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#63 Step 3.7 Flash

high

Cost: $0.007
Time: 63.6s
Tokens: 6,030 tok

#40 xAI: Grok 4.3

medium

Cost: $0.009
Time: 19.0s
Tokens: 3,661 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Step 3.7 Flash	10.0	10.0	100.0%	0		13.40s	696	42,656	0
Grok 4.3	10.0	10.0	100.0%	0		8.83s	2,010	88	8,207

Programação	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Step 3.7 Flash	4.0	6.0	22.2%	1		206.21s	6,057	327,340	0
Grok 4.3	5.9	7.7	44.4%	1		41.23s	8,340	1,028	31,226

Combinado	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Step 3.7 Flash	10.0	10.0	100.0%	0		13.01s	13,638	8,802	0
Grok 4.3	10.0	10.0	100.0%	0		63.99s	12,909	234	15,301

Análise e extração de dados	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Step 3.7 Flash	10.0	10.0	100.0%	0		14.72s	7,368	23,113	0
Grok 4.3	10.0	10.0	100.0%	0		18.97s	7,761	180	9,546

Específico do domínio	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Step 3.7 Flash	4.1	4.4	44.5%	2		149.64s	783	410,502	0
Grok 4.3	5.3	7.2	44.4%	1		181.74s	1,764	14	111,300

Inteligência geral	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Step 3.7 Flash	5.5	10.0	0.0%	0		4.17s	510	2,862	0
Grok 4.3	5.4	2.5	66.7%	1		24.70s	825	70	5,020

Seguimento de instruções	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Step 3.7 Flash	9.8	10.0	100.0%	0		1.52s	705	2,010	0
Grok 4.3	9.8	10.0	100.0%	0		18.58s	1,362	57	8,713

Resolução de quebra-cabeças	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Step 3.7 Flash	5.3	7.2	44.4%	1		10.22s	711	25,422	0
Grok 4.3	5.9	7.2	55.6%	1		22.52s	1,689	128	14,468

Chamada de ferramentas	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Step 3.7 Flash	10.0	10.0	100.0%	0		2.79s	7,701	1,172	0
Grok 4.3	10.0	10.0	100.0%	0		17.66s	7,263	168	4,615

Conhecimentos gerais	Pontuação	Consistência	Taxa de acerto por tentativa	Testes instáveis	Testes corretos	Tempo de resposta (médio)	Tokens de entrada	Tokens de saída	Tokens de raciocínio
Step 3.7 Flash	3.0	10.0	0.0%	0		149.34s	222	147,476	0
Grok 4.3	3.0	10.0	0.0%	0		44.47s	549	14	12,986

Comparação rápida

Trocar par de comparação

Step 3.7 FlashhighvsGLM 5.1medium Step 3.7 FlashhighvsMiMo-V2-Flashmedium Step 3.7 FlashlowvsGrok 4.3medium Qwen3.7 PlusnonevsStep 3.7 Flashhigh Kimi K2.7 CodemediumvsStep 3.7 Flashhigh Gemma 4 26B A4BmediumDisponível grátisvsStep 3.7 Flashhigh Gemini 3.5 FlashnonevsStep 3.7 Flashhigh Claude Opus 4.8nonevsStep 3.7 Flashhigh Step 3.7 FlashhighvsGLM 5V Turbomedium Gemini 3 Flash PreviewnonevsStep 3.7 Flashhigh GPT-5.3 ChatnonevsGrok 4.3medium Claude Sonnet 4.6nonevsStep 3.7 Flashhigh