Ranking de falhas por Erro de API

Veja quais modelos de IA encontram Erro de API com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Tempo de resposta (médio) ↓.

Modelos exibidos

Falhas totais

161

Modelo mais afetado

Step 3.5 Flash 1

Categorias

Na categoria Programação45 Na categoria Combinado26 Na categoria Chamada de ferramentas17 Na categoria Análise e extração de dados14 Na categoria Truques anti-IA14 Na categoria Conhecimentos gerais13 Na categoria Inteligência geral12 Na categoria Resolução de quebra-cabeças12 Na categoria Específico do domínio7 Na categoria Seguimento de instruções1

68/68

Posição	Modelo	Empresa	Contagem de Erro de API	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#130	Step 3.5 Flash medium	Stepfun	1	6.0	$0.108	11/21	174.2s
Total de testes 21 Testes errados 10 Custo total $0.108 Tempo de resposta (médio) 174.2s
#137	North Mini Code medium	Cohere	1	5.9	$0.000	9/22	137.1s
Total de testes 22 Testes errados 13 Custo total $0.000 Tempo de resposta (médio) 137.1s
#60	LongCat 2.0 medium	Meituan	1	7.4	$0.478	12/22	136.6s
Total de testes 22 Testes errados 10 Custo total $0.478 Tempo de resposta (médio) 136.6s
#33	Kimi K3 max	Moonshot AI	2	8.0	$3.112	16/22	122.5s
Total de testes 22 Testes errados 6 Custo total $3.112 Tempo de resposta (médio) 122.5s
#119	Qwen3.5-35B-A3B medium	Qwen	1	6.2	$0.837	11/22	112.5s
Total de testes 22 Testes errados 11 Custo total $0.837 Tempo de resposta (médio) 112.5s
#91	LongCat 2.0 low	Meituan	1	6.7	$0.391	10/22	100.3s
Total de testes 22 Testes errados 12 Custo total $0.391 Tempo de resposta (médio) 100.3s
#57	Qwen3.5 Plus 2026-02-15 medium	Qwen	1	7.5	$0.437	14/22	89.2s
Total de testes 22 Testes errados 8 Custo total $0.437 Tempo de resposta (médio) 89.2s
#114	Qwen3.5-Flash medium	Qwen	1	6.2	$0.139	12/22	84.8s
Total de testes 22 Testes errados 10 Custo total $0.139 Tempo de resposta (médio) 84.8s
#52	Kimi K2.7 Code medium	Moonshot AI	1	7.5	$0.751	12/22	84.2s
Total de testes 22 Testes errados 10 Custo total $0.751 Tempo de resposta (médio) 84.2s
#204	Qwen3.5-9B medium	Qwen	1	3.8	$0.036	3/22	82.2s
Total de testes 22 Testes errados 19 Custo total $0.036 Tempo de resposta (médio) 82.2s
#46	DeepSeek V4 Pro high	DeepSeek	1	7.7	$0.200	10/22	79.1s
Total de testes 22 Testes errados 12 Custo total $0.200 Tempo de resposta (médio) 79.1s
#110	Gemma 4 31B medium	Google	2	6.3	$0.163	14/22	75.4s
Total de testes 22 Testes errados 8 Custo total $0.163 Tempo de resposta (médio) 75.4s
#108	Ring-2.6-1T medium	Inclusionai	2	6.3	$0.103	11/22	68.7s
Total de testes 22 Testes errados 11 Custo total $0.103 Tempo de resposta (médio) 68.7s
#76	DeepSeek V3.2 medium	DeepSeek	2	7.0	$0.078	11/22	68.6s
Total de testes 22 Testes errados 11 Custo total $0.078 Tempo de resposta (médio) 68.6s
#90	Qwen3.6 35B A3B medium	Qwen	2	6.7	$0.746	13/22	58.1s
Total de testes 22 Testes errados 9 Custo total $0.746 Tempo de resposta (médio) 58.1s

1 2 3 4 5

→

Falhas por Erro de API

Filtrar modelos

Melhores modelos por Contagem de Erro de API

Contagem de Erro de API vs Pontuação

Melhores modelos por Tempo de resposta (médio)