Ranking de falhas por Tempo esgotado

Veja quais modelos de IA encontram Tempo esgotado com mais frequência para identificar riscos de confiabilidade antes de escolher. Ordenar por: Tempo de resposta (médio) ↓.

Modelos exibidos

Falhas totais

Modelo mais afetado

Step 3.5 Flash 1

Categorias

Na categoria Específico do domínio43 Na categoria Programação26 Na categoria Combinado5 Na categoria Resolução de quebra-cabeças5 Na categoria Inteligência geral4 Na categoria Truques anti-IA4 Na categoria Análise e extração de dados1 Na categoria Seguimento de instruções1

44/44

Posição	Modelo	Empresa	Contagem de Tempo esgotado	Pontuação	Custo total	Testes corretos	Tempo de resposta (médio)
#130	Step 3.5 Flash medium	Stepfun	1	6.0	$0.108	11/21	174.2s
Total de testes 21 Testes errados 10 Custo total $0.108 Tempo de resposta (médio) 174.2s
#97	LongCat 2.0 high	Meituan	3	6.6	$0.469	9/22	148.7s
Total de testes 22 Testes errados 13 Custo total $0.469 Tempo de resposta (médio) 148.7s
#194	GLM 4.7 Flash medium	Z.ai	2	4.3	$0.166	4/22	142.6s
Total de testes 22 Testes errados 18 Custo total $0.166 Tempo de resposta (médio) 142.6s
#60	LongCat 2.0 medium	Meituan	1	7.4	$0.478	12/22	136.6s
Total de testes 22 Testes errados 10 Custo total $0.478 Tempo de resposta (médio) 136.6s
#33	Kimi K3 max	Moonshot AI	2	8.0	$3.112	16/22	122.5s
Total de testes 22 Testes errados 6 Custo total $3.112 Tempo de resposta (médio) 122.5s
#119	Qwen3.5-35B-A3B medium	Qwen	5	6.2	$0.837	11/22	112.5s
Total de testes 22 Testes errados 11 Custo total $0.837 Tempo de resposta (médio) 112.5s
#58	Qwen3.5-27B medium	Qwen	1	7.4	$1.627	13/22	111.9s
Total de testes 22 Testes errados 9 Custo total $1.627 Tempo de resposta (médio) 111.9s
#68	Kimi K2.6 medium	Moonshot AI	3	7.2	$1.036	12/22	110.0s
Total de testes 22 Testes errados 10 Custo total $1.036 Tempo de resposta (médio) 110.0s
#95	Gemma 4 26B A4B medium	Google	2	6.6	$0.089	14/22	103.8s
Total de testes 22 Testes errados 8 Custo total $0.089 Tempo de resposta (médio) 103.8s
#91	LongCat 2.0 low	Meituan	1	6.7	$0.391	10/22	100.3s
Total de testes 22 Testes errados 12 Custo total $0.391 Tempo de resposta (médio) 100.3s
#77	Kimi K2.5 medium	Moonshot AI	2	7.0	$0.600	10/22	99.0s
Total de testes 22 Testes errados 12 Custo total $0.600 Tempo de resposta (médio) 99.0s
#80	Seed-2.0-Mini medium	Bytedance Seed	5	7.0	$0.101	11/22	92.5s
Total de testes 22 Testes errados 11 Custo total $0.101 Tempo de resposta (médio) 92.5s
#57	Qwen3.5 Plus 2026-02-15 medium	Qwen	2	7.5	$0.437	14/22	89.2s
Total de testes 22 Testes errados 8 Custo total $0.437 Tempo de resposta (médio) 89.2s
#114	Qwen3.5-Flash medium	Qwen	3	6.2	$0.139	12/22	84.8s
Total de testes 22 Testes errados 10 Custo total $0.139 Tempo de resposta (médio) 84.8s
#52	Kimi K2.7 Code medium	Moonshot AI	3	7.5	$0.751	12/22	84.2s
Total de testes 22 Testes errados 10 Custo total $0.751 Tempo de resposta (médio) 84.2s

Falhas por Tempo esgotado

Filtrar modelos

Melhores modelos por Contagem de Tempo esgotado

Contagem de Tempo esgotado vs Pontuação

Melhores modelos por Tempo de resposta (médio)