Navegação
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

LongCat 2.0 (medium) vs Qwen3.8 2.4T A95B (high)

A pontuação média está praticamente empatada em 7.4 vs 7.4. LongCat 2.0 (medium) tem menor custo de benchmark com $0.499 vs $2.357. Qwen3.8 2.4T A95B (high) é mais rápido com 120.59s vs 143.55s, com taxas de acerto de 59.1% vs 74.2%.

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-09-24

Modelos comparados

Posição
#132
Total de tokens de saída
390,873
Tempo de resposta (médio)
143.55s
Custo total
$0.499
Posição
#133
Total de tokens de saída
456,028
Tempo de resposta (médio)
120.59s
Custo total
$2.357
Modelo recomendado LongCat 2.0 (medium)

Tem a melhor pontuação aqui (7.4) e custa cerca de 4.7x menos que Qwen3.8 2.4T A95B (high).

Comparação detalhada

Métrica LongCat 2.0 LongCat 2.0 medium Lançamento: 2026-07-20 Qwen3.8 2.4T A95B Qwen3.8 2.4T A95B high Lançamento: 2026-08-12
Pontuação 7.4 7.4
Posição #132 #133
Confiabilidade 10.0 9.4
Consistência 9.3 8.3
Tentativas 66/66 66/66
Testes corretos
Taxa de acerto por tentativa 59.1% 74.2%
Testes instáveis 2 4
Execuções totais 66 66
Custo por resultado 4.153 16.832
Custo total $0.499 $2.357
Preço de entrada $0.300 / 1M $2.000 / 1M
Preço de saída $1.200 / 1M $6.000 / 1M
Total de tokens de entrada 97,324 108,931
Tokens de saída 44,383 112,801
Tokens de raciocínio 346,490 343,227
Tempo de resposta (médio) 143.55s 120.59s
Tempo de resposta (máx.) 939.52s 532.28s
Tempo de resposta (total) 3158.11s 2653.05s
Parâmetros 1.6T no total (48B ativos) 2.4T no total (95B ativos)
Disponibilidade Código aberto Pesos disponíveis

Geração showcase de modelos

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#132 LongCat 2.0

medium
Custo
$0.016
Tempo
285.1s
Tokens
13,057 tok

#133 Qwen3.8 2.4T A95B

high
Reached the allocated time limit (600 seconds) without receiving showcase output.
Custo
$0.000
Tempo
600.0s
Tokens
0 tok

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Programação Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de entrada Tokens de saída Tokens de raciocínio
LongCat 2.0 10.0 10.0 100.0% 0 455.00s 7,419 533 214,143
Qwen3.8 2.4T A95B 5.9 6.3 55.6% 1 160.52s 6,399 3,310 48,078

Comparação rápida

Trocar par de comparação