Navegação
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

xAI: Grok 4.20 Multi-Agent Beta vs Xiaomi: MiMo-V2-Omni

Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-03-21

Métrica Grok 4.20 Multi-Agent Beta Grok 4.20 Multi-Agent Beta medium Lançamento: 2026-03-12 MiMo-V2-Omni MiMo-V2-Omni none Lançamento: 2026-03-18
Pontuação 6.2 6.4
Posição #47 #43
Consistência 7.2 10.0
Testes corretos
Taxa de acerto por tentativa 54.9% 47.1%
Testes instáveis 6 0
Execuções totais 51 17
Custo por resultado 82.962 0.069
Custo total $4.978 $0.006
Preço de entrada $2.000 / 1M $0.400 / 1M
Preço de saída $6.000 / 1M $2.000 / 1M
Tokens de saída 298,948 469
Tokens de raciocínio 296,529 0
Tempo de resposta (médio) 8.64s 2.01s
Tempo de resposta (máx.) 35.28s 6.81s
Tempo de resposta (total) 129.64s 34.09s

Melhores modelos por pontuação

Pontuação vs custo total

Tempo de resposta (médio)

Pontuação vs Tempo de resposta (médio)

Total de tokens de saída

Pontuação vs Total de tokens de saída

Detalhamento por categoria

Truques anti-IA Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Grok 4.20 Multi-Agent Beta 6.9 5.8 75.0% 2 3.46s 33,706 33,077
MiMo-V2-Omni 4.8 10.0 25.0% 0 1.10s 74 0
Combinado Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Grok 4.20 Multi-Agent Beta 3.0 10.0 0.0% 0 0ms 0 0
MiMo-V2-Omni 3.0 10.0 0.0% 0 2.47s 110 0
Análise e extração de dados Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Grok 4.20 Multi-Agent Beta 10.0 10.0 100.0% 0 5.54s 25,306 25,051
MiMo-V2-Omni 10.0 10.0 100.0% 0 1.69s 83 0
Específico do domínio Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Grok 4.20 Multi-Agent Beta 2.9 7.2 11.1% 1 24.67s 164,609 163,647
MiMo-V2-Omni 5.3 10.0 33.3% 0 1.14s 8 0
Inteligência geral Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Grok 4.20 Multi-Agent Beta 5.8 2.8 66.7% 1 6.40s 15,848 15,746
MiMo-V2-Omni 4.5 10.0 0.0% 0 1.19s 37 0
Seguimento de instruções Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Grok 4.20 Multi-Agent Beta 8.3 10.0 50.0% 0 4.63s 25,457 25,322
MiMo-V2-Omni 6.5 10.0 50.0% 0 4.18s 22 0
Puzzle Solving Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Grok 4.20 Multi-Agent Beta 7.2 5.1 77.8% 2 5.01s 34,022 33,686
MiMo-V2-Omni 8.0 10.0 66.7% 0 2.71s 58 0
Chamada de ferramentas Pontuação Consistência Taxa de acerto por tentativa Testes instáveis Testes corretos Tempo de resposta (médio) Tokens de saída Tokens de raciocínio
Grok 4.20 Multi-Agent Beta 3.0 10.0 0.0% 0 0ms 0 0
MiMo-V2-Omni 10.0 10.0 100.0% 0 2.76s 77 0

Comparação rápida

Trocar par de comparação