DeepSeek: DeepSeek V4 Pro vs Xiaomi: MiMo-V2-Flash
Resumo
Comparação benchmark DeepSeek V4 Pro vs MiMo-V2-Flash: DeepSeek V4 Pro lidera na pontuação média com 7.2 vs 7.1. DeepSeek V4 Pro tem menor custo de benchmark com $0.034 vs $0.043. DeepSeek V4 Pro é mais rápido com 6.41s vs 20.11s, com taxas de acerto de 52.4% vs 65.1%.
Modelo recomendado: DeepSeek V4 Pro - Tem a melhor pontuação aqui (7.2) e responde cerca de 3.1x mais rápido que MiMo-V2-Flash.
Benchmarks gerados a partir das suítes de teste do AI BENCHY em: 2026-06-18
MiMo-V2-FlashMiMo-V2-FlashmediumModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.Lançamento: 2025-12-16
Pontuação
7.2Pontuação média em todos os testes de benchmark.…
7.1Pontuação média em todos os testes de benchmark.…
Posição
#58
#62
Confiabilidade
9.9Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
10.0Pontuação de sucesso na primeira tentativa: 10.0 significa nenhum erro reexecutável da API alvo ou de limite de taxa antes de chamadas bem-sucedidas; falhas registradas reduzem a pontuação.…
Consistência
8.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
8.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
Testes corretos
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 8Não seguiu as instruções: 2Formatação extra: 1Tempo de resposta (médio)6.41sTempo de resposta (máx.)30.09sTempo de resposta (total)134.66sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.2Pontuação média em todos os testes de benchmark.…
6.1A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
16.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
2Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Formatação extra: 1Não seguiu as instruções: 1Tempo de resposta (médio)4.02sTempo de resposta (máx.)5.11sTempo de resposta (total)16.10sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.02sTempo de resposta (médio)…
540Total de tokens de entrada…
1,168Tokens de saída…
0Tokens de raciocínio…
MiMo-V2-FlashModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
8.1Pontuação média em todos os testes de benchmark.…
7.9A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
83.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 1Tempo de resposta (médio)15.85sTempo de resposta (máx.)20.83sTempo de resposta (total)47.55sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.6Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Resposta incorreta: 1Tempo de resposta (médio)13.38sTempo de resposta (máx.)30.09sTempo de resposta (total)40.15sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
13.38sTempo de resposta (médio)…
7,275Total de tokens de entrada…
5,500Tokens de saída…
0Tokens de raciocínio…
MiMo-V2-FlashModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
6.0Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
55.6%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Resposta incorreta: 1Tempo de resposta (médio)10.71sTempo de resposta (máx.)17.72sTempo de resposta (total)32.13sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
9.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)23.74sTempo de resposta (máx.)23.74sTempo de resposta (total)23.74sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
23.74sTempo de resposta (médio)…
27,529Total de tokens de entrada…
2,235Tokens de saída…
0Tokens de raciocínio…
MiMo-V2-FlashModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
9.8Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)75.68sTempo de resposta (máx.)75.68sTempo de resposta (total)75.68sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.61sTempo de resposta (máx.)6.06sTempo de resposta (total)9.23sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.61sTempo de resposta (médio)…
7,568Total de tokens de entrada…
200Tokens de saída…
0Tokens de raciocínio…
MiMo-V2-FlashModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
6.5Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
50.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0msUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.3Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
33.3%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)3.72sTempo de resposta (máx.)7.90sTempo de resposta (total)11.17sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.72sTempo de resposta (médio)…
666Total de tokens de entrada…
24Tokens de saída…
0Tokens de raciocínio…
MiMo-V2-FlashModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
5.9Pontuação média em todos os testes de benchmark.…
7.2A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
55.6%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)96.01sTempo de resposta (máx.)96.01sTempo de resposta (total)96.01sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)2.05sTempo de resposta (máx.)2.05sTempo de resposta (total)2.05sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
2.05sTempo de resposta (médio)…
471Total de tokens de entrada…
126Tokens de saída…
0Tokens de raciocínio…
MiMo-V2-FlashModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
4.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.20sTempo de resposta (máx.)4.20sTempo de resposta (total)4.20sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
6.3Pontuação média em todos os testes de benchmark.…
5.8A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
1Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)4.12sTempo de resposta (máx.)4.37sTempo de resposta (total)8.24sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
4.12sTempo de resposta (médio)…
627Total de tokens de entrada…
713Tokens de saída…
0Tokens de raciocínio…
MiMo-V2-FlashModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.28sTempo de resposta (máx.)7.37sTempo de resposta (total)8.55sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.61sTempo de resposta (máx.)5.19sTempo de resposta (total)10.83sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.61sTempo de resposta (médio)…
594Total de tokens de entrada…
442Tokens de saída…
0Tokens de raciocínio…
MiMo-V2-FlashModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
7.7Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
66.7%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.87sTempo de resposta (máx.)5.26sTempo de resposta (total)7.74sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.40sTempo de resposta (máx.)7.40sTempo de resposta (total)7.40sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
7.40sTempo de resposta (médio)…
8,105Total de tokens de entrada…
328Tokens de saída…
0Tokens de raciocínio…
MiMo-V2-FlashModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
10.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
100.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)27.78sTempo de resposta (máx.)27.78sTempo de resposta (total)27.78sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)5.76sTempo de resposta (máx.)5.76sTempo de resposta (total)5.76sUm teste é totalmente aprovado apenas quando todas as execuções passam.…
5.76sTempo de resposta (médio)…
183Total de tokens de entrada…
688Tokens de saída…
0Tokens de raciocínio…
MiMo-V2-FlashModelo arquivado: este modelo não é mais atualizado nem testado em novos testes.
3.0Pontuação média em todos os testes de benchmark.…
10.0A consistência reflete a estabilidade entre execuções (10 = muito consistente, mesmo que consistentemente errado).…
0.0%Taxa de acerto por tentativa = tentativas aprovadas / tentativas totais em todas as execuções.…
0Testes instáveis tiveram resultados mistos entre execuções (pelo menos um acerto e uma falha).…
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.96sTempo de resposta (máx.)1.96sTempo de resposta (total)1.96sUm teste é totalmente aprovado apenas quando todas as execuções passam.…