Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)12.11sTempo de resposta (máx.)82.37sTempo de resposta (total)217.93s…
Total de testes: 18Testes errados: 0Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 100.0%Testes instáveis: 0…Tokens de saída: 655Tokens de raciocínio: 33,749Tempo de resposta: médio 12.11s · total 217.93s · máx. 82.37s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.26sTempo de resposta (máx.)5.01sTempo de resposta (total)13.04s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)82.37sTempo de resposta (máx.)82.37sTempo de resposta (total)82.37s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)23.58sTempo de resposta (máx.)23.58sTempo de resposta (total)23.58s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.62sTempo de resposta (máx.)8.37sTempo de resposta (total)15.24s
Específico do domínio
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)14.81sTempo de resposta (máx.)32.44sTempo de resposta (total)44.43s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.34sTempo de resposta (máx.)6.34sTempo de resposta (total)6.34s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.30sTempo de resposta (máx.)5.19sTempo de resposta (total)8.59s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.86sTempo de resposta (máx.)7.59sTempo de resposta (total)14.57s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.78sTempo de resposta (máx.)9.78sTempo de resposta (total)9.78s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)15.96sTempo de resposta (máx.)40.61sTempo de resposta (total)175.52s…
Total de testes: 18Testes errados: 1Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 94.4%Testes instáveis: 0…Tokens de saída: 1,932Tokens de raciocínio: 40,542Tempo de resposta: médio 15.96s · total 175.52s · máx. 40.61s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.90sTempo de resposta (máx.)9.52sTempo de resposta (total)15.80s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)19.88sTempo de resposta (máx.)19.88sTempo de resposta (total)19.88s
Combinado
: 9.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)40.61sTempo de resposta (máx.)40.61sTempo de resposta (total)40.61s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.72sTempo de resposta (máx.)7.72sTempo de resposta (total)7.72s
Específico do domínio
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)32.73sTempo de resposta (máx.)32.73sTempo de resposta (total)32.73s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)11.77sTempo de resposta (máx.)11.77sTempo de resposta (total)11.77s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.56sTempo de resposta (máx.)9.56sTempo de resposta (total)9.56s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.15sTempo de resposta (máx.)8.49sTempo de resposta (total)14.30s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)23.15sTempo de resposta (máx.)23.15sTempo de resposta (total)23.15s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Resposta incorreta: 1Tempo de resposta (médio)3.53sTempo de resposta (máx.)21.45sTempo de resposta (total)60.03s…
Total de testes: 18Testes errados: 2Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 88.9%Testes instáveis: 0…Tokens de saída: 5,375Tokens de raciocínio: 1,341Tempo de resposta: médio 3.53s · total 60.03s · máx. 21.45s
Truques anti-IA
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.85sTempo de resposta (máx.)2.71sTempo de resposta (total)7.38s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.41sTempo de resposta (máx.)6.41sTempo de resposta (total)6.41s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)21.45sTempo de resposta (máx.)21.45sTempo de resposta (total)21.45s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.37sTempo de resposta (máx.)3.30sTempo de resposta (total)4.74s
Específico do domínio
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Tempo de resposta (médio)1.17sTempo de resposta (máx.)1.40sTempo de resposta (total)2.35s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.87sTempo de resposta (máx.)2.87sTempo de resposta (total)2.87s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.57sTempo de resposta (máx.)1.66sTempo de resposta (total)3.14s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.51sTempo de resposta (máx.)2.89sTempo de resposta (total)7.54s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.17sTempo de resposta (máx.)4.17sTempo de resposta (total)4.17s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)3.13sTempo de resposta (máx.)18.27sTempo de resposta (total)56.33s…
Total de testes: 18Testes errados: 2Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 88.9%Testes instáveis: 0…Tokens de saída: 6,326Tokens de raciocínio: 0Tempo de resposta: médio 3.13s · total 56.33s · máx. 18.27s
Truques anti-IA
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)2.12sTempo de resposta (máx.)3.75sTempo de resposta (total)8.50s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.84sTempo de resposta (máx.)2.84sTempo de resposta (total)2.84s
Combinado
: 9.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)18.27sTempo de resposta (máx.)18.27sTempo de resposta (total)18.27s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.15sTempo de resposta (máx.)2.33sTempo de resposta (total)4.29s
Específico do domínio
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.19sTempo de resposta (máx.)1.40sTempo de resposta (total)3.58s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.47sTempo de resposta (máx.)3.47sTempo de resposta (total)3.47s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.46sTempo de resposta (máx.)1.68sTempo de resposta (total)2.91s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.58sTempo de resposta (máx.)4.07sTempo de resposta (total)7.73s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.74sTempo de resposta (máx.)4.74sTempo de resposta (total)4.74s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Não seguiu as instruções: 1Tempo de resposta (médio)32.75sTempo de resposta (máx.)332.10sTempo de resposta (total)589.59s…
Total de testes: 18Testes errados: 3Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 87.0%Testes instáveis: 2…Tokens de saída: 1,920Tokens de raciocínio: 89,632Tempo de resposta: médio 32.75s · total 589.59s · máx. 332.10s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.66sTempo de resposta (máx.)6.74sTempo de resposta (total)18.65s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.09sTempo de resposta (máx.)9.09sTempo de resposta (total)9.09s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)19.29sTempo de resposta (máx.)19.29sTempo de resposta (total)19.29s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.18sTempo de resposta (máx.)4.35sTempo de resposta (total)8.36s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)164.14sTempo de resposta (máx.)332.10sTempo de resposta (total)492.41s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.16sTempo de resposta (máx.)4.16sTempo de resposta (total)4.16s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.36sTempo de resposta (máx.)3.46sTempo de resposta (total)6.73s
Resolução de quebra-cabeças
: 8.6 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)6.78sTempo de resposta (máx.)10.54sTempo de resposta (total)20.33s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)10.57sTempo de resposta (máx.)10.57sTempo de resposta (total)10.57s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)6.01sTempo de resposta (máx.)14.72sTempo de resposta (total)108.12s…
Total de testes: 18Testes errados: 3Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 85.2%Testes instáveis: 1…Tokens de saída: 2,018Tokens de raciocínio: 23,273Tempo de resposta: médio 6.01s · total 108.12s · máx. 14.72s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.48sTempo de resposta (máx.)4.31sTempo de resposta (total)13.94s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.94sTempo de resposta (máx.)6.94sTempo de resposta (total)6.94s
Combinado
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.27sTempo de resposta (máx.)3.27sTempo de resposta (total)3.27s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.40sTempo de resposta (máx.)14.72sTempo de resposta (total)18.80s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)8.05sTempo de resposta (máx.)14.40sTempo de resposta (total)24.15s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.68sTempo de resposta (máx.)3.68sTempo de resposta (total)3.68s
Seguimento de instruções
: 9.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.02sTempo de resposta (máx.)7.35sTempo de resposta (total)14.03s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.11sTempo de resposta (máx.)10.27sTempo de resposta (total)18.32s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.99sTempo de resposta (máx.)4.99sTempo de resposta (total)4.99s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Não seguiu as instruções: 2Tempo de resposta (médio)30.37sTempo de resposta (máx.)168.71sTempo de resposta (total)546.72s…
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 83.3%Testes instáveis: 3…Tokens de saída: 3,257Tokens de raciocínio: 52,042Tempo de resposta: médio 30.37s · total 546.72s · máx. 168.71s
Truques anti-IA
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)17.99sTempo de resposta (máx.)48.33sTempo de resposta (total)71.98s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)74.49sTempo de resposta (máx.)74.49sTempo de resposta (total)74.49s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)37.67sTempo de resposta (máx.)37.67sTempo de resposta (total)37.67s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.07sTempo de resposta (máx.)12.19sTempo de resposta (total)18.14s
Específico do domínio
: 5.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)88.74sTempo de resposta (máx.)168.71sTempo de resposta (total)266.21s
Inteligência geral
: 6.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)18.25sTempo de resposta (máx.)18.25sTempo de resposta (total)18.25s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.26sTempo de resposta (máx.)9.02sTempo de resposta (total)14.52s
Resolução de quebra-cabeças
: 9.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)11.03sTempo de resposta (máx.)13.85sTempo de resposta (total)33.09s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)12.38sTempo de resposta (máx.)12.38sTempo de resposta (total)12.38s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Não seguiu as instruções: 2Tempo de resposta (médio)15.38sTempo de resposta (máx.)100.93sTempo de resposta (total)276.91s…
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 83.3%Testes instáveis: 3…Tokens de saída: 2,279Tokens de raciocínio: 35,179Tempo de resposta: médio 15.38s · total 276.91s · máx. 100.93s
Truques anti-IA
: 8.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)4.16sTempo de resposta (máx.)6.68sTempo de resposta (total)16.63s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.95sTempo de resposta (máx.)8.95sTempo de resposta (total)8.95s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)19.56sTempo de resposta (máx.)19.56sTempo de resposta (total)19.56s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.07sTempo de resposta (máx.)3.59sTempo de resposta (total)6.15s
Específico do domínio
: 5.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)64.31sTempo de resposta (máx.)100.93sTempo de resposta (total)192.94s
Inteligência geral
: 4.6 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.87sTempo de resposta (máx.)4.87sTempo de resposta (total)4.87s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.04sTempo de resposta (máx.)3.44sTempo de resposta (total)6.07s
Resolução de quebra-cabeças
: 9.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)5.12sTempo de resposta (máx.)8.73sTempo de resposta (total)15.37s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.37sTempo de resposta (máx.)6.37sTempo de resposta (total)6.37s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 2Resposta incorreta: 2Tempo de resposta (médio)46.56sTempo de resposta (máx.)120.91sTempo de resposta (total)512.20s…
Total de testes: 18Testes errados: 4Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 83.3%Testes instáveis: 2…Tokens de saída: 2,121Tokens de raciocínio: 111,889Tempo de resposta: médio 46.56s · total 512.20s · máx. 120.91s
Truques anti-IA
: 8.2 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)45.78sTempo de resposta (máx.)81.20sTempo de resposta (total)91.57s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)120.91sTempo de resposta (máx.)120.91sTempo de resposta (total)120.91s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)46.85sTempo de resposta (máx.)46.85sTempo de resposta (total)46.85s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)46.91sTempo de resposta (máx.)46.91sTempo de resposta (total)46.91s
Inteligência geral
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Tempo de resposta (médio)79.86sTempo de resposta (máx.)79.86sTempo de resposta (total)79.86s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)31.93sTempo de resposta (máx.)31.93sTempo de resposta (total)31.93s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)34.57sTempo de resposta (máx.)49.12sTempo de resposta (total)69.13s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.54sTempo de resposta (máx.)7.54sTempo de resposta (total)7.54s
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 81.5%Testes instáveis: 3…Tokens de saída: 238,920Tokens de raciocínio: 0Tempo de resposta: médio 55.19s · total 938.23s · máx. 149.94s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)32.69sTempo de resposta (máx.)85.41sTempo de resposta (total)130.78s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)99.76sTempo de resposta (máx.)99.76sTempo de resposta (total)99.76s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)113.09sTempo de resposta (máx.)113.09sTempo de resposta (total)113.09s
Análise e extração de dados
: 6.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)12.11sTempo de resposta (máx.)12.11sTempo de resposta (total)12.11s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)109.04sTempo de resposta (máx.)149.94sTempo de resposta (total)327.11s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)24.31sTempo de resposta (máx.)24.31sTempo de resposta (total)24.31s
Seguimento de instruções
: 8.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)34.02sTempo de resposta (máx.)41.83sTempo de resposta (total)68.04s
Resolução de quebra-cabeças
: 9.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)28.07sTempo de resposta (máx.)45.06sTempo de resposta (total)84.21s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)78.83sTempo de resposta (máx.)78.83sTempo de resposta (total)78.83s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Não seguiu as instruções: 1Tempo de resposta (médio)13.94sTempo de resposta (máx.)43.55sTempo de resposta (total)237.01s…
Total de testes: 17Testes errados: 4Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 76.5%Testes instáveis: 0…Tokens de saída: 1,756Tokens de raciocínio: 77,213Tempo de resposta: médio 13.94s · total 237.01s · máx. 43.55s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.90sTempo de resposta (máx.)19.37sTempo de resposta (total)39.60s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)34.95sTempo de resposta (máx.)34.95sTempo de resposta (total)34.95s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)14.95sTempo de resposta (máx.)15.40sTempo de resposta (total)29.90s
Específico do domínio
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)22.08sTempo de resposta (máx.)43.55sTempo de resposta (total)66.23s
Inteligência geral
: 5.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)27.05sTempo de resposta (máx.)27.05sTempo de resposta (total)27.05s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.54sTempo de resposta (máx.)11.67sTempo de resposta (total)15.07s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.11sTempo de resposta (máx.)7.52sTempo de resposta (total)18.34s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.87sTempo de resposta (máx.)5.87sTempo de resposta (total)5.87s
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 81.5%Testes instáveis: 3…Tokens de saída: 2,500Tokens de raciocínio: 242,500Tempo de resposta: médio 53.03s · total 954.46s · máx. 163.96s
Truques anti-IA
: 8.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 1Tempo de resposta (médio)19.75sTempo de resposta (máx.)49.95sTempo de resposta (total)79.01s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)70.35sTempo de resposta (máx.)70.35sTempo de resposta (total)70.35s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)163.96sTempo de resposta (máx.)163.96sTempo de resposta (total)163.96s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)30.26sTempo de resposta (máx.)32.03sTempo de resposta (total)60.52s
Inteligência geral
: 6.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)101.41sTempo de resposta (máx.)101.41sTempo de resposta (total)101.41s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)19.66sTempo de resposta (máx.)32.25sTempo de resposta (total)39.32s
Resolução de quebra-cabeças
: 8.2 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)64.61sTempo de resposta (máx.)123.57sTempo de resposta (total)193.84s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.45sTempo de resposta (máx.)7.45sTempo de resposta (total)7.45s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Não seguiu as instruções: 1Tempo de resposta (médio)68.83sTempo de resposta (máx.)280.52sTempo de resposta (total)1101.32s…
Total de testes: 16Testes errados: 4Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 77.1%Testes instáveis: 1…Tokens de saída: 1,283Tokens de raciocínio: 1,533,310Tempo de resposta: médio 68.83s · total 1101.32s · máx. 280.52s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)43.87sTempo de resposta (máx.)121.88sTempo de resposta (total)131.62s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)280.52sTempo de resposta (máx.)280.52sTempo de resposta (total)280.52s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.16sTempo de resposta (máx.)8.54sTempo de resposta (total)14.31s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)127.58sTempo de resposta (máx.)133.93sTempo de resposta (total)382.74s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.25sTempo de resposta (máx.)5.25sTempo de resposta (total)5.25s
Seguimento de instruções
: 7.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)70.07sTempo de resposta (máx.)136.53sTempo de resposta (total)140.14s
Resolução de quebra-cabeças
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)46.33sTempo de resposta (máx.)134.22sTempo de resposta (total)139.00s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.73sTempo de resposta (máx.)7.73sTempo de resposta (total)7.73s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Erro de API: 1Tempo de resposta (médio)9.06sTempo de resposta (máx.)26.24sTempo de resposta (total)90.58s…
Total de testes: 18Testes errados: 4Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 77.8%Testes instáveis: 0…Tokens de saída: 1,508Tokens de raciocínio: 10,084Tempo de resposta: médio 9.06s · total 90.58s · máx. 26.24s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)14.99sTempo de resposta (máx.)26.24sTempo de resposta (total)29.99s
Programação
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0ms
Combinado
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)10.37sTempo de resposta (máx.)10.37sTempo de resposta (total)10.37s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)10.84sTempo de resposta (máx.)10.84sTempo de resposta (total)10.84s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)7.01sTempo de resposta (máx.)7.01sTempo de resposta (total)7.01s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.34sTempo de resposta (máx.)9.34sTempo de resposta (total)9.34s
Seguimento de instruções
: 9.8 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.26sTempo de resposta (máx.)3.26sTempo de resposta (total)3.26s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.91sTempo de resposta (máx.)4.23sTempo de resposta (total)7.81s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)11.96sTempo de resposta (máx.)11.96sTempo de resposta (total)11.96s
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 85.2%Testes instáveis: 4…Tokens de saída: 20,163Tokens de raciocínio: 58,337Tempo de resposta: médio 23.34s · total 233.40s · máx. 79.09s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)23.66sTempo de resposta (máx.)25.06sTempo de resposta (total)47.32s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)79.09sTempo de resposta (máx.)79.09sTempo de resposta (total)79.09s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)28.96sTempo de resposta (máx.)28.96sTempo de resposta (total)28.96s
Análise e extração de dados
: 7.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)8.90sTempo de resposta (máx.)8.90sTempo de resposta (total)8.90s
Inteligência geral
: 6.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)14.69sTempo de resposta (máx.)14.69sTempo de resposta (total)14.69s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.25sTempo de resposta (máx.)7.25sTempo de resposta (total)7.25s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)15.64sTempo de resposta (máx.)16.34sTempo de resposta (total)31.27s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)15.93sTempo de resposta (máx.)15.93sTempo de resposta (total)15.93s
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 79.6%Testes instáveis: 2…Tokens de saída: 12,734Tokens de raciocínio: 27,950Tempo de resposta: médio 24.88s · total 398.13s · máx. 70.97s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)12.89sTempo de resposta (máx.)26.66sTempo de resposta (total)51.55s
Programação
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Tempo de resposta (médio)70.97sTempo de resposta (máx.)70.97sTempo de resposta (total)70.97s
Combinado
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0ms
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)21.11sTempo de resposta (máx.)21.94sTempo de resposta (total)42.21s
Específico do domínio
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)38.48sTempo de resposta (máx.)68.92sTempo de resposta (total)115.43s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.57sTempo de resposta (máx.)9.57sTempo de resposta (total)9.57s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)12.76sTempo de resposta (máx.)17.53sTempo de resposta (total)25.52s
Resolução de quebra-cabeças
: 8.8 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)27.63sTempo de resposta (máx.)61.08sTempo de resposta (total)82.89s
Chamada de ferramentas
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0ms
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 4Não seguiu as instruções: 1Tempo de resposta (médio)12.12sTempo de resposta (máx.)95.48sTempo de resposta (total)218.12s…
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 75.9%Testes instáveis: 1…Tokens de saída: 1,898Tokens de raciocínio: 122,273Tempo de resposta: médio 12.12s · total 218.12s · máx. 95.48s
Truques anti-IA
: 8.4 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)6.30sTempo de resposta (máx.)15.56sTempo de resposta (total)25.21s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)16.23sTempo de resposta (máx.)16.23sTempo de resposta (total)16.23s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)28.44sTempo de resposta (máx.)28.44sTempo de resposta (total)28.44s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.06sTempo de resposta (máx.)5.06sTempo de resposta (total)8.11s
Específico do domínio
: 5.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)37.34sTempo de resposta (máx.)95.48sTempo de resposta (total)112.01s
Inteligência geral
: 4.8 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.86sTempo de resposta (máx.)4.86sTempo de resposta (total)4.86s
Seguimento de instruções
: 9.8 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.62sTempo de resposta (máx.)2.78sTempo de resposta (total)5.24s
Resolução de quebra-cabeças
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.94sTempo de resposta (máx.)6.33sTempo de resposta (total)11.83s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.20sTempo de resposta (máx.)6.20sTempo de resposta (total)6.20s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Não seguiu as instruções: 2Tempo de resposta (médio)18.63sTempo de resposta (máx.)100.41sTempo de resposta (total)335.26s…
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 79.6%Testes instáveis: 3…Tokens de saída: 2,169Tokens de raciocínio: 48,732Tempo de resposta: médio 18.63s · total 335.26s · máx. 100.41s
Truques anti-IA
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)4.11sTempo de resposta (máx.)6.42sTempo de resposta (total)16.42s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)13.03sTempo de resposta (máx.)13.03sTempo de resposta (total)13.03s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)20.57sTempo de resposta (máx.)20.57sTempo de resposta (total)20.57s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.32sTempo de resposta (máx.)5.40sTempo de resposta (total)10.64s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)74.27sTempo de resposta (máx.)100.41sTempo de resposta (total)222.80s
Inteligência geral
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.92sTempo de resposta (máx.)4.92sTempo de resposta (total)4.92s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.11sTempo de resposta (máx.)3.68sTempo de resposta (total)6.22s
Resolução de quebra-cabeças
: 8.2 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)9.13sTempo de resposta (máx.)18.14sTempo de resposta (total)27.39s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)13.28sTempo de resposta (máx.)13.28sTempo de resposta (total)13.28s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 4Não seguiu as instruções: 1Tempo de resposta (médio)3.74sTempo de resposta (máx.)14.93sTempo de resposta (total)67.31s…
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 72.2%Testes instáveis: 0…Tokens de saída: 2,168Tokens de raciocínio: 29,030Tempo de resposta: médio 3.74s · total 67.31s · máx. 14.93s
Truques anti-IA
: 9.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)2.33sTempo de resposta (máx.)3.89sTempo de resposta (total)9.30s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.34sTempo de resposta (máx.)4.34sTempo de resposta (total)4.34s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)14.93sTempo de resposta (máx.)14.93sTempo de resposta (total)14.93s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.29sTempo de resposta (máx.)2.31sTempo de resposta (total)4.59s
Específico do domínio
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)4.21sTempo de resposta (máx.)5.86sTempo de resposta (total)12.62s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.16sTempo de resposta (máx.)3.16sTempo de resposta (total)3.16s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.91sTempo de resposta (máx.)1.93sTempo de resposta (total)3.82s
Resolução de quebra-cabeças
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.58sTempo de resposta (máx.)4.41sTempo de resposta (total)10.75s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.80sTempo de resposta (máx.)3.80sTempo de resposta (total)3.80s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Não seguiu as instruções: 2Tempo de resposta (médio)71.21sTempo de resposta (máx.)351.99sTempo de resposta (total)1281.73s…
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 74.1%Testes instáveis: 1…Tokens de saída: 671Tokens de raciocínio: 39,383Tempo de resposta: médio 71.21s · total 1281.73s · máx. 351.99s
Truques anti-IA
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)26.93sTempo de resposta (máx.)61.35sTempo de resposta (total)107.71s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)93.00sTempo de resposta (máx.)93.00sTempo de resposta (total)93.00s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)71.08sTempo de resposta (máx.)71.08sTempo de resposta (total)71.08s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)63.00sTempo de resposta (máx.)102.80sTempo de resposta (total)126.00s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)202.56sTempo de resposta (máx.)351.99sTempo de resposta (total)607.68s
Inteligência geral
: 5.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)26.96sTempo de resposta (máx.)26.96sTempo de resposta (total)26.96s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)14.60sTempo de resposta (máx.)20.03sTempo de resposta (total)29.20s
Resolução de quebra-cabeças
: 7.6 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)69.69sTempo de resposta (máx.)92.65sTempo de resposta (total)209.06s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)11.05sTempo de resposta (máx.)11.05sTempo de resposta (total)11.05s
Total de testes: 18Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 77.8%Testes instáveis: 5…Tokens de saída: 12,197Tokens de raciocínio: 38,933Tempo de resposta: médio 17.67s · total 317.98s · máx. 194.23s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.82sTempo de resposta (máx.)7.69sTempo de resposta (total)19.26s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)12.26sTempo de resposta (máx.)12.26sTempo de resposta (total)12.26s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)13.88sTempo de resposta (máx.)13.88sTempo de resposta (total)13.88s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.19sTempo de resposta (máx.)6.42sTempo de resposta (total)12.38s
Inteligência geral
: 6.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)10.05sTempo de resposta (máx.)10.05sTempo de resposta (total)10.05s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.38sTempo de resposta (máx.)5.70sTempo de resposta (total)10.77s
Resolução de quebra-cabeças
: 7.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 2Tempo de resposta (médio)5.44sTempo de resposta (máx.)7.26sTempo de resposta (total)16.32s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.84sTempo de resposta (máx.)9.84sTempo de resposta (total)9.84s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo esgotado: 2Tempo de resposta (médio)31.38sTempo de resposta (máx.)119.29sTempo de resposta (total)564.84s…
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 79.6%Testes instáveis: 3…Tokens de saída: 17,635Tokens de raciocínio: 162,668Tempo de resposta: médio 31.38s · total 564.84s · máx. 119.29s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.75sTempo de resposta (máx.)18.03sTempo de resposta (total)39.01s
Programação
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Tempo de resposta (médio)70.98sTempo de resposta (máx.)70.98sTempo de resposta (total)70.98s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)107.79sTempo de resposta (máx.)107.79sTempo de resposta (total)107.79s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)23.41sTempo de resposta (máx.)29.79sTempo de resposta (total)46.83s
Específico do domínio
: 2.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)63.40sTempo de resposta (máx.)119.29sTempo de resposta (total)190.20s
Inteligência geral
: 3.4 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Tempo de resposta (médio)34.11sTempo de resposta (máx.)34.11sTempo de resposta (total)34.11s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.88sTempo de resposta (máx.)15.44sTempo de resposta (total)19.76s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)17.18sTempo de resposta (máx.)31.99sTempo de resposta (total)51.55s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.60sTempo de resposta (máx.)4.60sTempo de resposta (total)4.60s
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 74.1%Testes instáveis: 1…Tokens de saída: 1,763Tokens de raciocínio: 83,782Tempo de resposta: médio 15.27s · total 259.55s · máx. 43.55s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.90sTempo de resposta (máx.)19.37sTempo de resposta (total)39.60s
Programação
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0ms
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)34.95sTempo de resposta (máx.)34.95sTempo de resposta (total)34.95s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)14.95sTempo de resposta (máx.)15.40sTempo de resposta (total)29.90s
Específico do domínio
: 2.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)29.59sTempo de resposta (máx.)43.55sTempo de resposta (total)88.77s
Inteligência geral
: 5.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)27.05sTempo de resposta (máx.)27.05sTempo de resposta (total)27.05s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.54sTempo de resposta (máx.)11.67sTempo de resposta (total)15.07s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.11sTempo de resposta (máx.)7.52sTempo de resposta (total)18.34s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.87sTempo de resposta (máx.)5.87sTempo de resposta (total)5.87s
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 75.9%Testes instáveis: 1…Tokens de saída: 65,778Tokens de raciocínio: 0Tempo de resposta: médio 23.98s · total 407.72s · máx. 78.74s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)16.61sTempo de resposta (máx.)38.50sTempo de resposta (total)66.46s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)27.94sTempo de resposta (máx.)27.94sTempo de resposta (total)27.94s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)78.74sTempo de resposta (máx.)78.74sTempo de resposta (total)78.74s
Análise e extração de dados
: 6.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)5.85sTempo de resposta (máx.)5.85sTempo de resposta (total)5.85s
Específico do domínio
: 5.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)40.44sTempo de resposta (máx.)46.32sTempo de resposta (total)121.31s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)16.44sTempo de resposta (máx.)16.44sTempo de resposta (total)16.44s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)15.98sTempo de resposta (máx.)22.24sTempo de resposta (total)31.97s
Resolução de quebra-cabeças
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 2Tempo de resposta (médio)13.73sTempo de resposta (máx.)25.82sTempo de resposta (total)41.19s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)17.84sTempo de resposta (máx.)17.84sTempo de resposta (total)17.84s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 5Tempo de resposta (médio)1.65sTempo de resposta (máx.)3.56sTempo de resposta (total)18.20s…
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 77.8%Testes instáveis: 2…Tokens de saída: 1,840Tokens de raciocínio: 0Tempo de resposta: médio 1.65s · total 18.20s · máx. 3.56s
Truques anti-IA
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.25sTempo de resposta (máx.)1.59sTempo de resposta (total)2.49s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.59sTempo de resposta (máx.)1.59sTempo de resposta (total)1.59s
Combinado
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.56sTempo de resposta (máx.)3.56sTempo de resposta (total)3.56s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.41sTempo de resposta (máx.)1.41sTempo de resposta (total)1.41s
Específico do domínio
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)963msTempo de resposta (máx.)963msTempo de resposta (total)963ms
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.13sTempo de resposta (máx.)1.13sTempo de resposta (total)1.13s
Seguimento de instruções
: 6.4 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.58sTempo de resposta (máx.)1.58sTempo de resposta (total)1.58s
Resolução de quebra-cabeças
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.06sTempo de resposta (máx.)1.06sTempo de resposta (total)2.12s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.35sTempo de resposta (máx.)3.35sTempo de resposta (total)3.35s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 4Não seguiu as instruções: 1Tempo de resposta (médio)3.22sTempo de resposta (máx.)11.91sTempo de resposta (total)58.00s…
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 72.2%Testes instáveis: 0…Tokens de saída: 2,247Tokens de raciocínio: 8,058Tempo de resposta: médio 3.22s · total 58.00s · máx. 11.91s
Truques anti-IA
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)2.12sTempo de resposta (máx.)3.18sTempo de resposta (total)8.50s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.20sTempo de resposta (máx.)2.20sTempo de resposta (total)2.20s
Combinado
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)11.91sTempo de resposta (máx.)11.91sTempo de resposta (total)11.91s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.00sTempo de resposta (máx.)3.74sTempo de resposta (total)5.99s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)2.36sTempo de resposta (máx.)3.51sTempo de resposta (total)7.07s
Inteligência geral
: 4.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)1.54sTempo de resposta (máx.)1.54sTempo de resposta (total)1.54s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.49sTempo de resposta (máx.)1.66sTempo de resposta (total)2.99s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.76sTempo de resposta (máx.)5.08sTempo de resposta (total)8.27s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.54sTempo de resposta (máx.)9.54sTempo de resposta (total)9.54s
Total de testes: 18Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 75.9%Testes instáveis: 3…Tokens de saída: 2,735Tokens de raciocínio: 52,571Tempo de resposta: médio 16.17s · total 291.09s · máx. 84.22s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.95sTempo de resposta (máx.)5.12sTempo de resposta (total)11.80s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)32.58sTempo de resposta (máx.)32.58sTempo de resposta (total)32.58s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)53.36sTempo de resposta (máx.)53.36sTempo de resposta (total)53.36s
Análise e extração de dados
: 7.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)18.81sTempo de resposta (máx.)20.29sTempo de resposta (total)37.61s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 2Tempo de resposta (médio)37.87sTempo de resposta (máx.)84.22sTempo de resposta (total)113.60s
Inteligência geral
: 5.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.27sTempo de resposta (máx.)4.27sTempo de resposta (total)4.27s
Seguimento de instruções
: 9.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.77sTempo de resposta (máx.)3.21sTempo de resposta (total)5.54s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)16.87sTempo de resposta (máx.)16.87sTempo de resposta (total)16.87s
Total de testes: 18Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 77.8%Testes instáveis: 3…Tokens de saída: 2,360Tokens de raciocínio: 38,320Tempo de resposta: médio 12.27s · total 208.56s · máx. 64.71s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.06sTempo de resposta (máx.)4.70sTempo de resposta (total)12.23s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)52.12sTempo de resposta (máx.)52.12sTempo de resposta (total)52.12s
Combinado
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)64.71sTempo de resposta (máx.)64.71sTempo de resposta (total)64.71s
Análise e extração de dados
: 7.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)17.20sTempo de resposta (máx.)17.44sTempo de resposta (total)34.40s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.06sTempo de resposta (máx.)4.06sTempo de resposta (total)4.06s
Seguimento de instruções
: 9.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.36sTempo de resposta (máx.)4.35sTempo de resposta (total)6.72s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.19sTempo de resposta (máx.)8.19sTempo de resposta (total)8.19s
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 74.1%Testes instáveis: 1…Tokens de saída: 65,057Tokens de raciocínio: 0Tempo de resposta: médio 14.63s · total 248.72s · máx. 46.04s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.59sTempo de resposta (máx.)10.20sTempo de resposta (total)26.37s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)31.37sTempo de resposta (máx.)31.37sTempo de resposta (total)31.37s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)46.04sTempo de resposta (máx.)46.04sTempo de resposta (total)46.04s
Análise e extração de dados
: 6.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)5.25sTempo de resposta (máx.)5.25sTempo de resposta (total)5.25s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)22.30sTempo de resposta (máx.)30.51sTempo de resposta (total)66.90s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)16.84sTempo de resposta (máx.)16.84sTempo de resposta (total)16.84s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.16sTempo de resposta (máx.)7.72sTempo de resposta (total)12.31s
Resolução de quebra-cabeças
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 2Tempo de resposta (médio)9.55sTempo de resposta (máx.)14.35sTempo de resposta (total)28.64s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)15.02sTempo de resposta (máx.)15.02sTempo de resposta (total)15.02s
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 75.9%Testes instáveis: 2…Tokens de saída: 15,928Tokens de raciocínio: 44,631Tempo de resposta: médio 25.03s · total 425.48s · máx. 147.47s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)6.20sTempo de resposta (máx.)9.64sTempo de resposta (total)24.78s
Programação
: 2.8 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Tempo de resposta (médio)147.47sTempo de resposta (máx.)147.47sTempo de resposta (total)147.47s
Combinado
: 9.6 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)73.55sTempo de resposta (máx.)73.55sTempo de resposta (total)73.55s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)16.51sTempo de resposta (máx.)20.57sTempo de resposta (total)33.02s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)29.76sTempo de resposta (máx.)29.76sTempo de resposta (total)29.76s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)17.54sTempo de resposta (máx.)21.25sTempo de resposta (total)35.08s
Resolução de quebra-cabeças
: 7.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)8.52sTempo de resposta (máx.)12.73sTempo de resposta (total)25.56s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.01sTempo de resposta (máx.)9.01sTempo de resposta (total)9.01s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 3Resposta incorreta: 3Tempo de resposta (médio)9.81sTempo de resposta (máx.)31.36sTempo de resposta (total)176.62s…
Total de testes: 18Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 74.1%Testes instáveis: 2…Tokens de saída: 1,568Tokens de raciocínio: 91,909Tempo de resposta: médio 9.81s · total 176.62s · máx. 31.36s
Truques anti-IA
: 8.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.16sTempo de resposta (máx.)3.44sTempo de resposta (total)12.65s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)31.36sTempo de resposta (máx.)31.36sTempo de resposta (total)31.36s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)20.93sTempo de resposta (máx.)20.93sTempo de resposta (total)20.93s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.01sTempo de resposta (máx.)4.27sTempo de resposta (total)8.02s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)21.33sTempo de resposta (máx.)24.21sTempo de resposta (total)64.00s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.78sTempo de resposta (máx.)5.78sTempo de resposta (total)5.78s
Seguimento de instruções
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.97sTempo de resposta (máx.)6.05sTempo de resposta (total)9.94s
Resolução de quebra-cabeças
: 8.2 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)3.85sTempo de resposta (máx.)4.53sTempo de resposta (total)11.55s
Chamada de ferramentas
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)12.39sTempo de resposta (máx.)12.39sTempo de resposta (total)12.39s
Total de testes: 18Testes errados: 5Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 74.1%Testes instáveis: 1…Tokens de saída: 42,068Tokens de raciocínio: 26,784Tempo de resposta: médio 12.66s · total 126.62s · máx. 46.35s
Truques anti-IA
: 6.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 1Resposta incorreta: 1Tempo de resposta (médio)2.98sTempo de resposta (máx.)4.95sTempo de resposta (total)5.97s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)35.76sTempo de resposta (máx.)35.76sTempo de resposta (total)35.76s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)46.35sTempo de resposta (máx.)46.35sTempo de resposta (total)46.35s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)13.90sTempo de resposta (máx.)13.90sTempo de resposta (total)13.90s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.94sTempo de resposta (máx.)4.94sTempo de resposta (total)4.94s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.61sTempo de resposta (máx.)2.61sTempo de resposta (total)2.61s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.80sTempo de resposta (máx.)5.22sTempo de resposta (total)9.60s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.48sTempo de resposta (máx.)7.48sTempo de resposta (total)7.48s
Total de testes: 18Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 79.6%Testes instáveis: 4…Tokens de saída: 7,554Tokens de raciocínio: 45,588Tempo de resposta: médio 43.49s · total 782.73s · máx. 180.92s
Truques anti-IA
: 8.4 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)30.72sTempo de resposta (máx.)44.23sTempo de resposta (total)122.88s
Programação
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Tempo de resposta (médio)180.92sTempo de resposta (máx.)180.92sTempo de resposta (total)180.92s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)93.11sTempo de resposta (máx.)93.11sTempo de resposta (total)93.11s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)36.09sTempo de resposta (máx.)39.12sTempo de resposta (total)72.18s
Inteligência geral
: 5.4 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)31.30sTempo de resposta (máx.)31.30sTempo de resposta (total)31.30s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)35.78sTempo de resposta (máx.)47.30sTempo de resposta (total)71.56s
Resolução de quebra-cabeças
: 8.2 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)36.87sTempo de resposta (máx.)59.22sTempo de resposta (total)110.62s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)34.81sTempo de resposta (máx.)34.81sTempo de resposta (total)34.81s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 5Não seguiu as instruções: 1Tempo de resposta (médio)6.84sTempo de resposta (máx.)38.52sTempo de resposta (total)123.17s…
Total de testes: 18Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 75.9%Testes instáveis: 3…Tokens de saída: 17,346Tokens de raciocínio: 0Tempo de resposta: médio 6.84s · total 123.17s · máx. 38.52s
Truques anti-IA
: 8.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.40sTempo de resposta (máx.)4.78sTempo de resposta (total)13.59s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.97sTempo de resposta (máx.)8.97sTempo de resposta (total)8.97s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.12sTempo de resposta (máx.)9.12sTempo de resposta (total)9.12s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.05sTempo de resposta (máx.)3.33sTempo de resposta (total)6.10s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)17.78sTempo de resposta (máx.)38.52sTempo de resposta (total)53.33s
Inteligência geral
: 4.4 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)3.20sTempo de resposta (máx.)3.20sTempo de resposta (total)3.20s
Seguimento de instruções
: 7.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)5.46sTempo de resposta (máx.)6.45sTempo de resposta (total)10.92s
Resolução de quebra-cabeças
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)4.42sTempo de resposta (máx.)5.04sTempo de resposta (total)13.27s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.68sTempo de resposta (máx.)4.68sTempo de resposta (total)4.68s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 4Não seguiu as instruções: 2Tempo de resposta (médio)1.30sTempo de resposta (máx.)3.39sTempo de resposta (total)23.42s…
Total de testes: 18Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 70.4%Testes instáveis: 1…Tokens de saída: 5,361Tokens de raciocínio: 0Tempo de resposta: médio 1.30s · total 23.42s · máx. 3.39s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.47sTempo de resposta (máx.)1.47sTempo de resposta (total)1.47s
Combinado
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.20sTempo de resposta (máx.)3.20sTempo de resposta (total)3.20s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.22sTempo de resposta (máx.)1.33sTempo de resposta (total)2.44s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)942msTempo de resposta (máx.)1.12sTempo de resposta (total)2.83s
Inteligência geral
: 4.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)741msTempo de resposta (máx.)741msTempo de resposta (total)741ms
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.13sTempo de resposta (máx.)1.14sTempo de resposta (total)2.27s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)972msTempo de resposta (máx.)1.13sTempo de resposta (total)2.92s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.39sTempo de resposta (máx.)3.39sTempo de resposta (total)3.39s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 3Resposta incorreta: 3Tempo de resposta (médio)26.78sTempo de resposta (máx.)170.45sTempo de resposta (total)294.58s…
Total de testes: 17Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 70.6%Testes instáveis: 2…Tokens de saída: 71,904Tokens de raciocínio: 155,607Tempo de resposta: médio 26.78s · total 294.58s · máx. 170.45s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)13.56sTempo de resposta (máx.)32.30sTempo de resposta (total)40.68s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)29.57sTempo de resposta (máx.)29.57sTempo de resposta (total)29.57s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)15.01sTempo de resposta (máx.)15.01sTempo de resposta (total)15.01s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)170.45sTempo de resposta (máx.)170.45sTempo de resposta (total)170.45s
Inteligência geral
: 5.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)6.54sTempo de resposta (máx.)6.54sTempo de resposta (total)6.54s
Seguimento de instruções
: 8.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.98sTempo de resposta (máx.)4.98sTempo de resposta (total)4.98s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)11.91sTempo de resposta (máx.)11.91sTempo de resposta (total)11.91s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 4Não seguiu as instruções: 3Tempo de resposta (médio)47.47sTempo de resposta (máx.)255.28sTempo de resposta (total)854.45s…
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 79.6%Testes instáveis: 5…Tokens de saída: 1,757Tokens de raciocínio: 55,907Tempo de resposta: médio 47.47s · total 854.45s · máx. 255.28s
Truques anti-IA
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)28.51sTempo de resposta (máx.)39.73sTempo de resposta (total)114.05s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)62.48sTempo de resposta (máx.)62.48sTempo de resposta (total)62.48s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)76.57sTempo de resposta (máx.)76.57sTempo de resposta (total)76.57s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)28.03sTempo de resposta (máx.)30.49sTempo de resposta (total)56.07s
Específico do domínio
: 4.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)112.69sTempo de resposta (máx.)255.28sTempo de resposta (total)338.07s
Inteligência geral
: 6.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)25.15sTempo de resposta (máx.)25.15sTempo de resposta (total)25.15s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)15.36sTempo de resposta (máx.)19.53sTempo de resposta (total)30.73s
Resolução de quebra-cabeças
: 6.4 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 2Tempo de resposta (médio)25.53sTempo de resposta (máx.)32.37sTempo de resposta (total)76.60s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)74.73sTempo de resposta (máx.)74.73sTempo de resposta (total)74.73s
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 77.8%Testes instáveis: 6…Tokens de saída: 2,351Tokens de raciocínio: 58,941Tempo de resposta: médio 14.96s · total 269.32s · máx. 67.08s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)13.78sTempo de resposta (máx.)13.78sTempo de resposta (total)13.78s
Combinado
: 6.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Tempo de resposta (médio)15.06sTempo de resposta (máx.)15.06sTempo de resposta (total)15.06s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.60sTempo de resposta (máx.)9.92sTempo de resposta (total)19.19s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)38.15sTempo de resposta (máx.)67.08sTempo de resposta (total)114.45s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)11.09sTempo de resposta (máx.)11.09sTempo de resposta (total)11.09s
Seguimento de instruções
: 9.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.74sTempo de resposta (máx.)5.23sTempo de resposta (total)7.47s
Resolução de quebra-cabeças
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)10.91sTempo de resposta (máx.)18.97sTempo de resposta (total)32.74s
Chamada de ferramentas
: 7.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Chamada de ferramenta inválida: 1Tempo de resposta (médio)12.53sTempo de resposta (máx.)12.53sTempo de resposta (total)12.53s
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 81.5%Testes instáveis: 6…Tokens de saída: 2,073Tokens de raciocínio: 191,899Tempo de resposta: médio 66.72s · total 1201.03s · máx. 234.29s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)59.11sTempo de resposta (máx.)168.31sTempo de resposta (total)236.44s
Programação
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Tempo de resposta (médio)45.75sTempo de resposta (máx.)45.75sTempo de resposta (total)45.75s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)17.78sTempo de resposta (máx.)17.78sTempo de resposta (total)17.78s
Análise e extração de dados
: 7.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)56.99sTempo de resposta (máx.)80.14sTempo de resposta (total)113.98s
Inteligência geral
: 6.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)40.05sTempo de resposta (máx.)40.05sTempo de resposta (total)40.05s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)63.49sTempo de resposta (máx.)111.61sTempo de resposta (total)126.98s
Resolução de quebra-cabeças
: 6.4 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 2Tempo de resposta (médio)56.74sTempo de resposta (máx.)115.01sTempo de resposta (total)170.23s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)10.33sTempo de resposta (máx.)10.33sTempo de resposta (total)10.33s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo esgotado: 2Erro de API: 1Tempo de resposta (médio)24.13sTempo de resposta (máx.)118.52sTempo de resposta (total)410.25s…
Total de testes: 18Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 75.9%Testes instáveis: 3…Tokens de saída: 8,005Tokens de raciocínio: 49,090Tempo de resposta: médio 24.13s · total 410.25s · máx. 118.52s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.31sTempo de resposta (máx.)14.20sTempo de resposta (total)33.24s
Programação
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Tempo de resposta (médio)118.52sTempo de resposta (máx.)118.52sTempo de resposta (total)118.52s
Combinado
: 9.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)43.11sTempo de resposta (máx.)43.11sTempo de resposta (total)43.11s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.33sTempo de resposta (máx.)9.40sTempo de resposta (total)18.66s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)20.95sTempo de resposta (máx.)20.95sTempo de resposta (total)20.95s
Seguimento de instruções
: 6.4 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)7.47sTempo de resposta (máx.)10.16sTempo de resposta (total)14.94s
Resolução de quebra-cabeças
: 8.2 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)23.85sTempo de resposta (máx.)33.09sTempo de resposta (total)71.54s
Chamada de ferramentas
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0ms
Total de testes: 18Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 74.1%Testes instáveis: 3…Tokens de saída: 2,840Tokens de raciocínio: 116,242Tempo de resposta: médio 13.71s · total 246.73s · máx. 86.93s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.98sTempo de resposta (máx.)3.76sTempo de resposta (total)7.92s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)31.48sTempo de resposta (máx.)31.48sTempo de resposta (total)31.48s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)16.86sTempo de resposta (máx.)16.86sTempo de resposta (total)16.86s
Inteligência geral
: 3.8 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)1.55sTempo de resposta (máx.)1.55sTempo de resposta (total)1.55s
Seguimento de instruções
: 9.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.80sTempo de resposta (máx.)1.81sTempo de resposta (total)3.60s
Resolução de quebra-cabeças
: 8.2 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)20.60sTempo de resposta (máx.)57.93sTempo de resposta (total)61.79s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.29sTempo de resposta (máx.)7.29sTempo de resposta (total)7.29s
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 74.1%Testes instáveis: 4…Tokens de saída: 80,759Tokens de raciocínio: 179,814Tempo de resposta: médio 45.20s · total 768.37s · máx. 215.85s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)106.96sTempo de resposta (máx.)106.96sTempo de resposta (total)106.96s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)40.96sTempo de resposta (máx.)40.96sTempo de resposta (total)40.96s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)20.38sTempo de resposta (máx.)22.88sTempo de resposta (total)40.76s
Específico do domínio
: 5.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 2Tempo de resposta (médio)202.38sTempo de resposta (máx.)215.85sTempo de resposta (total)404.76s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)17.83sTempo de resposta (máx.)17.83sTempo de resposta (total)17.83s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)12.53sTempo de resposta (máx.)19.15sTempo de resposta (total)25.06s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.92sTempo de resposta (máx.)8.92sTempo de resposta (total)8.92s
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 61.1%Testes instáveis: 0…Tokens de saída: 928Tokens de raciocínio: 72,661Tempo de resposta: médio 16.76s · total 301.61s · máx. 158.78s
Truques anti-IA
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.11sTempo de resposta (máx.)3.43sTempo de resposta (total)8.43s
Programação
: 4.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)68.55sTempo de resposta (máx.)68.55sTempo de resposta (total)68.55s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)19.29sTempo de resposta (máx.)19.29sTempo de resposta (total)19.29s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.29sTempo de resposta (máx.)2.62sTempo de resposta (total)4.58s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.86sTempo de resposta (máx.)2.86sTempo de resposta (total)2.86s
Seguimento de instruções
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.92sTempo de resposta (máx.)7.14sTempo de resposta (total)9.83s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)11.07sTempo de resposta (máx.)11.07sTempo de resposta (total)11.07s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 5Não seguiu as instruções: 2Tempo de resposta (médio)5.88sTempo de resposta (máx.)18.33sTempo de resposta (total)105.90s…
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 68.5%Testes instáveis: 3…Tokens de saída: 20,784Tokens de raciocínio: 0Tempo de resposta: médio 5.88s · total 105.90s · máx. 18.33s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.32sTempo de resposta (máx.)9.32sTempo de resposta (total)9.32s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)11.96sTempo de resposta (máx.)11.96sTempo de resposta (total)11.96s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.21sTempo de resposta (máx.)2.52sTempo de resposta (total)4.42s
Específico do domínio
: 3.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 3Tempo de resposta (médio)13.01sTempo de resposta (máx.)18.33sTempo de resposta (total)39.04s
Inteligência geral
: 4.6 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)1.99sTempo de resposta (máx.)1.99sTempo de resposta (total)1.99s
Seguimento de instruções
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.29sTempo de resposta (máx.)4.18sTempo de resposta (total)6.59s
Resolução de quebra-cabeças
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.93sTempo de resposta (máx.)3.05sTempo de resposta (total)8.78s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)8.36sTempo de resposta (máx.)8.36sTempo de resposta (total)8.36s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 4Resposta incorreta: 2Tempo de resposta (médio)21.08sTempo de resposta (máx.)83.40sTempo de resposta (total)231.84s…
Total de testes: 18Testes errados: 6Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 70.4%Testes instáveis: 2…Tokens de saída: 29,829Tokens de raciocínio: 18,938Tempo de resposta: médio 21.08s · total 231.84s · máx. 83.40s
Truques anti-IA
: 6.4 Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 2Tempo de resposta (médio)7.45sTempo de resposta (máx.)11.88sTempo de resposta (total)14.90s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)23.11sTempo de resposta (máx.)23.11sTempo de resposta (total)23.11s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)76.66sTempo de resposta (máx.)76.66sTempo de resposta (total)76.66s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.37sTempo de resposta (máx.)7.37sTempo de resposta (total)7.37s
Inteligência geral
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)5.04sTempo de resposta (máx.)5.04sTempo de resposta (total)5.04s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.43sTempo de resposta (máx.)2.43sTempo de resposta (total)2.43s
Resolução de quebra-cabeças
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)4.60sTempo de resposta (máx.)4.66sTempo de resposta (total)9.20s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)9.73sTempo de resposta (máx.)9.73sTempo de resposta (total)9.73s
Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 4Não seguiu as instruções: 3Tempo de resposta (médio)11.21sTempo de resposta (máx.)94.06sTempo de resposta (total)201.80s…
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 68.5%Testes instáveis: 2…Tokens de saída: 2,946Tokens de raciocínio: 58,132Tempo de resposta: médio 11.21s · total 201.80s · máx. 94.06s
Truques anti-IA
: 8.3 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)4.52sTempo de resposta (máx.)7.74sTempo de resposta (total)18.10s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)13.41sTempo de resposta (máx.)13.41sTempo de resposta (total)13.41s
Combinado
: 9.8 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)24.13sTempo de resposta (máx.)24.13sTempo de resposta (total)24.13s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)2.54sTempo de resposta (máx.)3.33sTempo de resposta (total)5.08s
Específico do domínio
: 5.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)38.18sTempo de resposta (máx.)94.06sTempo de resposta (total)114.53s
Inteligência geral
: 4.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.15sTempo de resposta (máx.)4.15sTempo de resposta (total)4.15s
Seguimento de instruções
: 9.8 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)1.88sTempo de resposta (máx.)2.61sTempo de resposta (total)3.75s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)7.71sTempo de resposta (máx.)7.71sTempo de resposta (total)7.71s
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 66.7%Testes instáveis: 2…Tokens de saída: 2,419Tokens de raciocínio: 79,238Tempo de resposta: médio 69.70s · total 1045.47s · máx. 262.83s
Truques anti-IA
: 6.6 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Resposta incorreta: 1Tempo de resposta (médio)74.75sTempo de resposta (máx.)182.10sTempo de resposta (total)298.98s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)197.31sTempo de resposta (máx.)197.31sTempo de resposta (total)197.31s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)262.83sTempo de resposta (máx.)262.83sTempo de resposta (total)262.83s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)24.27sTempo de resposta (máx.)27.52sTempo de resposta (total)48.54s
Específico do domínio
: 3.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 3Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0ms
Inteligência geral
: 5.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)36.65sTempo de resposta (máx.)36.65sTempo de resposta (total)36.65s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)17.47sTempo de resposta (máx.)19.46sTempo de resposta (total)34.93s
Resolução de quebra-cabeças
: 8.2 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)25.85sTempo de resposta (máx.)32.95sTempo de resposta (total)77.55s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)88.68sTempo de resposta (máx.)88.68sTempo de resposta (total)88.68s
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 72.2%Testes instáveis: 4…Tokens de saída: 2,705Tokens de raciocínio: 18,977Tempo de resposta: médio 14.04s · total 154.41s · máx. 77.80s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)15.12sTempo de resposta (máx.)15.12sTempo de resposta (total)15.12s
Combinado
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)14.06sTempo de resposta (máx.)14.06sTempo de resposta (total)14.06s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.15sTempo de resposta (máx.)3.15sTempo de resposta (total)3.15s
Inteligência geral
: 3.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.32sTempo de resposta (máx.)4.32sTempo de resposta (total)4.32s
Seguimento de instruções
: 9.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.12sTempo de resposta (máx.)3.12sTempo de resposta (total)3.12s
Resolução de quebra-cabeças
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)5.47sTempo de resposta (máx.)6.45sTempo de resposta (total)10.94s
Chamada de ferramentas
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem resposta: 1Tempo de resposta (médio)10.30sTempo de resposta (máx.)10.30sTempo de resposta (total)10.30s
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 70.4%Testes instáveis: 3…Tokens de saída: 12,387Tokens de raciocínio: 115,182Tempo de resposta: médio 23.36s · total 280.34s · máx. 96.01s
Truques anti-IA
: 8.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 1Tempo de resposta (médio)15.85sTempo de resposta (máx.)20.83sTempo de resposta (total)47.55s
Programação
: 4.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Tempo esgotado: 1Tempo de resposta (médio)13.03sTempo de resposta (máx.)13.03sTempo de resposta (total)13.03s
Combinado
: 9.8 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)75.68sTempo de resposta (máx.)75.68sTempo de resposta (total)75.68s
Análise e extração de dados
: 6.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Erro de API: 1Tempo de resposta (médio)0msTempo de resposta (máx.)0msTempo de resposta (total)0ms
Específico do domínio
: 5.9 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 2Tempo de resposta (médio)96.01sTempo de resposta (máx.)96.01sTempo de resposta (total)96.01s
Inteligência geral
: 4.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)4.20sTempo de resposta (máx.)4.20sTempo de resposta (total)4.20s
Seguimento de instruções
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.28sTempo de resposta (máx.)7.37sTempo de resposta (total)8.55s
Resolução de quebra-cabeças
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.77sTempo de resposta (máx.)5.26sTempo de resposta (total)7.55s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)27.78sTempo de resposta (máx.)27.78sTempo de resposta (total)27.78s
Total de testes: 18Testes errados: 7Confiabilidade: N/DA telemetria de confiabilidade está indisponível ou incompleta para este modelo.Taxa de acerto por tentativa: 64.8%Testes instáveis: 1…Tokens de saída: 7,433Tokens de raciocínio: 0Tempo de resposta: médio 4.98s · total 54.83s · máx. 23.84s
Truques anti-IA
: 4.8 Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 2Resposta incorreta: 1Tempo de resposta (médio)2.94sTempo de resposta (máx.)4.83sTempo de resposta (total)5.88s
Programação
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.67sTempo de resposta (máx.)3.67sTempo de resposta (total)3.67s
Combinado
: 9.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)23.84sTempo de resposta (máx.)23.84sTempo de resposta (total)23.84s
Análise e extração de dados
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)3.43sTempo de resposta (máx.)3.43sTempo de resposta (total)3.43s
Específico do domínio
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)3.54sTempo de resposta (máx.)3.54sTempo de resposta (total)3.54s
Inteligência geral
: 6.1 Um teste é totalmente aprovado apenas quando todas as execuções passam.Não seguiu as instruções: 1Tempo de resposta (médio)2.56sTempo de resposta (máx.)2.56sTempo de resposta (total)2.56s
Seguimento de instruções
: 6.5 Um teste é totalmente aprovado apenas quando todas as execuções passam.Resposta incorreta: 1Tempo de resposta (médio)1.96sTempo de resposta (máx.)1.96sTempo de resposta (total)1.96s
Resolução de quebra-cabeças
: 7.7 Um teste é totalmente aprovado apenas quando todas as execuções passam.Formatação extra: 1Tempo de resposta (médio)2.92sTempo de resposta (máx.)3.33sTempo de resposta (total)5.84s
Chamada de ferramentas
: 10.0 Um teste é totalmente aprovado apenas quando todas as execuções passam.Sem respostas com falha.Tempo de resposta (médio)4.11sTempo de resposta (máx.)4.11sTempo de resposta (total)4.11s