Pruebas totales: 18Pruebas incorrectas: 9Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 51.9%Pruebas inestables: 1…Tokens de salida: 1,611Tokens de razonamiento: 0Tiempo de respuesta: promedio 23.34s · total 420.04s · máximo 109.46s
Trucos anti-IA
: 4.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Formato extra: 1Tiempo de respuesta (promedio)36.12sTiempo de respuesta (máximo)109.46sTiempo de respuesta (total)144.50s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)33.40sTiempo de respuesta (máximo)33.40sTiempo de respuesta (total)33.40s
Combinado
: 9.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)34.55sTiempo de respuesta (máximo)34.55sTiempo de respuesta (total)34.55s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)54.04sTiempo de respuesta (máximo)105.46sTiempo de respuesta (total)108.08s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)3.08sTiempo de respuesta (máximo)6.59sTiempo de respuesta (total)9.24s
Inteligencia general
: 4.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)6.06sTiempo de respuesta (máximo)6.06sTiempo de respuesta (total)6.06s
Seguimiento de instrucciones
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)9.47sTiempo de respuesta (máximo)13.43sTiempo de respuesta (total)18.95s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)6.47sTiempo de respuesta (máximo)6.47sTiempo de respuesta (total)6.47s
Pruebas totales: 18Pruebas incorrectas: 9Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 64.8%Pruebas inestables: 6…Tokens de salida: 2,010Tokens de razonamiento: 91,298Tiempo de respuesta: promedio 23.88s · total 262.66s · máximo 121.79s
Trucos anti-IA
: 8.7 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.81sTiempo de respuesta (máximo)5.65sTiempo de respuesta (total)7.62s
Programación
: 2.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)23.58sTiempo de respuesta (máximo)23.58sTiempo de respuesta (total)23.58s
Combinado
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)37.64sTiempo de respuesta (máximo)37.64sTiempo de respuesta (total)37.64s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)6.63sTiempo de respuesta (máximo)6.63sTiempo de respuesta (total)6.63s
Específico del dominio
: 5.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Tiempo agotado: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)121.79sTiempo de respuesta (máximo)121.79sTiempo de respuesta (total)121.79s
Inteligencia general
: 4.2 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)16.25sTiempo de respuesta (máximo)16.25sTiempo de respuesta (total)16.25s
Seguimiento de instrucciones
: 6.6 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)5.30sTiempo de respuesta (máximo)5.30sTiempo de respuesta (total)5.30s
Llamada de herramientas
: 2.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Sin respuesta: 1Tiempo de respuesta (promedio)27.71sTiempo de respuesta (máximo)27.71sTiempo de respuesta (total)27.71s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 9Tiempo de respuesta (promedio)4.23sTiempo de respuesta (máximo)11.07sTiempo de respuesta (total)46.51s…
Pruebas totales: 18Pruebas incorrectas: 9Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 51.9%Pruebas inestables: 1…Tokens de salida: 1,959Tokens de razonamiento: 0Tiempo de respuesta: promedio 4.23s · total 46.51s · máximo 11.07s
Trucos anti-IA
: 4.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)2.37sTiempo de respuesta (máximo)3.39sTiempo de respuesta (total)4.75s
Programación
: 5.6 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)8.84sTiempo de respuesta (máximo)8.84sTiempo de respuesta (total)8.84s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)4.98sTiempo de respuesta (máximo)4.98sTiempo de respuesta (total)4.98s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)5.78sTiempo de respuesta (máximo)5.78sTiempo de respuesta (total)5.78s
Específico del dominio
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)2.24sTiempo de respuesta (máximo)2.24sTiempo de respuesta (total)2.24s
Inteligencia general
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.27sTiempo de respuesta (máximo)3.27sTiempo de respuesta (total)3.27s
Seguimiento de instrucciones
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.48sTiempo de respuesta (máximo)1.48sTiempo de respuesta (total)1.48s
Resolución de acertijos
: 7.7 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.05sTiempo de respuesta (máximo)2.08sTiempo de respuesta (total)4.10s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)11.07sTiempo de respuesta (máximo)11.07sTiempo de respuesta (total)11.07s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 6No siguió las instrucciones: 4Tiempo de respuesta (promedio)2.21sTiempo de respuesta (máximo)14.63sTiempo de respuesta (total)37.51s…
Pruebas totales: 18Pruebas incorrectas: 10Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 53.7%Pruebas inestables: 3…Tokens de salida: 3,972Tokens de razonamiento: 48,333Tiempo de respuesta: promedio 2.21s · total 37.51s · máximo 14.63s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.53sTiempo de respuesta (máximo)1.53sTiempo de respuesta (total)1.53s
Combinado
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.28sTiempo de respuesta (máximo)3.28sTiempo de respuesta (total)3.28s
Análisis y extracción de datos
: 7.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.11sTiempo de respuesta (máximo)1.47sTiempo de respuesta (total)2.21s
Específico del dominio
: 2.9 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)6.48sTiempo de respuesta (máximo)14.63sTiempo de respuesta (total)19.43s
Inteligencia general
: 4.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)821msTiempo de respuesta (máximo)821msTiempo de respuesta (total)821ms
Seguimiento de instrucciones
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.07sTiempo de respuesta (máximo)1.07sTiempo de respuesta (total)1.07s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.89sTiempo de respuesta (máximo)1.89sTiempo de respuesta (total)1.89s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 8No siguió las instrucciones: 2Tiempo de respuesta (promedio)1.99sTiempo de respuesta (máximo)6.81sTiempo de respuesta (total)35.81s…
Pruebas totales: 18Pruebas incorrectas: 10Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 44.4%Pruebas inestables: 0…Tokens de salida: 868Tokens de razonamiento: 0Tiempo de respuesta: promedio 1.99s · total 35.81s · máximo 6.81s
Trucos anti-IA
: 4.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)1.10sTiempo de respuesta (máximo)2.08sTiempo de respuesta (total)4.39s
Programación
: 6.6 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.72sTiempo de respuesta (máximo)1.72sTiempo de respuesta (total)1.72s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.47sTiempo de respuesta (máximo)2.47sTiempo de respuesta (total)2.47s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.69sTiempo de respuesta (máximo)2.46sTiempo de respuesta (total)3.38s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)1.14sTiempo de respuesta (máximo)1.63sTiempo de respuesta (total)3.41s
Inteligencia general
: 4.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)1.19sTiempo de respuesta (máximo)1.19sTiempo de respuesta (total)1.19s
Seguimiento de instrucciones
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)4.18sTiempo de respuesta (máximo)6.81sTiempo de respuesta (total)8.36s
Resolución de acertijos
: 8.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.71sTiempo de respuesta (máximo)5.96sTiempo de respuesta (total)8.14s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.76sTiempo de respuesta (máximo)2.76sTiempo de respuesta (total)2.76s
Pruebas totales: 18Pruebas incorrectas: 11Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 57.4%Pruebas inestables: 6…Tokens de salida: 299,034Tokens de razonamiento: 309,670Tiempo de respuesta: promedio 9.80s · total 156.75s · máximo 35.28s
Trucos anti-IA
: 6.9 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Formato extra: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.46sTiempo de respuesta (máximo)4.38sTiempo de respuesta (total)13.86s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)27.11sTiempo de respuesta (máximo)27.11sTiempo de respuesta (total)27.11s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0ms
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)5.54sTiempo de respuesta (máximo)7.51sTiempo de respuesta (total)11.08s
Específico del dominio
: 2.9 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Formato extra: 1Tiempo de respuesta (promedio)24.67sTiempo de respuesta (máximo)35.28sTiempo de respuesta (total)74.02s
Inteligencia general
: 5.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)6.40sTiempo de respuesta (máximo)6.40sTiempo de respuesta (total)6.40s
Seguimiento de instrucciones
: 8.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)4.63sTiempo de respuesta (máximo)5.46sTiempo de respuesta (total)9.26s
Resolución de acertijos
: 7.2 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 2Tiempo de respuesta (promedio)5.01sTiempo de respuesta (máximo)5.49sTiempo de respuesta (total)15.03s
Llamada de herramientas
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0ms
Pruebas totales: 18Pruebas incorrectas: 11Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 59.3%Pruebas inestables: 8…Tokens de salida: 4,980Tokens de razonamiento: 156,288Tiempo de respuesta: promedio 44.13s · total 485.47s · máximo 204.02s
Trucos anti-IA
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)25.50sTiempo de respuesta (máximo)37.73sTiempo de respuesta (total)51.00s
Programación
: 6.7 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)40.73sTiempo de respuesta (máximo)40.73sTiempo de respuesta (total)40.73s
Combinado
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)65.96sTiempo de respuesta (máximo)65.96sTiempo de respuesta (total)65.96s
Análisis y extracción de datos
: 3.7 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)21.42sTiempo de respuesta (máximo)21.42sTiempo de respuesta (total)21.42s
Específico del dominio
: 5.2 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Tiempo agotado: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)204.02sTiempo de respuesta (máximo)204.02sTiempo de respuesta (total)204.02s
Inteligencia general
: 4.1 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)17.51sTiempo de respuesta (máximo)17.51sTiempo de respuesta (total)17.51s
Seguimiento de instrucciones
: 8.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)11.90sTiempo de respuesta (máximo)11.90sTiempo de respuesta (total)11.90s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)33.30sTiempo de respuesta (máximo)33.30sTiempo de respuesta (total)33.30s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 8No siguió las instrucciones: 2Tiempo de respuesta (promedio)3.10sTiempo de respuesta (máximo)6.51sTiempo de respuesta (total)55.87s…
Pruebas totales: 18Pruebas incorrectas: 10Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 44.4%Pruebas inestables: 0…Tokens de salida: 1,724Tokens de razonamiento: 0Tiempo de respuesta: promedio 3.10s · total 55.87s · máximo 6.51s
Trucos anti-IA
: 4.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)3.13sTiempo de respuesta (máximo)5.90sTiempo de respuesta (total)12.50s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)5.30sTiempo de respuesta (máximo)5.30sTiempo de respuesta (total)5.30s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)6.51sTiempo de respuesta (máximo)6.51sTiempo de respuesta (total)6.51s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.81sTiempo de respuesta (máximo)5.69sTiempo de respuesta (total)7.62s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)2.09sTiempo de respuesta (máximo)2.39sTiempo de respuesta (total)6.26s
Inteligencia general
: 4.6 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.22sTiempo de respuesta (máximo)2.22sTiempo de respuesta (total)2.22s
Seguimiento de instrucciones
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.97sTiempo de respuesta (máximo)2.43sTiempo de respuesta (total)3.93s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.86sTiempo de respuesta (máximo)4.86sTiempo de respuesta (total)4.86s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 9No siguió las instrucciones: 1Tiempo de respuesta (promedio)3.25sTiempo de respuesta (máximo)13.73sTiempo de respuesta (total)58.44s…
Pruebas totales: 18Pruebas incorrectas: 10Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 46.3%Pruebas inestables: 1…Tokens de salida: 4,266Tokens de razonamiento: 0Tiempo de respuesta: promedio 3.25s · total 58.44s · máximo 13.73s
Trucos anti-IA
: 3.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)1.32sTiempo de respuesta (máximo)3.89sTiempo de respuesta (total)5.30s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.29sTiempo de respuesta (máximo)1.29sTiempo de respuesta (total)1.29s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)6.22sTiempo de respuesta (máximo)6.22sTiempo de respuesta (total)6.22s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.57sTiempo de respuesta (máximo)1.83sTiempo de respuesta (total)3.14s
Específico del dominio
: 7.7 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)905msTiempo de respuesta (máximo)1.10sTiempo de respuesta (total)2.71s
Inteligencia general
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)803msTiempo de respuesta (máximo)803msTiempo de respuesta (total)803ms
Seguimiento de instrucciones
: 6.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)8.81sTiempo de respuesta (máximo)13.73sTiempo de respuesta (total)17.61s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.67sTiempo de respuesta (máximo)3.67sTiempo de respuesta (total)3.67s
Pruebas totales: 18Pruebas incorrectas: 11Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 48.2%Pruebas inestables: 3…Tokens de salida: 1,783Tokens de razonamiento: 0Tiempo de respuesta: promedio 6.59s · total 118.61s · máximo 57.10s
Trucos anti-IA
: 8.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.28sTiempo de respuesta (máximo)2.09sTiempo de respuesta (total)5.13s
Programación
: 4.7 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Tiempo agotado: 1Tiempo de respuesta (promedio)7.07sTiempo de respuesta (máximo)7.07sTiempo de respuesta (total)7.07s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)30.53sTiempo de respuesta (máximo)30.53sTiempo de respuesta (total)30.53s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.70sTiempo de respuesta (máximo)2.21sTiempo de respuesta (total)3.41s
Específico del dominio
: 3.6 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)2.49sTiempo de respuesta (máximo)4.23sTiempo de respuesta (total)7.48s
Inteligencia general
: 4.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)3.54sTiempo de respuesta (máximo)3.54sTiempo de respuesta (total)3.54s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)57.10sTiempo de respuesta (máximo)57.10sTiempo de respuesta (total)57.10s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 10Tiempo de respuesta (promedio)2.53sTiempo de respuesta (máximo)6.70sTiempo de respuesta (total)45.46s…
Pruebas totales: 18Pruebas incorrectas: 10Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 55.6%Pruebas inestables: 5…Tokens de salida: 3,129Tokens de razonamiento: 0Tiempo de respuesta: promedio 2.53s · total 45.46s · máximo 6.70s
Trucos anti-IA
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)2.43sTiempo de respuesta (máximo)6.70sTiempo de respuesta (total)9.73s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.61sTiempo de respuesta (máximo)4.61sTiempo de respuesta (total)4.61s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)6.59sTiempo de respuesta (máximo)6.59sTiempo de respuesta (total)6.59s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.82sTiempo de respuesta (máximo)1.97sTiempo de respuesta (total)3.63s
Específico del dominio
: 3.6 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)1.33sTiempo de respuesta (máximo)1.53sTiempo de respuesta (total)4.00s
Inteligencia general
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.45sTiempo de respuesta (máximo)3.45sTiempo de respuesta (total)3.45s
Seguimiento de instrucciones
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.06sTiempo de respuesta (máximo)1.09sTiempo de respuesta (total)2.12s
Resolución de acertijos
: 5.2 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)2.46sTiempo de respuesta (máximo)4.23sTiempo de respuesta (total)7.37s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.94sTiempo de respuesta (máximo)3.94sTiempo de respuesta (total)3.94s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 10No siguió las instrucciones: 1Tiempo de respuesta (promedio)903msTiempo de respuesta (máximo)4.39sTiempo de respuesta (total)16.26s…
Pruebas totales: 18Pruebas incorrectas: 11Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 44.4%Pruebas inestables: 2…Tokens de salida: 1,726Tokens de razonamiento: 0Tiempo de respuesta: promedio 903ms · total 16.26s · máximo 4.39s
Trucos anti-IA
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)582msTiempo de respuesta (máximo)844msTiempo de respuesta (total)2.33s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.16sTiempo de respuesta (máximo)1.16sTiempo de respuesta (total)1.16s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)4.39sTiempo de respuesta (máximo)4.39sTiempo de respuesta (total)4.39s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)652msTiempo de respuesta (máximo)660msTiempo de respuesta (total)1.30s
Específico del dominio
: 5.9 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)495msTiempo de respuesta (máximo)642msTiempo de respuesta (total)1.49s
Inteligencia general
: 5.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)615msTiempo de respuesta (máximo)615msTiempo de respuesta (total)615ms
Seguimiento de instrucciones
: 8.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)672msTiempo de respuesta (máximo)785msTiempo de respuesta (total)1.34s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.91sTiempo de respuesta (máximo)1.91sTiempo de respuesta (total)1.91s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 9No siguió las instrucciones: 2Tiempo de respuesta (promedio)3.82sTiempo de respuesta (máximo)47.43sTiempo de respuesta (total)68.74s…
Pruebas totales: 18Pruebas incorrectas: 11Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 50.0%Pruebas inestables: 3…Tokens de salida: 4,300Tokens de razonamiento: 0Tiempo de respuesta: promedio 3.82s · total 68.74s · máximo 47.43s
Trucos anti-IA
: 3.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)1.43sTiempo de respuesta (máximo)4.39sTiempo de respuesta (total)5.71s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.67sTiempo de respuesta (máximo)2.67sTiempo de respuesta (total)2.67s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)47.43sTiempo de respuesta (máximo)47.43sTiempo de respuesta (total)47.43s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.16sTiempo de respuesta (máximo)1.42sTiempo de respuesta (total)2.33s
Específico del dominio
: 7.7 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)485msTiempo de respuesta (máximo)549msTiempo de respuesta (total)1.45s
Inteligencia general
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)1.19sTiempo de respuesta (máximo)1.19sTiempo de respuesta (total)1.19s
Seguimiento de instrucciones
: 6.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)809msTiempo de respuesta (máximo)983msTiempo de respuesta (total)1.62s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.30sTiempo de respuesta (máximo)2.30sTiempo de respuesta (total)2.30s
Pruebas totales: 18Pruebas incorrectas: 11Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 46.3%Pruebas inestables: 3…Tokens de salida: 8,378Tokens de razonamiento: 0Tiempo de respuesta: promedio 12.07s · total 217.28s · máximo 115.89s
Trucos anti-IA
: 3.2 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Formato extra: 2Respuesta incorrecta: 2Tiempo de respuesta (promedio)7.63sTiempo de respuesta (máximo)12.26sTiempo de respuesta (total)30.54s
Programación
: 2.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)7.63sTiempo de respuesta (máximo)7.63sTiempo de respuesta (total)7.63s
Combinado
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Tiempo de respuesta (promedio)115.89sTiempo de respuesta (máximo)115.89sTiempo de respuesta (total)115.89s
Análisis y extracción de datos
: 6.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)9.42sTiempo de respuesta (máximo)16.20sTiempo de respuesta (total)18.84s
Específico del dominio
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)1.52sTiempo de respuesta (máximo)1.77sTiempo de respuesta (total)4.55s
Inteligencia general
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.86sTiempo de respuesta (máximo)2.86sTiempo de respuesta (total)2.86s
Seguimiento de instrucciones
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.52sTiempo de respuesta (máximo)1.99sTiempo de respuesta (total)3.04s
Resolución de acertijos
: 8.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)7.37sTiempo de respuesta (máximo)10.78sTiempo de respuesta (total)22.10s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)11.85sTiempo de respuesta (máximo)11.85sTiempo de respuesta (total)11.85s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 9No siguió las instrucciones: 2Tiempo de respuesta (promedio)2.39sTiempo de respuesta (máximo)6.58sTiempo de respuesta (total)43.06s…
Pruebas totales: 18Pruebas incorrectas: 11Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 48.2%Pruebas inestables: 3…Tokens de salida: 2,320Tokens de razonamiento: 0Tiempo de respuesta: promedio 2.39s · total 43.06s · máximo 6.58s
Trucos anti-IA
: 3.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)1.80sTiempo de respuesta (máximo)2.62sTiempo de respuesta (total)7.19s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.82sTiempo de respuesta (máximo)3.82sTiempo de respuesta (total)3.82s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)6.58sTiempo de respuesta (máximo)6.58sTiempo de respuesta (total)6.58s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.39sTiempo de respuesta (máximo)1.42sTiempo de respuesta (total)2.78s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)1.78sTiempo de respuesta (máximo)2.49sTiempo de respuesta (total)5.34s
Inteligencia general
: 4.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.44sTiempo de respuesta (máximo)2.44sTiempo de respuesta (total)2.44s
Seguimiento de instrucciones
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.51sTiempo de respuesta (máximo)2.95sTiempo de respuesta (total)5.02s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.39sTiempo de respuesta (máximo)4.39sTiempo de respuesta (total)4.39s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 10No siguió las instrucciones: 1Tiempo de respuesta (promedio)1.51sTiempo de respuesta (máximo)2.95sTiempo de respuesta (total)27.21s…
Pruebas totales: 18Pruebas incorrectas: 11Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 42.6%Pruebas inestables: 2…Tokens de salida: 2,317Tokens de razonamiento: 0Tiempo de respuesta: promedio 1.51s · total 27.21s · máximo 2.95s
Trucos anti-IA
: 3.2 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)1.21sTiempo de respuesta (máximo)2.58sTiempo de respuesta (total)4.85s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.95sTiempo de respuesta (máximo)2.95sTiempo de respuesta (total)2.95s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.89sTiempo de respuesta (máximo)2.89sTiempo de respuesta (total)2.89s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.04sTiempo de respuesta (máximo)1.06sTiempo de respuesta (total)2.08s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)1.07sTiempo de respuesta (máximo)1.54sTiempo de respuesta (total)3.22s
Inteligencia general
: 4.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.78sTiempo de respuesta (máximo)1.78sTiempo de respuesta (total)1.78s
Seguimiento de instrucciones
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.07sTiempo de respuesta (máximo)1.17sTiempo de respuesta (total)2.15s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.75sTiempo de respuesta (máximo)2.75sTiempo de respuesta (total)2.75s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 10No siguió las instrucciones: 2Tiempo de respuesta (promedio)1.74sTiempo de respuesta (máximo)9.39sTiempo de respuesta (total)31.32s…
Pruebas totales: 18Pruebas incorrectas: 12Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 38.9%Pruebas inestables: 2…Tokens de salida: 3,545Tokens de razonamiento: 0Tiempo de respuesta: promedio 1.74s · total 31.32s · máximo 9.39s
Trucos anti-IA
: 4.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)788msTiempo de respuesta (máximo)1.34sTiempo de respuesta (total)3.15s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.51sTiempo de respuesta (máximo)2.51sTiempo de respuesta (total)2.51s
Combinado
: 2.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)9.39sTiempo de respuesta (máximo)9.39sTiempo de respuesta (total)9.39s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.43sTiempo de respuesta (máximo)1.45sTiempo de respuesta (total)2.86s
Específico del dominio
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)540msTiempo de respuesta (máximo)649msTiempo de respuesta (total)1.62s
Inteligencia general
: 5.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.51sTiempo de respuesta (máximo)2.51sTiempo de respuesta (total)2.51s
Seguimiento de instrucciones
: 4.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)815msTiempo de respuesta (máximo)973msTiempo de respuesta (total)1.63s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.54sTiempo de respuesta (máximo)3.54sTiempo de respuesta (total)3.54s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 7No siguió las instrucciones: 4Tiempo de respuesta (promedio)16.08sTiempo de respuesta (máximo)50.92sTiempo de respuesta (total)176.88s…
Pruebas totales: 18Pruebas incorrectas: 11Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 51.9%Pruebas inestables: 6…Tokens de salida: 13,493Tokens de razonamiento: 36,879Tiempo de respuesta: promedio 16.08s · total 176.88s · máximo 50.92s
Programación
: 4.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)26.33sTiempo de respuesta (máximo)26.33sTiempo de respuesta (total)26.33s
Combinado
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)31.18sTiempo de respuesta (máximo)31.18sTiempo de respuesta (total)31.18s
Análisis y extracción de datos
: 6.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.98sTiempo de respuesta (máximo)1.98sTiempo de respuesta (total)1.98s
Específico del dominio
: 2.9 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)50.92sTiempo de respuesta (máximo)50.92sTiempo de respuesta (total)50.92s
Inteligencia general
: 4.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)7.90sTiempo de respuesta (máximo)7.90sTiempo de respuesta (total)7.90s
Seguimiento de instrucciones
: 9.9 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)7.63sTiempo de respuesta (máximo)7.63sTiempo de respuesta (total)7.63s
Llamada de herramientas
: 9.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)6.91sTiempo de respuesta (máximo)6.91sTiempo de respuesta (total)6.91s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 8No siguió las instrucciones: 3Tiempo de respuesta (promedio)2.05sTiempo de respuesta (máximo)6.65sTiempo de respuesta (total)36.93s…
Pruebas totales: 18Pruebas incorrectas: 11Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 42.6%Pruebas inestables: 2…Tokens de salida: 2,973Tokens de razonamiento: 0Tiempo de respuesta: promedio 2.05s · total 36.93s · máximo 6.65s
Trucos anti-IA
: 4.6 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)1.39sTiempo de respuesta (máximo)2.96sTiempo de respuesta (total)5.56s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)6.65sTiempo de respuesta (máximo)6.65sTiempo de respuesta (total)6.65s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.38sTiempo de respuesta (máximo)3.38sTiempo de respuesta (total)3.38s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.32sTiempo de respuesta (máximo)1.39sTiempo de respuesta (total)2.64s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)1.48sTiempo de respuesta (máximo)1.85sTiempo de respuesta (total)4.45s
Inteligencia general
: 5.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)1.55sTiempo de respuesta (máximo)1.55sTiempo de respuesta (total)1.55s
Seguimiento de instrucciones
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.64sTiempo de respuesta (máximo)1.80sTiempo de respuesta (total)3.28s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.46sTiempo de respuesta (máximo)4.46sTiempo de respuesta (total)4.46s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 10No siguió las instrucciones: 2Tiempo de respuesta (promedio)1.51sTiempo de respuesta (máximo)3.54sTiempo de respuesta (total)27.21s…
Pruebas totales: 18Pruebas incorrectas: 12Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 46.3%Pruebas inestables: 4…Tokens de salida: 2,451Tokens de razonamiento: 0Tiempo de respuesta: promedio 1.51s · total 27.21s · máximo 3.54s
Trucos anti-IA
: 2.9 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)1.29sTiempo de respuesta (máximo)2.83sTiempo de respuesta (total)5.18s
Programación
: 6.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.39sTiempo de respuesta (máximo)2.39sTiempo de respuesta (total)2.39s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)3.54sTiempo de respuesta (máximo)3.54sTiempo de respuesta (total)3.54s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.32sTiempo de respuesta (máximo)1.42sTiempo de respuesta (total)2.64s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)877msTiempo de respuesta (máximo)904msTiempo de respuesta (total)2.63s
Inteligencia general
: 4.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.53sTiempo de respuesta (máximo)1.53sTiempo de respuesta (total)1.53s
Seguimiento de instrucciones
: 6.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.03sTiempo de respuesta (máximo)1.10sTiempo de respuesta (total)2.06s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.30sTiempo de respuesta (máximo)3.30sTiempo de respuesta (total)3.30s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 11No siguió las instrucciones: 1Tiempo de respuesta (promedio)3.69sTiempo de respuesta (máximo)46.00sTiempo de respuesta (total)66.50s…
Pruebas totales: 18Pruebas incorrectas: 12Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 38.9%Pruebas inestables: 2…Tokens de salida: 3,341Tokens de razonamiento: 0Tiempo de respuesta: promedio 3.69s · total 66.50s · máximo 46.00s
Trucos anti-IA
: 4.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)1.59sTiempo de respuesta (máximo)3.60sTiempo de respuesta (total)6.38s
Programación
: 4.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.44sTiempo de respuesta (máximo)3.44sTiempo de respuesta (total)3.44s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)46.00sTiempo de respuesta (máximo)46.00sTiempo de respuesta (total)46.00s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.01sTiempo de respuesta (máximo)1.06sTiempo de respuesta (total)2.02s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)465msTiempo de respuesta (máximo)492msTiempo de respuesta (total)1.39s
Inteligencia general
: 5.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)1.12sTiempo de respuesta (máximo)1.12sTiempo de respuesta (total)1.12s
Seguimiento de instrucciones
: 4.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)585msTiempo de respuesta (máximo)715msTiempo de respuesta (total)1.17s
Resolución de acertijos
: 5.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)982msTiempo de respuesta (máximo)1.36sTiempo de respuesta (total)2.95s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.04sTiempo de respuesta (máximo)2.04sTiempo de respuesta (total)2.04s
Pruebas totales: 18Pruebas incorrectas: 13Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 57.4%Pruebas inestables: 10…Tokens de salida: 107,044Tokens de razonamiento: 206,422Tiempo de respuesta: promedio 39.65s · total 396.47s · máximo 237.27s
Trucos anti-IA
: 7.9 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo agotado: 1Tiempo de respuesta (promedio)20.82sTiempo de respuesta (máximo)32.42sTiempo de respuesta (total)41.63s
Programación
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Tiempo agotado: 1Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0ms
Combinado
: 4.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Tiempo de respuesta (promedio)60.39sTiempo de respuesta (máximo)60.39sTiempo de respuesta (total)60.39s
Análisis y extracción de datos
: 4.6 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)7.48sTiempo de respuesta (máximo)7.48sTiempo de respuesta (total)7.48s
Específico del dominio
: 2.9 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo agotado: 1Tiempo de respuesta (promedio)237.27sTiempo de respuesta (máximo)237.27sTiempo de respuesta (total)237.27s
Inteligencia general
: 3.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)6.63sTiempo de respuesta (máximo)6.63sTiempo de respuesta (total)6.63s
Seguimiento de instrucciones
: 8.1 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)4.64sTiempo de respuesta (máximo)4.64sTiempo de respuesta (total)4.64s
Resolución de acertijos
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Tiempo agotado: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)11.54sTiempo de respuesta (máximo)17.37sTiempo de respuesta (total)23.08s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)15.35sTiempo de respuesta (máximo)15.35sTiempo de respuesta (total)15.35s
Pruebas totales: 18Pruebas incorrectas: 12Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 46.3%Pruebas inestables: 4…Tokens de salida: 2,278Tokens de razonamiento: 0Tiempo de respuesta: promedio 4.58s · total 77.92s · máximo 15.17s
Trucos anti-IA
: 3.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)3.81sTiempo de respuesta (máximo)6.85sTiempo de respuesta (total)15.23s
Programación
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0ms
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)15.17sTiempo de respuesta (máximo)15.17sTiempo de respuesta (total)15.17s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)8.49sTiempo de respuesta (máximo)14.02sTiempo de respuesta (total)16.98s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)2.33sTiempo de respuesta (máximo)2.94sTiempo de respuesta (total)6.99s
Inteligencia general
: 6.1 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.71sTiempo de respuesta (máximo)2.71sTiempo de respuesta (total)2.71s
Seguimiento de instrucciones
: 6.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.82sTiempo de respuesta (máximo)2.92sTiempo de respuesta (total)5.65s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)6.02sTiempo de respuesta (máximo)6.02sTiempo de respuesta (total)6.02s
Pruebas totales: 18Pruebas incorrectas: 13Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 50.0%Pruebas inestables: 7…Tokens de salida: 15,084Tokens de razonamiento: 39,408Tiempo de respuesta: promedio 5.64s · total 101.52s · máximo 30.49s
Trucos anti-IA
: 5.6 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)2.67sTiempo de respuesta (máximo)5.03sTiempo de respuesta (total)10.66s
Programación
: 6.7 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)30.49sTiempo de respuesta (máximo)30.49sTiempo de respuesta (total)30.49s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)25.25sTiempo de respuesta (máximo)25.25sTiempo de respuesta (total)25.25s
Análisis y extracción de datos
: 7.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Tiempo de respuesta (promedio)1.23sTiempo de respuesta (máximo)1.96sTiempo de respuesta (total)2.46s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Error de API: 1Respuesta incorrecta: 1Tiempo de respuesta (promedio)6.11sTiempo de respuesta (máximo)13.72sTiempo de respuesta (total)18.34s
Inteligencia general
: 4.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.05sTiempo de respuesta (máximo)2.05sTiempo de respuesta (total)2.05s
Seguimiento de instrucciones
: 7.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.38sTiempo de respuesta (máximo)1.61sTiempo de respuesta (total)2.75s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.50sTiempo de respuesta (máximo)3.50sTiempo de respuesta (total)3.50s
Pruebas totales: 18Pruebas incorrectas: 13Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 37.0%Pruebas inestables: 3…Tokens de salida: 2,489Tokens de razonamiento: 0Tiempo de respuesta: promedio 3.35s · total 36.90s · máximo 7.05s
Trucos anti-IA
: 5.2 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)5.51sTiempo de respuesta (máximo)6.59sTiempo de respuesta (total)11.02s
Programación
: 6.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)5.57sTiempo de respuesta (máximo)5.57sTiempo de respuesta (total)5.57s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Tiempo de respuesta (promedio)3.22sTiempo de respuesta (máximo)3.22sTiempo de respuesta (total)3.22s
Análisis y extracción de datos
: 7.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)4.82sTiempo de respuesta (máximo)4.82sTiempo de respuesta (total)4.82s
Específico del dominio
: 7.7 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)744msTiempo de respuesta (máximo)744msTiempo de respuesta (total)744ms
Inteligencia general
: 4.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)1.59sTiempo de respuesta (máximo)1.59sTiempo de respuesta (total)1.59s
Seguimiento de instrucciones
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)888msTiempo de respuesta (máximo)888msTiempo de respuesta (total)888ms
Llamada de herramientas
: 2.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)7.05sTiempo de respuesta (máximo)7.05sTiempo de respuesta (total)7.05s
Pruebas totales: 18Pruebas incorrectas: 13Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 37.0%Pruebas inestables: 4…Tokens de salida: 3,720Tokens de razonamiento: 0Tiempo de respuesta: promedio 4.33s · total 78.02s · máximo 32.57s
Trucos anti-IA
: 4.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)2.11sTiempo de respuesta (máximo)3.94sTiempo de respuesta (total)8.46s
Programación
: 5.1 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)9.79sTiempo de respuesta (máximo)9.79sTiempo de respuesta (total)9.79s
Combinado
: 2.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Tiempo de respuesta (promedio)32.57sTiempo de respuesta (máximo)32.57sTiempo de respuesta (total)32.57s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)1.08sTiempo de respuesta (máximo)1.62sTiempo de respuesta (total)2.15s
Específico del dominio
: 2.9 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)1.99sTiempo de respuesta (máximo)3.99sTiempo de respuesta (total)5.98s
Inteligencia general
: 5.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)790msTiempo de respuesta (máximo)790msTiempo de respuesta (total)790ms
Seguimiento de instrucciones
: 8.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)1.58sTiempo de respuesta (máximo)1.69sTiempo de respuesta (total)3.17s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)10.68sTiempo de respuesta (máximo)10.68sTiempo de respuesta (total)10.68s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 12Tiempo de respuesta (promedio)13.37sTiempo de respuesta (máximo)42.13sTiempo de respuesta (total)147.05s…
Pruebas totales: 18Pruebas incorrectas: 12Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 40.7%Pruebas inestables: 3…Tokens de salida: 2,659Tokens de razonamiento: 0Tiempo de respuesta: promedio 13.37s · total 147.05s · máximo 42.13s
Trucos anti-IA
: 3.6 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)6.24sTiempo de respuesta (máximo)11.38sTiempo de respuesta (total)12.48s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)38.78sTiempo de respuesta (máximo)38.78sTiempo de respuesta (total)38.78s
Combinado
: 2.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)19.16sTiempo de respuesta (máximo)19.16sTiempo de respuesta (total)19.16s
Análisis y extracción de datos
: 7.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)42.13sTiempo de respuesta (máximo)42.13sTiempo de respuesta (total)42.13s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)4.38sTiempo de respuesta (máximo)4.38sTiempo de respuesta (total)4.38s
Inteligencia general
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.00sTiempo de respuesta (máximo)4.00sTiempo de respuesta (total)4.00s
Seguimiento de instrucciones
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.67sTiempo de respuesta (máximo)2.67sTiempo de respuesta (total)2.67s
Resolución de acertijos
: 3.1 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)4.73sTiempo de respuesta (máximo)7.81sTiempo de respuesta (total)9.45s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)13.99sTiempo de respuesta (máximo)13.99sTiempo de respuesta (total)13.99s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 10No siguió las instrucciones: 2Tiempo de respuesta (promedio)2.94sTiempo de respuesta (máximo)8.21sTiempo de respuesta (total)52.98s…
Pruebas totales: 18Pruebas incorrectas: 12Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 37.0%Pruebas inestables: 2…Tokens de salida: 1,775Tokens de razonamiento: 0Tiempo de respuesta: promedio 2.94s · total 52.98s · máximo 8.21s
Trucos anti-IA
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)2.84sTiempo de respuesta (máximo)4.15sTiempo de respuesta (total)11.35s
Programación
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.93sTiempo de respuesta (máximo)3.93sTiempo de respuesta (total)3.93s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)4.89sTiempo de respuesta (máximo)4.89sTiempo de respuesta (total)4.89s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.47sTiempo de respuesta (máximo)2.48sTiempo de respuesta (total)4.95s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)1.97sTiempo de respuesta (máximo)2.65sTiempo de respuesta (total)5.92s
Inteligencia general
: 4.2 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.18sTiempo de respuesta (máximo)2.18sTiempo de respuesta (total)2.18s
Seguimiento de instrucciones
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.13sTiempo de respuesta (máximo)2.53sTiempo de respuesta (total)4.27s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)8.21sTiempo de respuesta (máximo)8.21sTiempo de respuesta (total)8.21s
Pruebas totales: 18Pruebas incorrectas: 12Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 35.2%Pruebas inestables: 1…Tokens de salida: 3,338Tokens de razonamiento: 0Tiempo de respuesta: promedio 11.33s · total 203.88s · máximo 35.34s
Trucos anti-IA
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)12.30sTiempo de respuesta (máximo)16.60sTiempo de respuesta (total)49.20s
Programación
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)11.21sTiempo de respuesta (máximo)11.21sTiempo de respuesta (total)11.21s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Tiempo de respuesta (promedio)35.34sTiempo de respuesta (máximo)35.34sTiempo de respuesta (total)35.34s
Análisis y extracción de datos
: 6.5 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)8.48sTiempo de respuesta (máximo)12.71sTiempo de respuesta (total)16.96s
Específico del dominio
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 3Tiempo de respuesta (promedio)4.94sTiempo de respuesta (máximo)7.65sTiempo de respuesta (total)14.81s
Inteligencia general
: 4.1 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)11.85sTiempo de respuesta (máximo)11.85sTiempo de respuesta (total)11.85s
Seguimiento de instrucciones
: 9.8 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)5.52sTiempo de respuesta (máximo)8.19sTiempo de respuesta (total)11.04s
Llamada de herramientas
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Llamada de herramienta no válida: 1Tiempo de respuesta (promedio)18.80sTiempo de respuesta (máximo)18.80sTiempo de respuesta (total)18.80s
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 11No siguió las instrucciones: 2Tiempo de respuesta (promedio)5.07sTiempo de respuesta (máximo)39.47sTiempo de respuesta (total)91.23s…
Pruebas totales: 18Pruebas incorrectas: 13Fiabilidad: N/DLa telemetría de fiabilidad no está disponible o está incompleta para este modelo.Tasa de aciertos por intento: 29.6%Pruebas inestables: 1…Tokens de salida: 1,985Tokens de razonamiento: 0Tiempo de respuesta: promedio 5.07s · total 91.23s · máximo 39.47s
Trucos anti-IA
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 4Tiempo de respuesta (promedio)3.02sTiempo de respuesta (máximo)8.17sTiempo de respuesta (total)12.07s
Programación
: 6.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)39.47sTiempo de respuesta (máximo)39.47sTiempo de respuesta (total)39.47s
Combinado
: 3.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)8.91sTiempo de respuesta (máximo)8.91sTiempo de respuesta (total)8.91s
Análisis y extracción de datos
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)3.26sTiempo de respuesta (máximo)4.66sTiempo de respuesta (total)6.52s
Específico del dominio
: 5.3 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)877msTiempo de respuesta (máximo)894msTiempo de respuesta (total)2.63s
Inteligencia general
: 4.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)2.86sTiempo de respuesta (máximo)2.86sTiempo de respuesta (total)2.86s
Resolución de acertijos
: 5.4 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)3.30sTiempo de respuesta (máximo)4.81sTiempo de respuesta (total)9.91s
Llamada de herramientas
: 10.0 Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)6.67sTiempo de respuesta (máximo)6.67sTiempo de respuesta (total)6.67s