Claude Opus 4.6 (medium) vs Gemini 2.5 Flash (medium)
Gemini 2.5 Flash (medium) lidera en puntuación media con 7.3 vs 6.3. Gemini 2.5 Flash (medium) tiene menor coste de benchmark con $0.680 vs $2.961. Gemini 2.5 Flash (medium) es más rápido con 20.51s vs 32.23s, con tasas de acierto de 60.9% vs 68.1%.
Benchmarks generados a partir de los suites de prueba de AI BENCHY en:
2026-10-09
Modelos comparados
Rango
#233
Total de tokens de salida
96,722
Tiempo de respuesta (promedio)
32.23s
Costo total
$2.961
Rango
#145
Total de tokens de salida
241,365
Tiempo de respuesta (promedio)
20.51s
Costo total
$0.680
Modelo recomendadoGemini 2.5 Flash (medium)
Tiene la mejor puntuación aquí (7.3) y cuesta aproximadamente 4.4x menos que Claude Opus 4.6 (medium).
Comparación detallada
Métrica
Claude Opus 4.6Claude Opus 4.6mediumModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.Lanzamiento: 2026-02-05
6.3Puntaje promedio en todas las pruebas de benchmark.…
7.3Puntaje promedio en todas las pruebas de benchmark.…
Rango
#233
#145
Fiabilidad
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
10.0Puntuación de éxito en el primer intento: 10.0 significa que no hubo fallos reintentables de la API objetivo ni de límite de tasa antes de llamadas exitosas; los fallos registrados bajan la puntuación.…
Consistencia
8.5La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
9.6La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
Intentos
66/69
69/69
Pruebas correctas
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Formato extra: 4Respuesta incorrecta: 4No siguió las instrucciones: 1Tiempo de respuesta (promedio)32.23sTiempo de respuesta (máximo)151.51sTiempo de respuesta (total)515.65sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 6No siguió las instrucciones: 2Tiempo de respuesta (promedio)20.51sTiempo de respuesta (máximo)140.50sTiempo de respuesta (total)471.64sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
Tasa de aciertos por intento
60.9%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
68.1%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
Pruebas inestables
3Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Ejecuciones totales
66Ejecuciones totales…
69Ejecuciones totales…
Costo por resultado
22.777
4.288
Costo total
$2.961
$0.680
Precio de entrada
$5.000 / 1MPrecio de entrada…
$0.300 / 1MPrecio de entrada…
Precio de salida
$25.000 / 1MPrecio de salida…
$2.500 / 1MPrecio de salida…
Precio de lectura de caché
$0.500 / 1MPrecio de lectura de caché…
$0.030 / 1MPrecio de lectura de caché…
Precio de escritura de caché
$6.250 / 1MPrecio de escritura de caché…
$0.084 / 1MPrecio de escritura de caché…
Total de tokens de entrada
108,573Total de tokens de entrada…
132,507Total de tokens de entrada…
Tokens de salida
69,994Tokens de salida…
12,739Tokens de salida…
Tokens de razonamiento
26,728Tokens de razonamiento…
228,626Tokens de razonamiento…
Tiempo de respuesta (promedio)
32.23sTiempo de respuesta (promedio)…
20.51sTiempo de respuesta (promedio)…
Tiempo de respuesta (máximo)
151.51sTiempo de respuesta (máximo)…
140.50sTiempo de respuesta (máximo)…
Tiempo de respuesta (total)
515.65sTiempo de respuesta (total)…
471.64sTiempo de respuesta (total)…
Parámetros
~5T en total (~500B activos)
~350B en total (~20B activos)
Disponibilidad
Código cerrado
Código cerrado
Los precios de caché se aplican a los tokens de entrada. Las lecturas reutilizan instrucciones guardadas; las escrituras las almacenan y pueden costar más. Los tokens de salida usan el precio de salida.
Generación showcase de modelos
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#233 Claude Opus 4.6
medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Coste
$0.000
Tiempo
300.0s
Tokens
0 tok
#145 Gemini 2.5 Flash
medium
No output was saved. The original provider response or failure reason is unavailable.
Coste
$0.000
Tiempo
274.0s
Tokens
0 tok
Rango
-
Coste
-
Tiempo
-
Tokens
-
Mejores modelos por puntuación
Puntuación vs costo total
Tiempo de respuesta (promedio)
Puntuación vs Tiempo de respuesta (promedio)
Total de tokens de salida
Puntuación vs Total de tokens de salida
Desglose por categoría
Tareas de agentes
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
0.0Puntaje promedio en todas las pruebas de benchmark.…
0.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)0msTiempo de respuesta (máximo)0msTiempo de respuesta (total)0msUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)6.54sTiempo de respuesta (máximo)6.54sTiempo de respuesta (total)6.54sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.54sTiempo de respuesta (promedio)…
0Total de tokens de entrada…
0Tokens de salida…
0Tokens de razonamiento…
Trucos anti-IA
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
6.4Puntaje promedio en todas las pruebas de benchmark.…
5.8La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
2Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Formato extra: 2Tiempo de respuesta (promedio)7.45sTiempo de respuesta (máximo)11.88sTiempo de respuesta (total)14.90sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
8.4Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
75.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)6.30sTiempo de respuesta (máximo)15.56sTiempo de respuesta (total)25.21sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.30sTiempo de respuesta (promedio)…
492Total de tokens de entrada…
255Tokens de salida…
10,233Tokens de razonamiento…
Programación
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
5.7Puntaje promedio en todas las pruebas de benchmark.…
7.1La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
44.4%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Formato extra: 1No siguió las instrucciones: 1Tiempo de respuesta (promedio)30.10sTiempo de respuesta (máximo)35.63sTiempo de respuesta (total)90.31sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.8Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)41.01sTiempo de respuesta (máximo)92.88sTiempo de respuesta (total)123.04sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
41.01sTiempo de respuesta (promedio)…
6,669Total de tokens de entrada…
543Tokens de salida…
32,303Tokens de razonamiento…
Combinado
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)114.08sTiempo de respuesta (máximo)151.51sTiempo de respuesta (total)228.16sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)84.47sTiempo de respuesta (máximo)140.50sTiempo de respuesta (total)168.94sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
84.47sTiempo de respuesta (promedio)…
110,544Total de tokens de entrada…
11,112Tokens de salida…
95,241Tokens de razonamiento…
Análisis y extracción de datos
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)7.37sTiempo de respuesta (máximo)7.37sTiempo de respuesta (total)7.37sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)4.06sTiempo de respuesta (máximo)5.06sTiempo de respuesta (total)8.11sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.06sTiempo de respuesta (promedio)…
7,257Total de tokens de entrada…
279Tokens de salida…
2,325Tokens de razonamiento…
Específico del dominio
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Formato extra: 1Tiempo de respuesta (promedio)42.53sTiempo de respuesta (máximo)83.40sTiempo de respuesta (total)85.06sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
5.9Puntaje promedio en todas las pruebas de benchmark.…
7.2La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
55.6%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
1Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 2Tiempo de respuesta (promedio)37.07sTiempo de respuesta (máximo)95.48sTiempo de respuesta (total)111.22sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
37.07sTiempo de respuesta (promedio)…
642Total de tokens de entrada…
18Tokens de salida…
80,864Tokens de razonamiento…
Inteligencia general
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)5.04sTiempo de respuesta (máximo)5.04sTiempo de respuesta (total)5.04sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.8Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No siguió las instrucciones: 1Tiempo de respuesta (promedio)4.86sTiempo de respuesta (máximo)4.86sTiempo de respuesta (total)4.86sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
4.86sTiempo de respuesta (promedio)…
486Total de tokens de entrada…
92Tokens de salida…
1,899Tokens de razonamiento…
Seguimiento de instrucciones
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.43sTiempo de respuesta (máximo)2.43sTiempo de respuesta (total)2.43sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
9.8Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)2.62sTiempo de respuesta (máximo)2.78sTiempo de respuesta (total)5.24sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
2.62sTiempo de respuesta (promedio)…
615Total de tokens de entrada…
69Tokens de salida…
1,203Tokens de razonamiento…
Resolución de acertijos
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
7.7Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)4.71sTiempo de respuesta (máximo)4.75sTiempo de respuesta (total)9.41sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
7.7Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
66.7%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)3.18sTiempo de respuesta (máximo)4.05sTiempo de respuesta (total)9.54sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.18sTiempo de respuesta (promedio)…
558Total de tokens de entrada…
126Tokens de salida…
2,499Tokens de razonamiento…
Llamada de herramientas
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)9.73sTiempo de respuesta (máximo)9.73sTiempo de respuesta (total)9.73sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
10.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
100.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.No hay respuestas fallidas.Tiempo de respuesta (promedio)6.20sTiempo de respuesta (máximo)6.20sTiempo de respuesta (total)6.20sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
6.20sTiempo de respuesta (promedio)…
5,088Total de tokens de entrada…
234Tokens de salida…
1,140Tokens de razonamiento…
Cultura general
Puntuación
Consistencia
Tasa de aciertos por intento
Pruebas inestables
Pruebas correctas
Tiempo de respuesta (promedio)
Tokens de entrada
Tokens de salida
Tokens de razonamiento
Claude Opus 4.6Modelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas.
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)63.24sTiempo de respuesta (máximo)63.24sTiempo de respuesta (total)63.24sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…
3.0Puntaje promedio en todas las pruebas de benchmark.…
10.0La consistencia refleja la estabilidad entre ejecuciones (10 = muy consistente, incluso si es consistentemente incorrecto).…
0.0%Tasa de aciertos por intento = intentos correctos / intentos totales en todas las ejecuciones.…
0Pruebas inestables tuvieron resultados mixtos entre ejecuciones (al menos un acierto y un fallo).…
Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.Respuesta incorrecta: 1Tiempo de respuesta (promedio)2.76sTiempo de respuesta (máximo)2.76sTiempo de respuesta (total)2.76sUna prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan.…