Navegación
AI BENCHY
Your ad here

AI BENCHY Compare

Modelos comparados

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-17

Métrica GPT-5.4 GPT-5.4 medium Lanzamiento: 2026-03-05 GPT-5.4 Mini GPT-5.4 Mini medium Lanzamiento: 2026-03-17 GPT-5.4 Nano GPT-5.4 Nano medium Lanzamiento: 2026-03-17 GPT-5 Mini GPT-5 Mini medium Lanzamiento: 2025-08-07
Rango #15 #34 #28 #38
Puntuación 8.1 7.1 7.4 6.8
Consistencia 8.6 7.2 9.0 8.5
Costo por resultado 6.613 3.610 0.769 1.473
Costo total $0.794 $0.289 $0.077 $0.118
Pruebas correctas
Tasa de aciertos por intento 78.4% 68.6% 66.7% 58.8%
Pruebas inestables 3 6 2 3
Ejecuciones totales 51 51 51 51
Tokens de salida 1,780 1,708 2,474 5,896
Tokens de razonamiento 46,687 58,019 54,516 49,322
Tiempo de respuesta (promedio) 18.95s 15.66s 11.08s 24.02s
Tiempo de respuesta (máximo) 100.41s 102.91s 94.06s 88.15s
Tiempo de respuesta (total) 322.23s 266.14s 188.39s 408.39s

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-5.4 8.3 10.0 75.0% 0 4.11s 240 1,511
GPT-5.4 Mini 8.6 7.9 91.7% 1 4.05s 296 2,876
GPT-5.4 Nano 8.3 10.0 75.0% 0 4.52s 683 2,254
GPT-5 Mini 7.1 7.6 66.7% 1 13.86s 1,715 6,378
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-5.4 10.0 10.0 100.0% 0 20.57s 301 3,543
GPT-5.4 Mini 10.0 10.0 100.0% 0 17.81s 317 4,317
GPT-5.4 Nano 9.8 10.0 100.0% 0 24.13s 349 5,719
GPT-5 Mini 10.0 10.0 100.0% 0 88.15s 754 11,520
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-5.4 10.0 10.0 100.0% 0 5.32s 234 804
GPT-5.4 Mini 10.0 10.0 100.0% 0 2.43s 234 650
GPT-5.4 Nano 10.0 10.0 100.0% 0 2.54s 234 516
GPT-5 Mini 10.0 10.0 100.0% 0 12.58s 453 3,200
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-5.4 5.3 7.2 44.4% 1 74.27s 61 34,748
GPT-5.4 Mini 4.1 4.4 44.5% 2 65.31s 60 43,286
GPT-5.4 Nano 5.9 7.2 55.6% 1 38.18s 60 43,325
GPT-5 Mini 3.6 7.2 22.2% 1 44.63s 293 14,016
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-5.4 4.7 3.1 33.3% 1 4.92s 145 321
GPT-5.4 Mini 4.5 10.0 0.0% 0 3.72s 150 510
GPT-5.4 Nano 4.5 10.0 0.0% 0 4.15s 179 443
GPT-5 Mini 4.5 10.0 0.0% 0 13.50s 349 1,856
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-5.4 10.0 10.0 100.0% 0 3.11s 93 897
GPT-5.4 Mini 7.4 6.5 66.7% 1 2.50s 129 1,337
GPT-5.4 Nano 9.8 10.0 100.0% 0 1.88s 95 521
GPT-5 Mini 8.0 6.6 83.3% 1 15.66s 318 4,992
Puzzle Solving Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-5.4 8.2 7.2 88.9% 1 9.13s 442 3,832
GPT-5.4 Mini 6.8 7.9 55.6% 1 4.33s 271 2,449
GPT-5.4 Nano 4.0 7.1 22.2% 1 3.65s 640 1,356
GPT-5 Mini 5.6 9.8 33.3% 0 14.09s 1,527 5,760
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de salida Tokens de razonamiento
GPT-5.4 10.0 10.0 100.0% 0 13.28s 264 1,031
GPT-5.4 Mini 4.7 1.6 66.7% 1 9.62s 251 2,594
GPT-5.4 Nano 10.0 10.0 100.0% 0 7.71s 234 382
GPT-5 Mini 10.0 10.0 100.0% 0 18.64s 487 1,600

Comparación rápida

Cambiar par de comparación