Leaderboard de AI Benchy
Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-09-02
Modelos evaluados: 305
Modelos recomendados
GPT-5.6 Sol
high
Inteligente
Tasa de aciertos por intento
89.4%
Pruebas correctas
18 / 22
Puntuación
9.4/10
GPT-5.6 Luna
medium
Rápido
Tiempo de respuesta (promedio)
7.43s
Total de tokens de salida
44,525
Puntuación
7.4/10
DeepSeek V4 Flash 0731
high
Económico
Precio de entrada
$0.065 / 1M
Precio de salida
$0.180 / 1M
Puntuación
8.0/10
305/305
Filtrar modelos
Ningún modelo coincide con la búsqueda y los filtros actuales.
| Rango | Modelo | Puntuación Puntaje promedio en todas las pruebas de benchmark. | Empresa | Costo total | Tiempo de respuesta (promedio) Tiempo de respuesta (promedio) | Pruebas correctas Muestra cuántas pruebas se superan completamente (todas las ejecuciones pasan). |
|---|---|---|---|---|---|---|
| #305#305 | LFM2-24B-A2BnoneModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas. | 2.2… | Liquid | $0.001 … | 782ms… | Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan. Respuesta incorrecta: 9 Error de API: 4 No siguió las instrucciones: 1 Tiempo de respuesta (promedio)782ms Tiempo de respuesta (máximo)3.15s Tiempo de respuesta (total)10.94s … |
|
||||||
| #303#303 | Nemotron 3 Nano Omni 30b A3b ReasoningnoneModelo archivado: este modelo ya no se actualiza ni se prueba en pruebas nuevas. | 3.2… | NVIDIA | $0.000 … | 728ms… | Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan. Respuesta incorrecta: 9 Error de API: 6 No siguió las instrucciones: 2 Tiempo de respuesta (promedio)728ms Tiempo de respuesta (máximo)2.21s Tiempo de respuesta (total)9.47s … |
|
||||||
| #279#279 | Laguna S 2.1none | 4.5… | Poolside | $0.022 ↓ … | 11.67s… | Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan. Respuesta incorrecta: 18 No siguió las instrucciones: 1 Sin respuesta: 1 Tiempo de respuesta (promedio)11.67s Tiempo de respuesta (máximo)200.52s Tiempo de respuesta (total)256.71s … |
|
||||||
| #291#291 | Ling 3.0 Tinynone | 4.0… | Inclusionai | $0.000 … | 14.02s… | Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan. Respuesta incorrecta: 13 No siguió las instrucciones: 4 Error de API: 1 Formato extra: 1 Llamada de herramienta no válida: 1 Tiempo de respuesta (promedio)14.02s Tiempo de respuesta (máximo)240.61s Tiempo de respuesta (total)294.46s … |
Respuesta incorrecta: 13 No siguió las instrucciones: 4 Error de API: 1 Formato extra: 1 Llamada de herramienta no válida: 1
|
||||||
| #292#292 | Granite 4.1 8Bnone | 4.0… | IBM Granite | $0.007 … | 1.44s… | Una prueba cuenta como totalmente superada solo si todas sus ejecuciones pasan. Respuesta incorrecta: 13 No siguió las instrucciones: 4 Llamada de herramienta no válida: 2 Formato extra: 1 Tiempo de respuesta (promedio)1.44s Tiempo de respuesta (máximo)16.67s Tiempo de respuesta (total)31.75s … |
Respuesta incorrecta: 13 No siguió las instrucciones: 4 Llamada de herramienta no válida: 2 Formato extra: 1
|
||||||
Tendencias globales del benchmark
Descubre cómo los modelos actuales equilibran puntuación, costo, velocidad, longitud de salida y rendimiento por categoría.
Evolución de la mejor puntuación de las empresas líderes
Frontera de Pareto: inteligencia vs velocidad de respuesta
Frontera de Pareto: puntuación vs tokens de salida
Dificultad de las categorías entre modelos
Comparación rápida
Gemini 3.6 FlashhighvsGemini 3.7 FlashhighGemini 3.7 FlashhighvsGemini 3.6 FlashmediumGemini 3.6 FlashmediumvsGPT-5.6 SollowGPT-5.6 SollowvsGemini 3 Flash PreviewmediumGemini 3 Flash PreviewmediumvsGemini 3.5 FlashhighGemini 3.5 FlashhighvsGemini 3.7 FlashmediumGemini 3.7 FlashmediumvsGPT-5.6 SolmediumGPT-5.6 SolmediumvsGPT-5.6 SolhighGPT-5.6 SolhighvsGPT-5.5lowGPT-5.5lowvsGrok 4.6highGrok 4.6highvsGemini 3.1 Pro PreviewmediumGemini 3.1 Pro PreviewmediumvsGemini 3.7 Flashlow