AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Registro de cambios

Un registro simple de actualizaciones de producto y benchmark, agrupado por fecha. Lo usamos para anotar modelos recién probados, re-tests, cambios del benchmark y trabajo de UX/producto ya publicado.

2026-09-05

  • Nueva función: Copia las muestras SVG como imágenes o descarga PNG con marca de agua. Las vistas previas ahora muestran la posición del modelo.
  • Corrección de error: Se restauraron muestras SVG válidas y se aclararon los errores por tiempo agotado.

2026-08-20

2026-08-15

  • Nueva función: dots-studio/dots-3-note-preview:free Se añadió Dots3-Note Preview (gratis) para pruebas rápidas de disponibilidad y modos de razonamiento.
  • Nueva función: Las ejecuciones locales ahora usan el coste eléctrico estimado de una RTX 3090 en las comparaciones de coste y valor.

2026-08-14

  • Nuevos modelos probados: Gemini 3.7 Flash, Qwen3.8 27B
  • Nueva función: Se añadió la ejecución local de benchmarks con Ollama, la procedencia del proveedor, el tratamiento de la computación local sin precio y etiquetas claras de Ejecución local.

2026-08-12

  • Nuevos modelos probados: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • Nueva función: Se añadieron recuentos de parámetros con fuentes, parámetros MoE activos, disponibilidad y arquitectura en las páginas de modelos y comparaciones, junto con nuevos filtros de la clasificación.

2026-08-02

  • Nueva función: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • Nuevos modelos probados: Trinity Large Thinking, Qwen3.7 Flash
  • Nueva función: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • Nueva función: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-18

2026-07-17

  • Nuevas pruebas añadidas: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • Nuevos modelos probados: Muse Spark 1.1, Kimi K3
  • Nueva función: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • Nueva función: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-06-17

  • Nuevos modelos probados: GLM 5.2
  • Corrección de error: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • Nueva función: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • Nuevos modelos probados: Kimi K2.7 Code
  • Nueva función: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-06

  • Nueva función: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • Nueva función: Added model-generated visual showcases to model and comparison pages.
  • Nueva función: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • Nuevos modelos probados: Nemotron 3 Ultra
  • Nuevas pruebas añadidas: Added a coding benchmark with executable reference cases.

2026-05-27

  • Nueva función: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • Nuevos modelos probados: Qwen3.7 Max
  • Nuevas pruebas añadidas: Se añadió una nueva categoría de test Coding enfocada en la búsqueda de errores en soluciones C++.

2026-05-21

  • Nuevos modelos probados: Grok Build 0.1
  • Nuevas pruebas añadidas: Added a new benchmark test and improved answer judging.
  • Corrección de error: Se eliminó la variante sin razonamiento no compatible de xAI Grok Build 0.1 después de que la validación del proveedor exigiera razonamiento.

2026-05-08

  • Nuevas pruebas añadidas: Added a new benchmark test to expand suite coverage.
  • Corrección de error: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

2026-04-30

2026-04-26

  • UX: Se mejoró la posición móvil del desplegable de comparación, se ajustó el diseño de las páginas de modelo y se dividió el historial en fragmentos por modelo para cargar menos datos históricos.
  • Corrección de error: El historial de ejecuciones ahora agrupa retests casi duplicados de la misma suite y muestra todas las ejecuciones públicas en una tabla comparativa directa en las páginas de modelo.

2026-04-25

  • Nueva función: Se añadió telemetría de fiabilidad para registrar fallos de la API objetivo y de límite de tasa por separado de las respuestas incorrectas.

2026-04-24

  • Nuevos modelos probados: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • Corrección de error: Los enlaces de modelos del changelog ahora apuntan a páginas canónicas activas de modelos, y las páginas de modelo ahora enlazan entre variantes de razonamiento.

2026-04-23

  • Nuevos modelos probados: Ling-2.6-1T, Hy3 preview
  • Nueva función: Historial de ejecuciones - Las páginas de modelo ahora muestran ejecuciones públicas históricas y una tabla comparativa de ejecuciones en paralelo. (Página de modelo de ejemplo)
  • UX: La clasificación ahora admite paginación y filtros basados en URL, además de acciones directas de comparación desde la lista.
  • Corrección de error: La búsqueda de la página principal, los conteos de filtros y el estado de la paginación ahora se mantienen coherentes en todo el conjunto de datos.
  • Re-test: GLM 5.1 Se volvió a ejecutar la suite completa de benchmark y se limpió la instantánea pública del historial de ejecuciones de este modelo.
  • Corrección de error: Se evitó que modelos no retestados recibieran un nuevo timestamp tested_at.

2026-04-20

2026-04-11

2026-03-18

  • Nuevos modelos probados: MiniMax M2.7
  • Nueva función: Added input and output pricing metrics to model and comparison pages.

2026-03-06

  • Nueva función: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-04

  • Nuevos modelos probados: GPT-5.2 Chat, GPT 5.3 Chat
  • Nueva función: Added interactive comparison charts for direct model analysis.
  • Nuevas pruebas añadidas: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • Nueva función: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • Nuevos modelos probados: Seed-2.0-Mini
  • Nueva función: Added reasoning-quality and consistency charts to model comparisons.

Página de changelog creada

Este changelog empezó después del lanzamiento, así que faltan algunas actualizaciones anteriores.