AI BENCHY
Advertise here

Registro de alterações

Um registro simples de atualizações de produto e benchmark, agrupadas por data. Usamos isso para anotar modelos recém-testados, re-tests, mudanças no benchmark e trabalho de UX/produto já entregue.

2026-09-05

  • Novo recurso: Copie exemplos SVG como imagens ou baixe PNGs com marca-d’água. As prévias agora mostram a posição do modelo.
  • Correção de bug: Exemplos SVG válidos foram restaurados e os erros de tempo limite ficaram mais claros.

2026-08-20

2026-08-15

  • Novo recurso: dots-studio/dots-3-note-preview:free O Dots3-Note Preview (gratuito) foi adicionado para testes rápidos de disponibilidade e modos de raciocínio.
  • Novo recurso: As execuções locais agora usam o custo estimado de eletricidade de uma RTX 3090 nas comparações de custo e valor.

2026-08-14

  • Novos modelos testados: Gemini 3.7 Flash, Qwen3.8 27B
  • Novo recurso: Foi adicionada a execução local de benchmarks com Ollama, com origem do provedor, tratamento correto da computação local sem preço e etiquetas claras de Execução local.

2026-08-12

  • Novos modelos testados: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • Novo recurso: Foram adicionadas contagens de parâmetros com fontes, parâmetros MoE ativos, disponibilidade e arquitetura às páginas de modelos e comparações, além de novos filtros na classificação.

2026-08-02

  • Novo recurso: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • Novos modelos testados: Trinity Large Thinking, Qwen3.7 Flash
  • Novo recurso: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • Novo recurso: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-18

2026-07-17

  • Novos testes adicionados: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • Novos modelos testados: Muse Spark 1.1, Kimi K3
  • Novo recurso: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • Novo recurso: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-06-17

  • Novos modelos testados: GLM 5.2
  • Correção de bug: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • Novo recurso: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • Novos modelos testados: Kimi K2.7 Code
  • Novo recurso: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-06

  • Novo recurso: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • Novo recurso: Added model-generated visual showcases to model and comparison pages.
  • Novo recurso: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • Novos modelos testados: Nemotron 3 Ultra
  • Novos testes adicionados: Added a coding benchmark with executable reference cases.

2026-05-27

  • Novo recurso: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • Novos modelos testados: Qwen3.7 Max
  • Novos testes adicionados: Adicionada uma nova categoria de teste Coding focada na busca de bugs em soluções C++.

2026-05-21

  • Novos modelos testados: Grok Build 0.1
  • Novos testes adicionados: Added a new benchmark test and improved answer judging.
  • Correção de bug: A variante sem raciocínio não suportada do xAI Grok Build 0.1 foi removida depois que a validação do provedor exigiu raciocínio.

2026-05-08

  • Novos testes adicionados: Added a new benchmark test to expand suite coverage.
  • Correção de bug: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

2026-04-30

2026-04-26

  • UX: Melhoramos a posição do menu de comparação no celular, compactamos o layout das páginas de modelo e dividimos o histórico de execuções em shards por modelo para carregar menos dados históricos.
  • Correção de bug: O histórico de execuções agora agrupa retestes quase duplicados da mesma suíte e mostra todas as execuções públicas em uma tabela comparativa direta nas páginas de modelo.

2026-04-25

  • Novo recurso: Adicionamos telemetria de confiabilidade para rastrear falhas da API alvo e de limite de taxa separadamente de respostas erradas.

2026-04-24

  • Novos modelos testados: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • Correção de bug: Os links de modelos no changelog agora apontam para páginas canônicas ativas dos modelos, e as páginas de modelo agora também ligam entre variantes de raciocínio.

2026-04-23

  • Novos modelos testados: Ling-2.6-1T, Hy3 preview
  • Novo recurso: Histórico de execuções - As páginas de modelo agora mostram execuções públicas históricas e uma tabela comparativa lado a lado. (Página de modelo de exemplo)
  • UX: O leaderboard agora suporta paginação e filtros baseados em URL, além de ações diretas de comparação a partir da lista.
  • Correção de bug: A busca da homepage, as contagens de filtros e o estado da paginação agora permanecem consistentes em todo o conjunto de dados.
  • Re-test: GLM 5.1 A suíte completa de benchmark foi executada novamente e o snapshot público do histórico de execuções deste modelo foi limpo.
  • Correção de bug: Modelos que não foram realmente retestados deixaram de receber um novo timestamp tested_at.

2026-04-20

2026-04-11

2026-03-18

  • Novos modelos testados: MiniMax M2.7
  • Novo recurso: Added input and output pricing metrics to model and comparison pages.

2026-03-06

  • Novo recurso: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-04

  • Novos modelos testados: GPT-5.2 Chat, GPT 5.3 Chat
  • Novo recurso: Added interactive comparison charts for direct model analysis.
  • Novos testes adicionados: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • Novo recurso: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • Novos modelos testados: Seed-2.0-Mini
  • Novo recurso: Added reasoning-quality and consistency charts to model comparisons.

Página de changelog criada

Este changelog começou após o lançamento, então algumas atualizações antigas não aparecem aqui.