AI BENCHY
Advertise here

Журнал изменений

Простой журнал продуктовых и бенчмарк-обновлений, сгруппированных по дате. Здесь мы отмечаем новые протестированные модели, повторные прогоны, изменения бенчмарка и выпущенные UX/продуктовые улучшения.

2026-09-05

  • Новая функция: Копируйте SVG-примеры как изображения или скачивайте PNG с водяным знаком. В предпросмотре теперь показано место модели.
  • Исправление ошибки: Восстановлены корректные SVG-примеры и уточнены сообщения об истечении времени.

2026-09-04

  • Новые протестированные модели: GPT-6 Astra

2026-08-29

  • Новые протестированные модели: Hy4 preview

2026-08-26

  • Новые протестированные модели: GLM 5.3 Flash

2026-08-20

  • Новые протестированные модели: GLM 5.3

2026-08-15

  • Новая функция: dots-studio/dots-3-note-preview:free Dots3-Note Preview (бесплатно) добавлена для быстрых проверок доступности и режимов рассуждения.
  • Новая функция: В сравнениях стоимости и ценности локальных запусков теперь используется оценочная стоимость электроэнергии для RTX 3090.

2026-08-14

  • Новые протестированные модели: Gemini 3.7 Flash, Qwen3.8 27B
  • Новая функция: Добавлены локальный запуск бенчмарков через Ollama, сведения о провайдере, корректная обработка локальных вычислений без цены и понятные метки Локальный запуск.

2026-08-12

  • Новые протестированные модели: Seed 2.1 Turbo, Qwen3.8 2.4T A95B, Seed-2.0-Code, Grok 4.6
  • Новая функция: На страницы моделей и сравнений добавлены подтвержденные источниками данные о числе параметров, активных параметрах MoE, доступности и архитектуре, а также новые фильтры рейтинга.

2026-08-08

  • Новые протестированные модели: Ling 3.0 Tiny

2026-08-06

  • Новые протестированные модели: Muse Spark 1.2

2026-08-04

  • Новые протестированные модели: Qwen3.8 Max

2026-08-02

  • Новая функция: Model pages now show benchmark-suite coverage so incomplete results are clear at a glance.

2026-07-28

  • Новые протестированные модели: Trinity Large Thinking, Qwen3.7 Flash
  • Новая функция: Added site-wide Spotlight Search with keyboard navigation and a shortcut for finding pages, models, and comparisons.

2026-07-26

  • Новая функция: Added editorial model recommendations for affordable, intelligent, and fast choices.
  • UX: Comparison pages now use draggable model summary cards with clearer model selection and ordering.

2026-07-25

  • Новые протестированные модели: Claude Opus 5

2026-07-24

  • Новые протестированные модели: Ling-3.0-flash

2026-07-22

  • Новые протестированные модели: Laguna S 2.1

2026-07-20

  • Новые протестированные модели: LongCat 2.0

2026-07-18

  • Новые протестированные модели: Inkling

2026-07-17

  • Добавлены новые тесты: Added an executable JavaScript tool-calling benchmark with reference-case validation.

2026-07-16

  • Новые протестированные модели: Muse Spark 1.1, Kimi K3
  • Новая функция: The benchmark runner now supports executable tools with validated tool-call schemas and sandboxed execution.

2026-07-03

  • Новая функция: Launched AI World Cup, where benchmarked models generate football strategies and compete in simulated matches.

2026-07-02

  • Новые протестированные модели: Laguna XS 2.1

2026-06-30

  • Новые протестированные модели: Claude Sonnet 5

2026-06-18

  • Новые протестированные модели: North Mini Code

2026-06-17

  • Новые протестированные модели: GLM 5.2
  • Исправление ошибки: Adjusted missing-test handling so models are not scored as if unavailable tests were valid wrong answers.
  • UX: Leaderboard search now supports comma-separated model queries, so searches like "deepseek, glm" show matches for either model family.

2026-06-16

  • Новая функция: Added cost sorting and filtering across leaderboard and category views.

2026-06-12

  • Новые протестированные модели: Kimi K2.7 Code
  • Новая функция: Updated scoring to use per-category bias adjustments, so category-level differences are normalized before they roll into leaderboard results.

2026-06-10

  • Новые протестированные модели: Claude Fable 5

2026-06-06

  • Новая функция: Model showcases now support shareable lightbox views, filtering, and score details.

2026-06-05

  • Новая функция: Added model-generated visual showcases to model and comparison pages.
  • Новая функция: Added multi-model comparison pages with model recommendations and category-based ranking.

2026-06-04

  • Новые протестированные модели: Nemotron 3 Ultra
  • Добавлены новые тесты: Added a coding benchmark with executable reference cases.

2026-06-03

  • Новые протестированные модели: Qwen3.7 Plus

2026-06-01

  • Новые протестированные модели: MiniMax M3

2026-05-29

  • Новые протестированные модели: Step 3.7 Flash

2026-05-28

  • Новые протестированные модели: Claude Opus 4.8

2026-05-27

  • Новая функция: Added current-price cost calculations while preserving original tested-at pricing for auditability.

2026-05-22

  • Новые протестированные модели: Qwen3.7 Max
  • Добавлены новые тесты: Добавлена новая категория тестов Coding, ориентированная на поиск ошибок в решениях на C++.

2026-05-21

  • Новые протестированные модели: Grok Build 0.1
  • Добавлены новые тесты: Added a new benchmark test and improved answer judging.
  • Исправление ошибки: Удален неподдерживаемый вариант xAI Grok Build 0.1 без reasoning после того, как проверка провайдера потребовала reasoning.

2026-05-20

2026-05-10

  • Новые протестированные модели: Ring-2.6-1T

2026-05-08

  • Добавлены новые тесты: Added a new benchmark test to expand suite coverage.
  • Исправление ошибки: Reasoning chips and compare labels now recognize the minimal reasoning variant instead of falling back to auto.
  • UX: Model pages now order sibling reasoning-variant chips from highest effort to lowest.

2026-05-06

  • Новые протестированные модели: Cobuddy

2026-04-30

  • Новые протестированные модели: Owl Alpha

2026-04-26

  • UX: Улучшено положение выпадающего меню сравнения на мобильных, уплотнена компоновка страниц моделей, а история запусков разделена на шарды по моделям, чтобы страницы загружали меньше исторических данных.
  • Исправление ошибки: История запусков теперь группирует почти дублирующиеся ретесты одной и той же suite и показывает все публичные запуски на страницах моделей в прямой таблице сравнения.

2026-04-25

  • Новая функция: Добавлена телеметрия оценки надежности, чтобы сбои целевого API и лимитов отслеживались отдельно от неправильных ответов.

2026-04-24

  • Новые протестированные модели: DeepSeek V4 Flash 0423, DeepSeek V4 Pro, GPT-5.5
  • Исправление ошибки: Ссылки на модели в changelog теперь ведут на канонические актуальные страницы моделей, а страницы моделей теперь также связывают варианты рассуждения между собой.

2026-04-23

  • Новые протестированные модели: Ling-2.6-1T, Hy3 preview
  • Новая функция: История запусков - Страницы моделей теперь показывают исторические публичные запуски и таблицу сравнения запусков бок о бок. (Пример страницы модели)
  • UX: Лидерборд теперь поддерживает пагинацию и фильтры через URL, а также прямые действия сравнения из рейтингового списка.
  • Исправление ошибки: Поиск на главной странице, счетчики фильтров и состояние пагинации теперь остаются согласованными по всему набору данных.
  • Повторный прогон: GLM 5.1 Полный benchmark-набор был повторно запущен, а публичный snapshot истории запусков для этой модели очищен.
  • Исправление ошибки: Модели, которые фактически не проходили повторный тест, больше не получают новый timestamp tested_at.

2026-04-20

  • Новые протестированные модели: Kimi K2.6

2026-04-16

  • Новые протестированные модели: Claude Opus 4.7

2026-04-14

  • Новые протестированные модели: Ling-2.6-flash

2026-04-11

  • Новые протестированные модели: GLM 5.1

2026-04-04

  • Новые протестированные модели: Gemma 4 26B A4B

2026-03-21

  • Новые протестированные модели: Mimo V2 Omni

2026-03-20

  • Новые протестированные модели: Mimo V2 PRO

2026-03-18

  • Новые протестированные модели: MiniMax M2.7
  • Новая функция: Added input and output pricing metrics to model and comparison pages.

2026-03-15

  • Новые протестированные модели: GLM 5 Turbo

2026-03-06

  • Новая функция: Added the Methodology section and expanded charts with latency, cost, token, and model-switching views.

2026-03-05

2026-03-04

  • Новые протестированные модели: GPT-5.2 Chat, GPT 5.3 Chat
  • Новая функция: Added interactive comparison charts for direct model analysis.
  • Добавлены новые тесты: Added a VAT compliance micro-audit benchmark with structured tool requirements.

2026-03-02

  • Новая функция: Added share actions with copyable links across model and comparison pages.

2026-02-27

  • Новые протестированные модели: Seed-2.0-Mini
  • Новая функция: Added reasoning-quality and consistency charts to model comparisons.

2026-02-24

  • Новые протестированные модели: GPT-5.3-Codex

2026-02-17

Страница changelog создана

Этот changelog начали вести после запуска, поэтому часть более ранних обновлений здесь отсутствует.