Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Mistral Small 4 (medium) vs GPT-5.6 Luna

GPT-5.6 Luna лидирует по среднему баллу: 5.4 vs 5.1. GPT-5.6 Luna имеет более низкую стоимость benchmark: $0.029 vs $0.097. GPT-5.6 Luna быстрее: 1.50s vs 10.80s, с долей успешных попыток 43.9% vs 36.4%.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-08-20

Ранг
#236
Общее число выходных токенов
133,597
Время ответа (среднее)
10.80s
Общая стоимость
$0.097
Ранг
#221
Общее число выходных токенов
6,709
Время ответа (среднее)
1.50s
Общая стоимость
$0.029
Рекомендуемая модель GPT-5.6 Luna

Здесь у него лучший балл (5.4), при этом он примерно в 3.4 раза дешевле, чем Mistral Small 4 (medium).

Подробное сравнение

Метрика Mistral Small 4 Mistral Small 4 medium Релиз: 2026-03-16 GPT-5.6 Luna GPT-5.6 Luna none Релиз: 2026-07-09
Оценка 5.1 5.4
Ранг #236 #221
Надежность 10.0 10.0
Стабильность 7.0 8.8
Попытки 66/66 66/66
Тестов верно
Доля успешных попыток 43.9% 36.4%
Нестабильные тесты 8 3
Всего запусков 66 66
Стоимость за результат 1.923 2.357
Общая стоимость $0.097 $0.029
Цена входа $0.150 / 1M $0.200 / 1M
Цена выхода $0.600 / 1M $1.200 / 1M
Общее число входных токенов 140,559 101,332
Выходные токены 40,268 6,709
Токены рассуждений 93,329 0
Время ответа (среднее) 10.80s 1.50s
Время ответа (макс.) 59.15s 10.57s
Время ответа (суммарно) 237.60s 33.05s
Параметры 119B всего (6B активных) ~400B всего (~17B активных)
Доступность Открытый исходный код Закрытая модель

Генерация showcase моделей

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#236 Mistral Small 4

medium
Стоимость
$0.006
Время
47.9s
Токены
9,857 tok

#221 GPT-5.6 Luna

none
Стоимость
$0.016
Время
15.8s
Токены
2,685 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
Mistral Small 4 4.4 5.1 33.3% 2 39.98s 7,636 11,635 54,715
GPT-5.6 Luna 3.8 7.2 22.2% 1 980ms 7,302 459 0

Быстрое сравнение

Сменить пару сравнения