AI BENCHY Compare

Mistral: Mistral Small 4 vs MoonshotAI: Kimi K2.5

Сводка

Сравнение benchmark Mistral Small 4 vs Kimi K2.5: Kimi K2.5 лидирует по среднему баллу: 5.5 vs 5.1. Kimi K2.5 имеет более низкую стоимость benchmark: $0.028 vs $0.068. Mistral Small 4 быстрее: 9.40s vs 13.18s, с долей успешных попыток 44.4% vs 34.9%.

Рекомендуемая модель: Kimi K2.5 - Здесь у него лучший балл (5.5), при этом он примерно в 2.5 раза дешевле, чем Mistral Small 4.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-12

Метрика	Mistral Small 4 Mistral Small 4 medium Релиз: 2026-03-16	Kimi K2.5 Kimi K2.5 none Релиз: 2026-01-27

Метрика	Mistral Small 4 Mistral Small 4 medium Релиз: 2026-03-16	Kimi K2.5 Kimi K2.5 none Релиз: 2026-01-27
Оценка	5.1	5.5
Ранг	#138	#121
Надежность	10.0	10.0
Стабильность	6.9	8.9
Тестов верно
Доля успешных попыток	44.4%	34.9%
Нестабильные тесты	8	3
Всего запусков	63	63
Стоимость за результат	1.344	0.442
Общая стоимость	$0.068	$0.028
Цена входа	$0.150 / 1M	$0.400 / 1M
Цена выхода	$0.600 / 1M	$1.900 / 1M
Общее число входных токенов	42,576	36,034
Выходные токены	24,184	6,657
Токены рассуждений	84,678	0
Время ответа (среднее)	9.40s	13.18s
Время ответа (макс.)	59.15s	42.13s
Время ответа (суммарно)	197.39s	184.47s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#138 Mistral Small 4

medium

Cost: $0.006
Time: 47.9s
Tokens: 9,857 tok

#121 MoonshotAI: Kimi K2.5

none

Cost: $0.015
Time: 89.1s
Tokens: 5,421 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mistral Small 4	5.6	3.8	66.7%	3		2.67s	708	4,055	4,778
Kimi K2.5	3.6	8.4	8.3%	1		6.24s	652	373	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mistral Small 4	4.4	5.1	33.3%	2		39.98s	7,636	11,635	54,715
Kimi K2.5	5.5	10.0	33.3%	0		24.56s	7,311	4,708	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mistral Small 4	3.0	10.0	0.0%	0		25.25s	18,706	2,612	10,700
Kimi K2.5	2.8	2.1	33.3%	1		19.16s	12,264	748	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mistral Small 4	7.3	5.9	83.3%	1		1.23s	6,171	335	723
Kimi K2.5	7.3	5.8	83.3%	1		42.13s	7,180	187	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mistral Small 4	5.3	7.2	44.4%	1		6.11s	742	2,621	6,904
Kimi K2.5	5.3	10.0	33.3%	0		4.38s	753	29	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mistral Small 4	4.8	10.0	0.0%	0		2.05s	519	821	828
Kimi K2.5	10.0	10.0	100.0%	0		4.00s	483	76	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mistral Small 4	7.3	5.8	83.3%	1		1.38s	729	540	1,031
Kimi K2.5	6.5	10.0	50.0%	0		2.67s	677	60	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mistral Small 4	3.4	9.7	0.0%	0		2.17s	735	1,226	2,632
Kimi K2.5	3.0	10.0	0.0%	0		4.04s	667	236	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mistral Small 4	10.0	10.0	100.0%	0		3.50s	6,420	321	810
Kimi K2.5	10.0	10.0	100.0%	0		13.99s	5,835	220	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Mistral Small 4	3.0	10.0	0.0%	0		5.92s	210	18	1,557
Kimi K2.5	3.0	10.0	0.0%	0		3.90s	212	20	0

Быстрое сравнение

Сменить пару сравнения

Mistral Small 4mediumvsMiMo-V2.5none Mistral Small 4mediumvsQwen3.5-9Bnone Mistral Small 4mediumvsQwen3 Coder Nextnone Mistral Small 4mediumvsQwen3.6 35B A3Bnone Trinity Large PreviewnonevsMistral Small 4medium Mistral Small 4mediumvsGPT-4o-mininone DeepSeek V3.2nonevsMistral Small 4medium Mistral Small 4mediumvsQwen3.5-122B-A10Bnone Mistral Small 4mediumvsGPT-5.4 Mininone Mistral Small 4mediumvsGrok 4.20none Mistral Small 4mediumvsGLM 5 Turbonone Mistral Small 4mediumvsGLM 4.7 Flashnone