AI BENCHY Compare

Google: Gemini 3.1 Pro Preview vs MoonshotAI: Kimi K2.5

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-01

Метрика	Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Релиз: 2026-02-19	Kimi K2.5 Kimi K2.5 medium Релиз: 2026-01-27

Метрика	Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Релиз: 2026-02-19	Kimi K2.5 Kimi K2.5 medium Релиз: 2026-01-27
Оценка	9.6	7.0
Ранг	#2	#60
Надежность	Н/Д	Н/Д
Стабильность	10.0	6.8
Тестов верно
Доля успешных попыток	94.4%	72.2%
Нестабильные тесты	0	7
Всего запусков	54	54
Стоимость за результат	3.400	2.444
Общая стоимость	$0.578	$0.220
???? ?????	$2.000 / 1M	$0.440 / 1M
???? ??????	$12.000 / 1M	$2.000 / 1M
Выходные токены	1,932	42,176
Токены рассуждений	40,542	84,870
Время ответа (среднее)	15.96s	72.43s
Время ответа (макс.)	40.61s	150.77s
Время ответа (суммарно)	175.52s	796.70s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.90s	112	3,218
Kimi K2.5	7.3	5.8	83.3%	2		51.38s	2,789	8,880

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		19.88s	405	4,201
Kimi K2.5	4.7	1.6	66.7%	1		150.77s	1,269	9,749

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Pro Preview	9.5	10.0	100.0%	0		40.61s	432	9,281
Kimi K2.5	10.0	10.0	100.0%	0		71.37s	703	3,713

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.72s	279	3,904
Kimi K2.5	10.0	10.0	100.0%	0		49.78s	563	7,940

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Pro Preview	7.7	10.0	66.7%	0		32.73s	18	12,424
Kimi K2.5	3.5	4.4	33.3%	2		137.29s	20,753	30,564

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		11.77s	108	1,179
Kimi K2.5	6.5	3.4	66.7%	1		69.73s	3,815	4,262

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		9.56s	72	2,236
Kimi K2.5	10.0	10.0	100.0%	0		92.47s	5,371	6,547

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		7.15s	232	3,117
Kimi K2.5	5.3	7.3	44.4%	1		45.40s	6,671	12,403

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Gemini 3.1 Pro Preview	10.0	10.0	100.0%	0		23.15s	274	982
Kimi K2.5	10.0	10.0	100.0%	0		31.74s	242	812

Быстрое сравнение

Сменить пару сравнения

DeepSeek V4 ProhighvsKimi K2.5medium Gemma 4 31BnoneБесплатно доступноvsKimi K2.5medium Kimi K2.5mediumvsQwen3.5 Plus 2026-02-15none Kimi K2.5mediumvsGPT-5.5none Kimi K2.5mediumvsGLM 5none Claude Opus 4.7nonevsGemini 3.1 Pro Previewmedium Claude Sonnet 4.6nonevsKimi K2.5medium Kimi K2.5mediumvsQwen3.6 Max Previewnone Gemini 3.1 Pro PreviewmediumvsGPT-5.5low Kimi K2.5mediumvsMiMo-V2-Omninone Gemma 4 26B A4BnoneБесплатно доступноvsKimi K2.5medium Gemini 2.5 FlashnonevsKimi K2.5medium