AI BENCHY Compare

MoonshotAI: Kimi K2.5 vs OpenAI: gpt-oss-120b

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-04-11

Метрика	Kimi K2.5 Kimi K2.5 none Релиз: 2026-01-27	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно

Метрика	Kimi K2.5 Kimi K2.5 none Релиз: 2026-01-27	gpt-oss-120b gpt-oss-120b medium Релиз: 2025-08-05 Бесплатно доступно
Оценка	5.5	5.8
Ранг	#72	#65
Стабильность	8.7	7.2
Тестов верно
Доля успешных попыток	40.7%	51.9%
Нестабильные тесты	3	6
Всего запусков	54	54
Стоимость за результат	0.271	0.144
Общая стоимость	$0.017	$0.011
???? ?????	$0.383 / 1M	$0.039 / 1M
???? ??????	$1.720 / 1M	$0.190 / 1M
Выходные токены	2,659	13,493
Токены рассуждений	0	36,879
Время ответа (среднее)	13.37s	16.08s
Время ответа (макс.)	42.13s	50.92s
Время ответа (суммарно)	147.05s	176.88s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Kimi K2.5	3.6	8.4	8.3%	1		6.24s	373	0
gpt-oss-120b	6.7	9.9	50.0%	0		10.21s	3,518	2,177

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Kimi K2.5	10.0	10.0	100.0%	0		38.78s	649	0
gpt-oss-120b	4.3	1.1	66.7%	1		26.33s	228	2,549

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Kimi K2.5	2.8	2.1	33.3%	1		19.16s	748	0
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	694	5,072

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Kimi K2.5	7.3	5.8	83.3%	1		42.13s	187	0
gpt-oss-120b	6.4	5.9	66.7%	1		1.98s	241	1,114

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Kimi K2.5	5.3	10.0	33.3%	0		4.38s	29	0
gpt-oss-120b	2.9	4.4	22.2%	2		50.92s	6,784	20,606

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Kimi K2.5	10.0	10.0	100.0%	0		4.00s	76	0
gpt-oss-120b	4.3	10.0	0.0%	0		7.90s	107	387

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Kimi K2.5	6.5	10.0	50.0%	0		2.67s	60	0
gpt-oss-120b	9.9	10.0	100.0%	0		7.63s	126	1,799

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Kimi K2.5	3.1	10.0	0.0%	0		4.73s	317	0
gpt-oss-120b	3.2	4.7	22.2%	2		11.80s	1,508	2,092

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Kimi K2.5	10.0	10.0	100.0%	0		13.99s	220	0
gpt-oss-120b	9.8	10.0	100.0%	0		6.91s	287	1,083

Быстрое сравнение

Сменить пару сравнения

gpt-oss-120bmediumБесплатно доступноvsQwen3.5-27Bnone Mistral Small 4mediumvsKimi K2.5none gpt-oss-120bmediumБесплатно доступноvsQwen3.5-122B-A10Bnone MiniMax M2.5mediumБесплатно доступноvsKimi K2.5none gpt-oss-120bmediumБесплатно доступноvsMiMo-V2-Pronone gpt-oss-120bmediumБесплатно доступноvsGLM 4.7 Flashnone gpt-oss-120bmediumБесплатно доступноvsGLM 5.1none MiniMax M2.7mediumvsKimi K2.5none DeepSeek V3.2nonevsgpt-oss-120bmediumБесплатно доступно gpt-oss-120bmediumБесплатно доступноvsQwen3.5-35B-A3Bnone Gemini 2.5 Flashnonevsgpt-oss-120bmediumБесплатно доступно Seed-2.0-Litenonevsgpt-oss-120bmediumБесплатно доступно