Сводка
gpt-oss-120b набирает 4.2 в AI BENCHY и занимает #364. У модели надежность 10.0, доля успешных попыток 34.8%, общая стоимость $0.016 и среднее время ответа 28.63s.
Что делает gpt-oss-120b особенной: Сильнее всего модель выделяется в Агентные задачи, где занимает #1; самая слабая область — Программирование с #10.
Сведения о модели
Дата исследования: 2026-08-12
- Параметры
- 117B всего (5.1B активных)
- Архитектура
- MoE
- Доступность
- Открытый исходный код
- Лицензия
- Apache-2.0
4.2
Стабильность
7.6
10.0
Общее число выходных токенов
62,213
Общее число входных токенов
131,652
Цена входа
$0.037 / 1M
Цена выхода
$0.170 / 1M
Цена чтения из кэша
Н/Д
Цена записи в кэш
Н/Д
Цены кэша относятся к входным токенам. Чтение повторно использует сохранённые запросы; запись сохраняет их и может стоить дороже. Выходные токены оплачиваются по цене вывода.
Ошибочных тестов: 14
Доля успешных попыток: 34.8%
Покрытие бенчмарка: 60/69 попыток (Цель: 3 повторов на тест)
Нестабильные тесты
3
Нестабильные тесты имели смешанные результаты между прогонами (как минимум один успех и один провал).
История запусков
| Проверено | Оценка | Надежность | Тестов верно | Общая стоимость | Сравнить |
|---|---|---|---|---|---|
| 2026-10-01 05:17 Набор изменён | 4.2 | 10.0 | $0.016 ↓ | Текущий запуск | |
| 2026-04-21 12:42 Первый зафиксированный запуск | 5.2 | Н/Д | $0.009 | Сравнить |
Этот запуск использовал другой набор бенчмарков. Учитывайте изменения набора при чтении исторической динамики.
Сравнение запусков
| Запуск | Покрытие бенчмарка | Оценка | Стабильность | Надежность | Тестов верно | Нестабильные тесты | Общее число выходных токенов | Общее число входных токенов | Общая стоимость | Время ответа (среднее) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-10-01 05:17 · Текущий запуск | 60/69 попыток | 4.2 | 7.6 | 10.0 | 6/20 | 3 | 62,213 | 131,652 | $0.016 | 28.63s |
| 2026-04-21 12:42 · Первый зафиксированный запуск | 54/54 попыток | 5.2 | 7.9 | Н/Д | 4/18 | 5 | 44,652 | 0 | $0.009 | 11.96s |
| Разница | — | -1.0 | -0.3 | +2 | -2 | +17561 | +131652 | +$0.007 | +16672ms |
Покрытие бенчмарка различается: 60/69 попыток (Цель: 3 повторов на тест) против 54/54 попыток (Цель: 3 повторов на тест). Итоги и метрики, зависящие от числа повторов, нельзя сравнивать напрямую.
Эти два запуска использовали разные наборы бенчмарков, поэтому различия отражают и изменения модели, и изменения набора.
История цен
Исторические данные о ценах для этой модели из OpenRouter.
| Дата | Цена входа | Цена выхода | Цена чтения из кэша | Цена записи в кэш |
|---|---|---|---|---|
| 2026-06-04 15:40 | $0.039 / 1M | $0.180 / 1M | Н/Д | Н/Д |
| 2026-06-29 01:00 | $0.030 / 1M | $0.150 / 1M | Н/Д | Н/Д |
| 2026-07-09 20:59 | $0.036 / 1M | $0.180 / 1M | Н/Д | Н/Д |
| 2026-07-16 15:36 | $0.037 / 1M | $0.170 / 1M | Н/Д | Н/Д |
| 2026-08-12 11:59 | $0.030 / 1M | $0.170 / 1M | Н/Д | Н/Д |
Графики
Выберите первую модель, затем нажмите вторую, чтобы открыть страницу сравнения бок о бок.
Оценка vs Общая стоимость
Время ответа (среднее)
Оценка vs Время ответа (среднее)
Общее число выходных токенов
Оценка vs Общее число выходных токенов
Быстрое сравнение
Разбивка по категориям
| Категория | Оценка | Стабильность | Тестов верно |
|---|---|---|---|
| Агентные задачи | 6.1 | 3.1 | |
| Анти-ИИ уловки | 6.5 | 10.0 | |
| Программирование | 1.5 | 0.4 | |
| Комбинированный | 1.5 | 5.0 | |
| Парсинг и извлечение данных | 6.5 | 10.0 | |
| Предметно-ориентированное | 3.0 | 10.0 | |
| Общий интеллект | 4.8 | 10.0 | |
| Следование инструкциям | 9.8 | 10.0 | |
| Решение головоломок | 6.0 | 7.2 | |
| Вызов инструментов | 3.0 | 10.0 | |
| Эрудиция | 3.0 | 10.0 |