Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Opus 4.6 vs StepFun: Step 3.7 Flash

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика Claude Opus 4.6 Claude Opus 4.6 medium Релиз: 2026-02-05 Step 3.7 Flash Step 3.7 Flash high Релиз: 2026-05-29
Оценка 7.2 7.1
Ранг #71 #74
Надежность 10.0 10.0
Стабильность 9.1 8.2
Тестов верно
Доля успешных попыток 63.3% 65.8%
Нестабильные тесты 2 4
Всего запусков 60 60
Стоимость за результат 15.796 8.723
Общая стоимость $1.896 $0.960
Цена входа $5.000 / 1M $0.200 / 1M
Цена выхода $25.000 / 1M $1.150 / 1M
Выходные токены 42,254 828,084
Токены рассуждений 23,554 0
Время ответа (среднее) 25.45s 49.43s
Время ответа (макс.) 83.40s 192.75s
Время ответа (суммарно) 330.91s 988.58s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.6 6.4 5.8 66.7% 2 7.45s 986 1,071
Step 3.7 Flash 10.0 10.0 100.0% 0 13.40s 42,656 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.6 7.2 9.8 50.0% 0 29.37s 7,865 3,675
Step 3.7 Flash 3.6 4.6 25.0% 1 126.82s 164,069 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.6 10.0 10.0 100.0% 0 76.66s 8,178 5,194
Step 3.7 Flash 10.0 10.0 100.0% 0 13.01s 8,802 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.6 10.0 10.0 100.0% 0 7.37s 691 757
Step 3.7 Flash 10.0 10.0 100.0% 0 14.72s 23,113 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.6 3.0 10.0 0.0% 0 83.40s 14,642 8,687
Step 3.7 Flash 4.1 4.4 44.5% 2 149.64s 410,502 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.6 10.0 10.0 100.0% 0 5.04s 188 292
Step 3.7 Flash 5.5 10.0 0.0% 0 4.17s 2,862 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.6 10.0 10.0 100.0% 0 2.43s 266 467
Step 3.7 Flash 9.8 10.0 100.0% 0 1.52s 2,010 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.6 7.7 10.0 66.7% 0 4.71s 532 630
Step 3.7 Flash 5.3 7.2 44.4% 1 10.22s 25,422 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.6 10.0 10.0 100.0% 0 9.73s 861 329
Step 3.7 Flash 10.0 10.0 100.0% 0 2.79s 1,172 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.6 3.0 10.0 0.0% 0 63.24s 8,045 2,452
Step 3.7 Flash 3.0 10.0 0.0% 0 149.34s 147,476 0

Быстрое сравнение

Сменить пару сравнения