Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Google: Gemini 3.1 Pro Preview

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика Claude Opus 4.8 Claude Opus 4.8 none Релиз: 2026-05-28 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Релиз: 2026-02-19
Оценка 7.3 9.3
Ранг #65 #4
Надежность 10.0 10.0
Стабильность 9.2 10.0
Тестов верно
Доля успешных попыток 65.0% 90.0%
Нестабильные тесты 2 0
Всего запусков 60 60
Стоимость за результат 4.324 5.587
Общая стоимость $0.519 $1.006
Цена входа $5.000 / 1M $2.000 / 1M
Цена выхода $25.000 / 1M $12.000 / 1M
Выходные токены 8,098 1,971
Токены рассуждений 0 75,384
Время ответа (среднее) 3.51s 20.77s
Время ответа (макс.) 17.73s 88.68s
Время ответа (суммарно) 70.19s 269.96s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 6.5 10.0 50.0% 0 3.40s 1,472 0
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 7.90s 112 3,218
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 6.8 10.0 50.0% 0 3.59s 1,323 0
Gemini 3.1 Pro Preview 7.0 9.8 50.0% 0 54.28s 429 37,735
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 9.5 10.0 100.0% 0 17.73s 3,259 0
Gemini 3.1 Pro Preview 9.5 10.0 100.0% 0 40.61s 432 9,281
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 7.3 5.8 83.3% 1 1.77s 308 0
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 7.72s 279 3,904
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 5.3 7.2 44.4% 1 1.66s 61 0
Gemini 3.1 Pro Preview 7.7 10.0 66.7% 0 32.73s 18 12,424
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 10.0 10.0 100.0% 0 3.48s 230 0
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 11.77s 108 1,179
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 9.9 10.0 100.0% 0 1.37s 95 0
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 9.56s 72 2,236
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 7.7 10.0 66.7% 0 2.74s 783 0
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 6.90s 235 3,128
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 10.0 10.0 100.0% 0 5.35s 355 0
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 23.15s 274 982
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 3.0 10.0 0.0% 0 3.41s 212 0
Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 6.27s 12 1,297

Быстрое сравнение

Сменить пару сравнения