Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Gemini 3 PRO Preview

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-28

Метрика Claude Opus 4.8 Claude Opus 4.8 medium Релиз: 2026-05-28 Gemini 3 PRO Preview Gemini 3 PRO Preview medium Релиз: 2025-11-18
Оценка 8.7 8.1
Ранг #12 #21
Надежность 10.0 Н/Д
Стабильность 9.6 10.0
Тестов верно
Доля успешных попыток 83.3% 73.7%
Нестабильные тесты 1 0
Всего запусков 60 60
Стоимость за результат 6.285 1.406
Общая стоимость $1.006 $0.385
Цена входа $5.000 / 1M $9.506 / 1M
Цена выхода $25.000 / 1M $9.506 / 1M
Выходные токены 23,201 1,490
Токены рассуждений 5,901 10,102
Время ответа (среднее) 9.34s 9.05s
Время ответа (макс.) 38.03s 26.24s
Время ответа (суммарно) 186.84s 90.53s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 10.0 10.0 100.0% 0 3.95s 1,179 478
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 14.99s 149 1,485
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 10.0 10.0 100.0% 0 14.97s 6,651 1,381
Gemini 3 PRO Preview 3.0 10.0 0.0% 0 0ms 0 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 9.8 10.0 100.0% 0 38.03s 5,260 1,588
Gemini 3 PRO Preview 3.0 10.0 0.0% 0 10.37s 351 952
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 7.1 5.6 83.3% 1 12.29s 481 312
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 10.84s 279 3,156
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 5.3 10.0 33.3% 0 14.15s 7,477 900
Gemini 3 PRO Preview 5.3 10.0 33.3% 0 7.01s 15 1,195
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 10.0 10.0 100.0% 0 2.46s 237 0
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 9.34s 78 374
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 10.0 10.0 100.0% 0 3.32s 373 320
Gemini 3 PRO Preview 9.8 10.0 100.0% 0 3.26s 69 754
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 10.0 10.0 100.0% 0 3.95s 791 483
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 3.88s 225 1,215
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 10.0 10.0 100.0% 0 8.96s 301 225
Gemini 3 PRO Preview 10.0 10.0 100.0% 0 11.96s 324 971
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 3.0 10.0 0.0% 0 6.14s 451 214
Gemini 3 PRO Preview 0.0 0.0 0.0% 0 0ms 0 0

Быстрое сравнение

Сменить пару сравнения