Навигация
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Google: Gemma 4 26B A4B

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-05-29

Метрика Claude Opus 4.8 Claude Opus 4.8 none Релиз: 2026-05-28 Gemma 4 26B A4B Gemma 4 26B A4B medium Релиз: 2026-04-03 Бесплатно доступно
Оценка 7.3 7.8
Ранг #65 #34
Надежность 10.0 10.0
Стабильность 9.2 9.2
Тестов верно
Доля успешных попыток 65.0% 73.3%
Нестабильные тесты 2 2
Всего запусков 60 60
Стоимость за результат 4.324 0.317
Общая стоимость $0.519 $0.045
Цена входа $5.000 / 1M $0.060 / 1M
Цена выхода $25.000 / 1M $0.330 / 1M
Выходные токены 8,098 28,000
Токены рассуждений 0 82,045
Время ответа (среднее) 3.51s 50.92s
Время ответа (макс.) 17.73s 369.32s
Время ответа (суммарно) 70.19s 967.47s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 6.5 10.0 50.0% 0 3.40s 1,472 0
Gemma 4 26B A4B 10.0 10.0 100.0% 0 6.20s 1,142 3,045
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 6.8 10.0 50.0% 0 3.59s 1,323 0
Gemma 4 26B A4B 2.9 10.0 0.0% 0 258.40s 14,838 26,122
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 9.5 10.0 100.0% 0 17.73s 3,259 0
Gemma 4 26B A4B 9.6 10.0 100.0% 0 73.55s 5,415 13,112
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 7.3 5.8 83.3% 1 1.77s 308 0
Gemma 4 26B A4B 10.0 10.0 100.0% 0 16.51s 1,567 2,827
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 5.3 7.2 44.4% 1 1.66s 61 0
Gemma 4 26B A4B 2.9 4.4 22.2% 2 23.62s 2,469 7,105
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 10.0 10.0 100.0% 0 3.48s 230 0
Gemma 4 26B A4B 10.0 10.0 100.0% 0 29.76s 25 5,075
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 9.9 10.0 100.0% 0 1.37s 95 0
Gemma 4 26B A4B 10.0 10.0 100.0% 0 17.54s 887 4,470
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 7.7 10.0 66.7% 0 2.74s 783 0
Gemma 4 26B A4B 10.0 10.0 100.0% 0 5.79s 410 2,128
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 10.0 10.0 100.0% 0 5.35s 355 0
Gemma 4 26B A4B 10.0 10.0 100.0% 0 9.01s 450 1,256
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Claude Opus 4.8 3.0 10.0 0.0% 0 3.41s 212 0
Gemma 4 26B A4B 3.0 10.0 0.0% 0 180.87s 797 16,905

Быстрое сравнение

Сменить пару сравнения