AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs Google: Gemini 3.1 Flash Lite

Сводка

Сравнение benchmark Claude Opus 4.8 vs Gemini 3.1 Flash Lite: Средний балл практически равен: 7.7 vs 7.8. Gemini 3.1 Flash Lite имеет более низкую стоимость benchmark: $0.071 vs $1.270. Gemini 3.1 Flash Lite быстрее: 3.23s vs 10.83s, с долей успешных попыток 79.4% vs 65.1%.

Рекомендуемая модель: Gemini 3.1 Flash Lite - Здесь у него лучший балл (7.8), при этом он примерно в 18.1 раза дешевле, чем Claude Opus 4.8.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-30

Метрика	Claude Opus 4.8 Claude Opus 4.8 low Релиз: 2026-05-28	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite medium Релиз: 2026-05-08

Метрика	Claude Opus 4.8 Claude Opus 4.8 low Релиз: 2026-05-28	Gemini 3.1 Flash Lite Gemini 3.1 Flash Lite medium Релиз: 2026-05-08
Оценка	7.7	7.8
Ранг	#38	#35
Надежность	10.0	10.0
Стабильность	8.8	9.2
Тестов верно
Доля успешных попыток	79.4%	65.1%
Нестабильные тесты	3	2
Всего запусков	63	63
Стоимость за результат	8.466	0.539
Общая стоимость	$1.270	$0.071
Цена входа	$5.000 / 1M	$0.250 / 1M
Цена выхода	$25.000 / 1M	$1.500 / 1M
Общее число входных токенов	60,946	36,808
Выходные токены	31,771	2,254
Токены рассуждений	6,831	38,300
Время ответа (среднее)	10.83s	3.23s
Время ответа (макс.)	127.97s	10.87s
Время ответа (суммарно)	227.39s	67.80s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low

Стоимость: $0.031
Время: 14.1s
Токены: 1,345 tok

#35 Gemini 3.1 Flash Lite

medium

Стоимость: $0.003
Время: 5.3s
Токены: 1,754 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.30s	834	793	371
Gemini 3.1 Flash Lite	9.1	10.0	75.0%	0		2.39s	502	604	4,201

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	6.6	4.6	77.8%	2		7.58s	10,590	3,637	809
Gemini 3.1 Flash Lite	5.5	10.0	33.3%	0		3.81s	8,134	459	8,978

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	9.8	10.0	100.0%	0		20.84s	23,500	2,216	1,081
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		10.87s	12,873	327	7,401

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	6.3	5.8	66.7%	1		2.27s	10,503	310	0
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		2.60s	7,362	279	2,845

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	5.3	10.0	33.3%	0		45.53s	975	23,311	3,908
Gemini 3.1 Flash Lite	2.9	7.2	11.1%	1		3.16s	643	15	5,165

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		2.55s	708	231	0
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		2.60s	488	84	1,142

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	9.8	10.0	100.0%	0		2.78s	909	111	221
Gemini 3.1 Flash Lite	9.9	10.0	100.0%	0		2.59s	623	75	3,320

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.01s	894	592	184
Gemini 3.1 Flash Lite	7.6	7.2	77.8%	1		1.95s	568	165	2,450

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		6.85s	11,775	370	35
Gemini 3.1 Flash Lite	10.0	10.0	100.0%	0		4.55s	5,457	234	921

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	3.0	10.0	0.0%	0		5.48s	258	200	222
Gemini 3.1 Flash Lite	3.0	10.0	0.0%	0		3.08s	158	12	1,877

Быстрое сравнение

Сменить пару сравнения