AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs ByteDance Seed: Seed-2.0-Lite

Сводка

Сравнение benchmark Claude Opus 4.8 vs Seed-2.0-Lite: Seed-2.0-Lite лидирует по среднему баллу: 8.5 vs 7.7. Seed-2.0-Lite имеет более низкую стоимость benchmark: $0.175 vs $1.270. Claude Opus 4.8 быстрее: 10.83s vs 47.07s, с долей успешных попыток 79.4% vs 76.2%.

Рекомендуемая модель: Seed-2.0-Lite - Здесь у него лучший балл (8.5), при этом он примерно в 7.3 раза дешевле, чем Claude Opus 4.8.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-02

Метрика	Claude Opus 4.8 Claude Opus 4.8 low Релиз: 2026-05-28	Seed-2.0-Lite Seed-2.0-Lite medium Релиз: 2026-02-14

Метрика	Claude Opus 4.8 Claude Opus 4.8 low Релиз: 2026-05-28	Seed-2.0-Lite Seed-2.0-Lite medium Релиз: 2026-02-14
Оценка	7.7	8.5
Ранг	#38	#18
Надежность	10.0	10.0
Стабильность	8.8	9.0
Тестов верно
Доля успешных попыток	79.4%	76.2%
Нестабильные тесты	3	3
Всего запусков	63	63
Стоимость за результат	8.466	1.250
Общая стоимость	$1.270	$0.175
Цена входа	$5.000 / 1M	$0.250 / 1M
Цена выхода	$25.000 / 1M	$2.000 / 1M
Общее число входных токенов	60,946	46,740
Выходные токены	31,771	3,230
Токены рассуждений	6,831	78,406
Время ответа (среднее)	10.83s	47.07s
Время ответа (макс.)	127.97s	254.92s
Время ответа (суммарно)	227.39s	988.37s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low

Стоимость: $0.031
Время: 14.1s
Токены: 1,345 tok

#18 Seed-2.0-Lite

medium

Стоимость: $0.005
Время: 86.7s
Токены: 2,354 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.30s	834	793	371
Seed-2.0-Lite	8.3	10.0	75.0%	0		17.99s	942	996	7,142

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	6.6	4.6	77.8%	2		7.58s	10,590	3,637	809
Seed-2.0-Lite	8.0	9.8	66.7%	0		156.74s	8,247	458	31,890

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	9.8	10.0	100.0%	0		20.84s	23,500	2,216	1,081
Seed-2.0-Lite	10.0	10.0	100.0%	0		37.67s	16,254	506	4,299

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	6.3	5.8	66.7%	1		2.27s	10,503	310	0
Seed-2.0-Lite	10.0	10.0	100.0%	0		9.07s	8,562	246	1,742

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	5.3	10.0	33.3%	0		45.53s	975	23,311	3,908
Seed-2.0-Lite	5.9	7.2	55.6%	1		88.74s	843	15	23,897

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		2.55s	708	231	0
Seed-2.0-Lite	6.7	3.6	66.7%	1		18.25s	582	304	1,620

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	9.8	10.0	100.0%	0		2.78s	909	111	221
Seed-2.0-Lite	10.0	10.0	100.0%	0		7.26s	834	71	1,480

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		3.01s	894	592	184
Seed-2.0-Lite	9.0	7.9	88.9%	1		10.23s	894	403	3,285

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	10.0	10.0	100.0%	0		6.85s	11,775	370	35
Seed-2.0-Lite	10.0	10.0	100.0%	0		12.38s	9,306	222	1,011

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Claude Opus 4.8	3.0	10.0	0.0%	0		5.48s	258	200	222
Seed-2.0-Lite	3.0	10.0	0.0%	0		48.32s	276	9	2,040

Быстрое сравнение

Сменить пару сравнения