Сравнить Графики Методология

Язык:

❤️ Made by XCS

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs OpenAI: GPT-5.4

Сравнить:

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-06

Метрика	Anthropic: Claude Sonnet 4.6 none Релиз: 2026-02-17	OpenAI: GPT-5.4 medium Релиз: 2026-03-05
Ранг	#25	#9
Средний балл	6.8	8.0
Стабильность	9.6	8.5
Стоимость за результат	2.504	6.601
Общая стоимость	$0.251	$0.793
Тестов верно
Доля успешных попыток	66.7%	83.3%
Нестабильные тесты	1	3
Всего запусков	48 (16 x 3)	48 (16 x 3)
Выходные токены	6,895	1,756
Токены рассуждений	0	46,642
Время ответа (среднее)	5.57s	20.05s
Время ответа (макс.)	23.84s	100.41s
Время ответа (суммарно)	50.12s	320.87s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Средний балл vs Время ответа (среднее)

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Anthropic: Claude Sonnet 4.6	4.0	10.0	33.3%	0		4.83s	1,199	0
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		5.02s	216	1,466

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Anthropic: Claude Sonnet 4.6	9.0	10.0	100.0%	0		23.84s	3,766	0
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		20.57s	301	3,543

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Anthropic: Claude Sonnet 4.6	9.9	10.0	100.0%	0		3.43s	252	0
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		5.32s	234	804

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Anthropic: Claude Sonnet 4.6	7.0	10.0	66.7%	0		3.54s	413	0
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		74.27s	61	34,748

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Anthropic: Claude Sonnet 4.6	5.0	3.1	66.7%	1		2.56s	192	0
OpenAI: GPT-5.4	5.0	3.1	33.3%	1		4.92s	145	321

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Anthropic: Claude Sonnet 4.6	5.5	10.0	50.0%	0		1.96s	90	0
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		3.11s	93	897

Puzzle Solving	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Anthropic: Claude Sonnet 4.6	7.0	10.0	66.7%	0		2.92s	536	0
OpenAI: GPT-5.4	7.0	7.2	88.9%	1		9.13s	442	3,832

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Выходные токены	Токены рассуждений
Anthropic: Claude Sonnet 4.6	10.0	10.0	100.0%	0		4.11s	447	0
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		13.28s	264	1,031

Быстрое сравнение

Сменить пару сравнения

Claude Sonnet 4.6nonevsQwen3.5-Flashmedium Claude Sonnet 4.6nonevsSeed-2.0-Minimedium Gemini 3.1 Flash Lite PreviewhighvsGPT-5.4medium Gemini 3 Flash PreviewlowvsGPT-5.4medium Claude Sonnet 4.6nonevsGPT-5.2medium Claude Sonnet 4.6nonevsKimi K2.5medium Claude Sonnet 4.6nonevsMiMo-V2-Flashmedium Claude Sonnet 4.6nonevsDeepSeek V3.2medium Claude Sonnet 4.6nonevsGemini 3.1 Flash Lite Previewlow Claude Sonnet 4.6nonevsGrok 4.1 Fastmedium Claude Sonnet 4.6nonevsGemini 2.5 Flashmedium Claude Sonnet 4.6nonevsGLM 5medium