AI BENCHY Compare

Poolside: Laguna XS 2.1 vs xAI: Grok 4.20

Сводка

Сравнение benchmark Laguna XS 2.1 vs Grok 4.20: Laguna XS 2.1 лидирует по среднему баллу: 5.3 vs 4.4. Laguna XS 2.1 имеет более низкую стоимость benchmark: $0.003 vs $0.057. Laguna XS 2.1 быстрее: 722ms vs 1.11s, с долей успешных попыток 31.8% vs 28.6%.

Рекомендуемая модель: Laguna XS 2.1 - Здесь у него лучший балл (5.3), при этом он примерно в 19.6 раза дешевле, чем Grok 4.20.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-07-02

Метрика	Laguna XS 2.1 Laguna XS 2.1 none Релиз: 2026-07-02 Бесплатно доступно	Grok 4.20 Grok 4.20 none Релиз: 2026-03-31

Метрика	Laguna XS 2.1 Laguna XS 2.1 none Релиз: 2026-07-02 Бесплатно доступно	Grok 4.20 Grok 4.20 none Релиз: 2026-03-31
Оценка	5.3	4.4
Ранг	#128	#160
Надежность	10.0	Н/Д
Стабильность	9.0	8.5
Тестов верно
Доля успешных попыток	31.8%	28.6%
Нестабильные тесты	3	0
Всего запусков	63	54
Стоимость за результат	0.058	1.570
Общая стоимость	$0.003	$0.057
Цена входа	$0.060 / 1M	$1.250 / 1M
Цена выхода	$0.120 / 1M	$2.500 / 1M
Общее число входных токенов	41,148	41,313
Выходные токены	3,451	1,923
Токены рассуждений	0	0
Время ответа (среднее)	722ms	1.11s
Время ответа (макс.)	2.30s	6.04s
Время ответа (суммарно)	15.17s	19.96s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#128 Laguna XS 2.1

none

Стоимость: $0.001
Время: 27.6s
Токены: 4,344 tok

#160 xAI: Grok 4.20

none

Стоимость: $0.004
Время: 6.5s
Токены: 1,367 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Laguna XS 2.1	5.3	8.3	33.3%	1		755ms	774	1,015	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	1,986	267	0

Программирование	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Laguna XS 2.1	4.3	7.8	22.2%	1		623ms	7,995	562	0
Grok 4.20	1.1	3.1	0.0%	0		1.22s	1,074	312	0

Комбинированный	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Laguna XS 2.1	3.0	10.0	0.0%	0		1.76s	14,197	402	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	17,673	282	0

Парсинг и извлечение данных	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Laguna XS 2.1	10.0	10.0	100.0%	0		768ms	7,734	240	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	7,749	207	0

Предметно-ориентированное	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Laguna XS 2.1	5.3	10.0	33.3%	0		364ms	834	14	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	1,746	325	0

Общий интеллект	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Laguna XS 2.1	5.0	10.0	0.0%	0		529ms	537	128	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	819	83	0

Следование инструкциям	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Laguna XS 2.1	3.8	5.8	33.3%	1		364ms	638	50	0
Grok 4.20	6.3	10.0	50.0%	0		445ms	1,350	60	0

Решение головоломок	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Laguna XS 2.1	3.0	10.0	0.0%	0		1.01s	771	730	0
Grok 4.20	5.3	10.0	33.3%	0		473ms	1,671	198	0

Вызов инструментов	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Laguna XS 2.1	10.0	10.0	100.0%	0		1.36s	7,413	300	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	7,245	189	0

Эрудиция	Оценка	Стабильность	Доля успешных попыток	Нестабильные тесты	Тестов верно	Время ответа (среднее)	Входные токены	Выходные токены	Токены рассуждений
Laguna XS 2.1	3.0	10.0	0.0%	0		254ms	255	10	0
Grok 4.20	0.0	0.0	0.0%	0		0ms	0	0	0

Быстрое сравнение

Сменить пару сравнения

Grok 4.20nonevsGLM 4.7 Flashmedium MiniMax M2.7mediumvsLaguna XS 2.1noneБесплатно доступно Mistral Small 4mediumvsLaguna XS 2.1noneБесплатно доступно Qwen3 Coder NextmediumvsGrok 4.20none MiniMax M2.5mediumvsGrok 4.20none CobuddymediumvsLaguna XS 2.1noneБесплатно доступно North Mini CodemediumБесплатно доступноvsLaguna XS 2.1noneБесплатно доступно CobuddymediumvsGrok 4.20none Qwen3.5-9BmediumvsGrok 4.20none MiniMax M2.5mediumvsLaguna XS 2.1noneБесплатно доступно Laguna XS 2.1noneБесплатно доступноvsQwen3 Coder Nextmedium Mistral Small 4mediumvsGrok 4.20none