Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3.5-9B

Сводка

Сравнение benchmark GPT-5.4 vs Qwen3.5-9B: GPT-5.4 лидирует по среднему баллу: 5.8 vs 5.1. Qwen3.5-9B имеет более низкую стоимость benchmark: $0.006 vs $0.122. GPT-5.4 быстрее: 1.42s vs 1.89s, с долей успешных попыток 36.5% vs 20.6%.

Рекомендуемая модель: Qwen3.5-9B - Его балл близок к лучшему здесь (5.1 против 5.8), при этом он примерно в 22.6 раза дешевле, чем GPT-5.4.

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-18

Метрика GPT-5.4 GPT-5.4 none Релиз: 2026-03-05 Qwen3.5-9B Qwen3.5-9B none Релиз: 2026-03-02
Оценка 5.8 5.1
Ранг #112 #135
Надежность 10.0 10.0
Стабильность 9.2 9.7
Тестов верно
Доля успешных попыток 36.5% 20.6%
Нестабильные тесты 2 1
Всего запусков 63 63
Стоимость за результат 1.740 0.123
Общая стоимость $0.122 $0.006
Цена входа $2.500 / 1M $0.100 / 1M
Цена выхода $15.000 / 1M $0.150 / 1M
Общее число входных токенов 34,212 48,041
Выходные токены 2,417 3,952
Токены рассуждений 0 0
Время ответа (среднее) 1.42s 1.89s
Время ответа (макс.) 2.95s 6.03s
Время ответа (суммарно) 29.87s 39.68s

Генерация showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#112 GPT-5.4

none
Стоимость
$0.026
Время
18.1s
Токены
1,792 tok

#135 Qwen3.5-9B

none
Неверный SVG
Стоимость
$0.000
Время
300.0s
Токены
0 tok

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.4 3.2 8.0 8.3% 1 1.21s 606 406 0
Qwen3.5-9B 3.1 9.9 0.0% 0 1.71s 696 582 0
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.4 5.5 10.0 33.3% 0 1.62s 7,305 516 0
Qwen3.5-9B 3.9 7.8 11.1% 1 5.60s 7,913 1,042 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.4 3.0 10.0 0.0% 0 2.89s 11,019 291 0
Qwen3.5-9B 3.0 10.0 0.0% 0 5.91s 20,397 1,255 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.4 10.0 10.0 100.0% 0 1.04s 7,140 222 0
Qwen3.5-9B 10.0 10.0 100.0% 0 847ms 7,788 249 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.4 5.3 7.2 44.4% 1 1.07s 723 50 0
Qwen3.5-9B 3.0 10.0 0.0% 0 464ms 789 24 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.4 4.4 9.9 0.0% 0 1.78s 477 184 0
Qwen3.5-9B 4.4 9.9 0.0% 0 552ms 522 99 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.4 6.5 10.0 50.0% 0 1.07s 660 81 0
Qwen3.5-9B 6.5 10.0 50.0% 0 514ms 711 75 0
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.4 5.6 9.8 33.3% 0 1.44s 642 381 0
Qwen3.5-9B 3.2 10.0 0.0% 0 621ms 714 347 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.4 10.0 10.0 100.0% 0 2.75s 5,445 246 0
Qwen3.5-9B 10.0 10.0 100.0% 0 1.27s 8,301 273 0
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.4 3.0 10.0 0.0% 0 990ms 195 40 0
Qwen3.5-9B 3.0 10.0 0.0% 0 2.32s 210 6 0

Быстрое сравнение

Сменить пару сравнения