Навигация
AI BENCHY
Сравнить Графики Методология
❤️ Made by XCS
Your ad here

AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3.5 Plus 2026-02-15

Сравнить:

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-06

Метрика OpenAI: GPT-5.4 medium Релиз: 2026-03-05 Qwen: Qwen3.5 Plus 2026-02-15 none Релиз: 2026-02-15
Ранг #9 #29
Средний балл 8.0 6.2
Стабильность 8.5 9.6
Стоимость за результат 6.601 0.172
Общая стоимость $0.793 $0.016
Тестов верно
Доля успешных попыток 83.3% 58.3%
Нестабильные тесты 3 1
Всего запусков 48 (16 x 3) 48 (16 x 3)
Выходные токены 1,756 2,015
Токены рассуждений 46,642 0
Время ответа (среднее) 20.05s 2.65s
Время ответа (макс.) 100.41s 6.65s
Время ответа (суммарно) 320.87s 26.52s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Средний балл vs Время ответа (среднее)

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
OpenAI: GPT-5.4 10.0 10.0 100.0% 0 5.02s 216 1,466
Qwen: Qwen3.5 Plus 2026-02-15 4.0 10.0 33.3% 0 2.74s 514 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
OpenAI: GPT-5.4 10.0 10.0 100.0% 0 20.57s 301 3,543
Qwen: Qwen3.5 Plus 2026-02-15 10.0 10.0 0.0% 0 6.65s 314 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
OpenAI: GPT-5.4 9.9 10.0 100.0% 0 5.32s 234 804
Qwen: Qwen3.5 Plus 2026-02-15 9.9 10.0 100.0% 0 1.89s 243 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
OpenAI: GPT-5.4 4.0 7.2 44.4% 1 74.27s 61 34,748
Qwen: Qwen3.5 Plus 2026-02-15 4.0 10.0 33.3% 0 1.17s 17 0
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
OpenAI: GPT-5.4 5.0 3.1 33.3% 1 4.92s 145 321
Qwen: Qwen3.5 Plus 2026-02-15 4.0 3.0 33.3% 1 2.26s 117 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
OpenAI: GPT-5.4 10.0 10.0 100.0% 0 3.11s 93 897
Qwen: Qwen3.5 Plus 2026-02-15 10.0 10.0 100.0% 0 1.67s 72 0
Puzzle Solving Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
OpenAI: GPT-5.4 7.0 7.2 88.9% 1 9.13s 442 3,832
Qwen: Qwen3.5 Plus 2026-02-15 7.0 10.0 66.7% 0 2.82s 516 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
OpenAI: GPT-5.4 10.0 10.0 100.0% 0 13.28s 264 1,031
Qwen: Qwen3.5 Plus 2026-02-15 10.0 10.0 100.0% 0 3.33s 222 0

Быстрое сравнение

Сменить пару сравнения