Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

OpenAI: GPT-5.2 Chat vs Qwen: Qwen3.5-27B

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-04

Метрика GPT-5.2 Chat GPT-5.2 Chat none Релиз: 2025-12-11 Qwen3.5-27B Qwen3.5-27B medium Релиз: 2026-02-24
Оценка 7.9 7.8
Ранг #24 #30
Надежность 10.0 10.0
Стабильность 8.9 8.5
Тестов верно
Доля успешных попыток 74.6% 73.0%
Нестабильные тесты 3 4
Всего запусков 63 63
Стоимость за результат 2.803 4.901
Общая стоимость $0.393 $0.536
Цена входа $1.750 / 1M $0.195 / 1M
Цена выхода $14.000 / 1M $1.560 / 1M
Общее число входных токенов 34,212 42,164
Выходные токены 23,744 8,534
Токены рассуждений 0 329,289
Время ответа (среднее) 7.13s 68.39s
Время ответа (макс.) 38.52s 234.36s
Время ответа (суммарно) 149.69s 1436.24s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 8.7 7.9 91.7% 1 3.40s 606 1,807 0
Qwen3.5-27B 8.7 7.9 91.7% 1 19.75s 672 569 31,505
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 8.8 7.8 88.9% 1 9.82s 7,305 6,731 0
Qwen3.5-27B 6.2 7.1 55.6% 1 160.69s 7,895 6,381 89,388
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 10.0 10.0 100.0% 0 9.12s 11,019 1,243 0
Qwen3.5-27B 10.0 10.0 100.0% 0 163.96s 14,946 483 9,991
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 10.0 10.0 100.0% 0 3.05s 7,140 980 0
Qwen3.5-27B 10.0 10.0 100.0% 0 30.26s 7,782 270 16,150
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 5.3 10.0 33.3% 0 17.78s 723 7,810 0
Qwen3.5-27B 5.3 10.0 33.3% 0 79.53s 553 43 52,368
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 4.4 3.0 33.3% 1 3.20s 477 335 0
Qwen3.5-27B 6.1 3.1 66.7% 1 101.41s 524 70 23,147
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 9.8 10.0 100.0% 0 5.51s 660 1,441 0
Qwen3.5-27B 10.0 10.0 100.0% 0 19.66s 699 97 11,638
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 7.7 10.0 66.7% 0 4.10s 642 1,603 0
Qwen3.5-27B 8.2 7.7 77.8% 1 59.60s 696 242 70,096
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 10.0 10.0 100.0% 0 4.68s 5,445 555 0
Qwen3.5-27B 10.0 10.0 100.0% 0 7.45s 8,193 348 1,323
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 3.0 10.0 0.0% 0 6.89s 195 1,239 0
Qwen3.5-27B 3.0 10.0 0.0% 0 85.11s 204 31 23,683

Быстрое сравнение

Сменить пару сравнения