Навигация
AI BENCHY
Сравнить Графики Методология
❤️ Made by XCS
Your ad here

AI BENCHY Compare

Google: Gemini 3.1 Flash Lite Preview vs Qwen: Qwen3.5-Flash

Сравнить:

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-06

Метрика Google: Gemini 3.1 Flash Lite Preview high Релиз: 2026-03-03 Qwen: Qwen3.5-Flash medium Релиз: 2026-02-24
Ранг #8 #24
Средний балл 8.2 6.9
Стабильность 9.6 7.5
Стоимость за результат 19.243 0.720
Общая стоимость $2.310 $0.072
Тестов верно
Доля успешных попыток 77.1% 81.3%
Нестабильные тесты 1 5
common.totalRuns 48 (16 x 3) 48 (16 x 3)
Выходные токены 1,283 1,807
Токены рассуждений 1,533,310 169,952
Время ответа (среднее) 68.83s 70.81s
Время ответа (макс.) 280.52s 234.29s
Время ответа (суммарно) 1101.32s 1132.90s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Средний балл vs Время ответа (среднее)

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 43.87s 144 193,077
Qwen: Qwen3.5-Flash 10.0 10.0 100.0% 0 71.35s 363 23,645
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 280.52s 335 380,440
Qwen: Qwen3.5-Flash 10.0 10.0 100.0% 0 17.78s 483 8,270
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview 9.9 10.0 100.0% 0 7.16s 279 6,186
Qwen: Qwen3.5-Flash 5.5 5.9 83.3% 1 56.99s 235 16,237
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview 4.0 10.0 33.3% 0 127.58s 18 566,202
Qwen: Qwen3.5-Flash 4.0 7.2 44.4% 1 146.50s 58 43,615
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 5.25s 117 3,915
Qwen: Qwen3.5-Flash 5.0 3.1 66.7% 1 40.05s 99 38,486
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview 9.0 6.9 66.7% 1 70.07s 69 190,053
Qwen: Qwen3.5-Flash 10.0 10.0 100.0% 0 63.49s 98 14,139
Puzzle Solving Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview 7.0 10.0 66.7% 0 46.33s 87 190,953
Qwen: Qwen3.5-Flash 4.0 4.4 77.8% 2 56.74s 162 24,276
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 7.73s 234 2,484
Qwen: Qwen3.5-Flash 10.0 10.0 100.0% 0 10.33s 309 1,284

Быстрое сравнение

Сменить пару сравнения