Навигация
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Сравниваемые модели

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-06-04

Метрика GPT-5.2 Chat GPT-5.2 Chat none Релиз: 2025-12-11 GPT-5.3 Chat GPT-5.3 Chat none Релиз: 2026-03-03 Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview low Релиз: 2026-03-03
Оценка 7.9 7.2 7.4
Ранг #24 #63 #50
Надежность 10.0 10.0 10.0
Стабильность 8.9 8.1 10.0
Тестов верно
Доля успешных попыток 74.6% 66.7% 61.9%
Нестабильные тесты 3 5 0
Всего запусков 63 63 63
Стоимость за результат 2.803 3.605 0.196
Общая стоимость $0.393 $0.433 $0.026
Цена входа $1.750 / 1M $1.750 / 1M $0.250 / 1M
Цена выхода $14.000 / 1M $14.000 / 1M $1.500 / 1M
Общее число входных токенов 34,212 34,209 32,715
Выходные токены 23,744 26,617 2,286
Токены рассуждений 0 0 9,166
Время ответа (среднее) 7.13s 6.34s 2.77s
Время ответа (макс.) 38.52s 18.33s 11.91s
Время ответа (суммарно) 149.69s 133.13s 58.12s

Лучшие модели по оценке

Оценка vs общая стоимость

Время ответа (среднее)

Оценка vs Время ответа (среднее)

Общее число выходных токенов

Оценка vs Общее число выходных токенов

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 8.7 7.9 91.7% 1 3.40s 606 1,807 0
GPT-5.3 Chat 6.7 8.1 58.3% 1 3.86s 606 3,167 0
Gemini 3.1 Flash Lite Preview 8.3 10.0 75.0% 0 2.12s 506 462 1,638
Программирование Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 8.8 7.8 88.9% 1 9.82s 7,305 6,731 0
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0
Gemini 3.1 Flash Lite Preview 5.5 10.0 33.3% 0 1.39s 8,138 660 1,060
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 10.0 10.0 100.0% 0 9.12s 11,019 1,243 0
GPT-5.3 Chat 10.0 10.0 100.0% 0 11.96s 11,019 2,614 0
Gemini 3.1 Flash Lite Preview 3.0 10.0 0.0% 0 11.91s 8,381 225 762
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 10.0 10.0 100.0% 0 3.05s 7,140 980 0
GPT-5.3 Chat 10.0 10.0 100.0% 0 2.21s 7,140 942 0
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 3.00s 7,455 291 696
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 5.3 10.0 33.3% 0 17.78s 723 7,810 0
GPT-5.3 Chat 3.5 4.4 33.3% 2 13.01s 723 8,264 0
Gemini 3.1 Flash Lite Preview 5.3 10.0 33.3% 0 2.36s 641 18 1,212
Общий интеллект Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 4.4 3.0 33.3% 1 3.20s 477 335 0
GPT-5.3 Chat 4.6 10.0 0.0% 0 1.99s 477 319 0
Gemini 3.1 Flash Lite Preview 4.0 10.0 0.0% 0 1.54s 490 69 384
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 9.8 10.0 100.0% 0 5.51s 660 1,441 0
GPT-5.3 Chat 9.8 10.0 100.0% 0 3.51s 660 1,491 0
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 1.49s 621 72 753
Решение головоломок Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 7.7 10.0 66.7% 0 4.10s 642 1,603 0
GPT-5.3 Chat 10.0 10.0 100.0% 0 2.99s 642 1,758 0
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 1.69s 566 243 1,248
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 10.0 10.0 100.0% 0 4.68s 5,445 555 0
GPT-5.3 Chat 10.0 10.0 100.0% 0 8.36s 5,445 861 0
Gemini 3.1 Flash Lite Preview 10.0 10.0 100.0% 0 9.54s 5,757 237 993
Эрудиция Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Входные токены Выходные токены Токены рассуждений
GPT-5.2 Chat 3.0 10.0 0.0% 0 6.89s 195 1,239 0
GPT-5.3 Chat 3.0 10.0 0.0% 0 4.38s 195 569 0
Gemini 3.1 Flash Lite Preview 3.0 10.0 0.0% 0 1.35s 160 9 420

Быстрое сравнение

Сменить пару сравнения