Навигация
AI BENCHY
Сравнить Графики
❤️ Made by XCS
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Google: Gemini 3.1 Pro Preview vs OpenAI: GPT-5.4

Сравнить:

Бенчмарки сгенерированы из тестовых наборов AI BENCHY в: 2026-03-05

Метрика Google: Gemini 3.1 Pro Preview medium Релиз: 2026-02-19 OpenAI: GPT-5.4 none Релиз: 2026-03-05
Ранг #2 #44
Средний балл 9.3 4.6
Тестов верно
Стабильность 10.0 8.9
Стоимость за результат 3.544 1.496
Общая стоимость $0.497 $0.090
Доля успешных попыток 93.3% 44.4%
Нестабильные тесты 0 2
common.totalAttempts 45 (15 x 3) 45 (15 x 3)
Выходные токены 1,413 1,635
Токены рассуждений 34,477 0
Время ответа (среднее) 17.20s 1.46s
Время ответа (макс.) 40.61s 2.89s
Время ответа (суммарно) 137.59s 21.86s

Лучшие модели по оценке

Время ответа (среднее)

Оценка vs общая стоимость

Средний балл vs Время ответа (среднее)

Разбивка по категориям

Анти-ИИ уловки Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 9.52s 106 2,533
OpenAI: GPT-5.4 10.0 7.3 11.1% 1 1.41s 388 0
Комбинированный Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Pro Preview 9.0 10.0 100.0% 0 40.61s 432 9,281
OpenAI: GPT-5.4 10.0 10.0 0.0% 0 2.89s 291 0
Парсинг и извлечение данных Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Pro Preview 9.9 10.0 100.0% 0 7.72s 279 3,904
OpenAI: GPT-5.4 9.9 10.0 100.0% 0 1.04s 222 0
Предметно-ориентированное Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Pro Preview 7.0 10.0 66.7% 0 32.73s 18 12,424
OpenAI: GPT-5.4 4.0 7.2 44.4% 1 1.07s 50 0
Следование инструкциям Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 9.56s 72 2,236
OpenAI: GPT-5.4 5.5 10.0 50.0% 0 1.07s 81 0
Puzzle Solving Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 7.15s 232 3,117
OpenAI: GPT-5.4 4.0 9.8 33.3% 0 1.52s 357 0
Вызов инструментов Оценка Стабильность Доля успешных попыток Нестабильные тесты Тестов верно Время ответа (среднее) Выходные токены Токены рассуждений
Google: Gemini 3.1 Pro Preview 10.0 10.0 100.0% 0 23.15s 274 982
OpenAI: GPT-5.4 10.0 10.0 100.0% 0 2.75s 246 0

Быстрое сравнение

Сменить пару сравнения