Navigare
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Google: Gemini 2.5 Flash vs OpenAI: GPT-5.3-Codex

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-15

Metrică Gemini 2.5 Flash Gemini 2.5 Flash medium Lansare: 2025-06-17 GPT-5.3-Codex GPT-5.3-Codex medium Lansare: 2026-02-05
Rang #15 #5
Scor 8.0 8.7
Consistență 9.5 9.1
Cost per rezultat 2.619 4.485
Cost total $0.288 $0.539
Teste corecte
Rată de trecere pe încercare 72.9% 83.3%
Teste instabile 1 2
Rulări totale 48 48
Tokenuri de ieșire 1,370 1,764
Tokenuri de raționament 110,522 33,348
Timp de răspuns (mediu) 12.35s 16.59s
Timp de răspuns (maxim) 95.48s 100.93s
Timp de răspuns (total) 197.62s 265.39s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Gemini 2.5 Flash 7.8 10.0 66.7% 0 6.98s 249 8,832
GPT-5.3-Codex 10.0 10.0 100.0% 0 4.69s 216 1,421
Combinat Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Gemini 2.5 Flash 10.0 10.0 100.0% 0 28.44s 303 11,922
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.56s 364 2,731
Parsare și extragere de date Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Gemini 2.5 Flash 10.0 10.0 100.0% 0 4.06s 279 2,325
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.07s 234 728
Specific domeniului Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Gemini 2.5 Flash 5.9 7.2 55.6% 1 37.34s 18 80,702
GPT-5.3-Codex 5.9 7.2 55.6% 1 64.31s 64 25,308
Inteligență generală Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Gemini 2.5 Flash 4.8 10.0 0.0% 0 4.86s 92 1,899
GPT-5.3-Codex 4.6 10.0 0.0% 0 4.87s 187 331
Respectarea instrucțiunilor Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Gemini 2.5 Flash 9.8 10.0 100.0% 0 2.62s 69 1,203
GPT-5.3-Codex 10.0 10.0 100.0% 0 3.04s 93 693
Puzzle Solving Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Gemini 2.5 Flash 7.7 10.0 66.7% 0 3.94s 126 2,499
GPT-5.3-Codex 9.0 7.9 88.9% 1 5.12s 352 1,644
Apelare instrumente Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de ieșire Tokenuri de raționament
Gemini 2.5 Flash 10.0 10.0 100.0% 0 6.20s 234 1,140
GPT-5.3-Codex 10.0 10.0 100.0% 0 6.37s 254 492

Comparație rapidă

Schimbă perechea de comparație