नेविगेशन
AI BENCHY
Advertise here

तुलना किए गए मॉडल

GPT-5.2 Chat vs GPT-5.3 Chat vs Gemini 3.1 Flash Lite Preview (low) benchmark तुलनाGPT-5.2 Chat स्कोर में 8.0 के साथ आगे है। GPT-5.2 Chat विश्वसनीयता में 10.0 के साथ आगे है। GPT-5.3 Chat का कुल लागत सबसे कम है: $0.571. GPT-5.3 Chat 6.88s पर सबसे तेज है।

अनुशंसित मॉडलGPT-5.2 ChatIt has the best score here (8.0), while responding about 1.5x faster than इस तुलना के बाकी मॉडल.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-21

मेट्रिक GPT-5.2 Chat GPT-5.2 Chat none रिलीज़: 2025-12-11 GPT-5.3 Chat GPT-5.3 Chat none रिलीज़: 2026-03-03 Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview low रिलीज़: 2026-03-03
स्कोर 8.0 7.5 6.5
रैंक #34 #58 #110
विश्वसनीयता 10.0 10.0 10.0
संगति 8.6 8.2 10.0
सही परीक्षण
प्रति प्रयास पास दर 74.2% 68.2% 59.1%
अस्थिर टेस्ट 4 5 0
कुल रन 66 66 66
प्रति परिणाम लागत 4.308 4.387 4.969
कुल लागत $0.604 $0.571 $0.646
इनपुट कीमत $1.750 / 1M $1.750 / 1M $0.250 / 1M
आउटपुट कीमत $14.000 / 1M $14.000 / 1M $1.500 / 1M
कुल इनपुट टोकन 101,248 78,990 110,185
आउटपुट टोकन 30,424 30,854 14,717
रीजनिंग टोकन 0 0 397,483
प्रतिक्रिया समय (औसत) 7.65s 6.88s 16.70s
प्रतिक्रिया समय (अधिकतम) 38.52s 18.33s 309.35s
प्रतिक्रिया समय (कुल) 168.39s 151.31s 367.47s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#34 GPT-5.2 Chat

none
लागत
$0.010
समय
15.3s
टोकन
797 tok

#58 GPT-5.3 Chat

none
लागत
$0.008
समय
8.1s
टोकन
634 tok

#110 Gemini 3.1 Flash Lite Preview

low
लागत
$0.002
समय
3.7s
टोकन
1,203 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.2 Chat 8.8 7.8 88.9% 1 9.82s 7,305 6,731 0
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0
Gemini 3.1 Flash Lite Preview 5.5 10.0 33.3% 0 1.39s 8,138 660 1,060

त्वरित तुलना

तुलना जोड़ी बदलें