नेविगेशन
AI BENCHY
Advertise here

GPT-5.2 Chat vs Step 3.7 Flash (medium)

average score लगभग बराबर है: 7.9 vs 7.9. Step 3.7 Flash (medium) की benchmark लागत कम है: $0.495 vs $0.594. GPT-5.2 Chat तेज है: 7.73s vs 23.51s, pass rates 69.7% vs 68.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-26

रैंक
#60
कुल आउटपुट टोकन
29,742
प्रतिक्रिया समय (औसत)
7.73s
कुल लागत
$0.594
रैंक
#61
कुल आउटपुट टोकन
409,709
प्रतिक्रिया समय (औसत)
23.51s
कुल लागत
$0.495
अनुशंसित मॉडल GPT-5.2 Chat

It has the best score here (7.9), while responding about 3.0x faster than Step 3.7 Flash (medium).

विस्तृत तुलना

मेट्रिक GPT-5.2 Chat GPT-5.2 Chat none रिलीज़: 2025-12-11 Step 3.7 Flash Step 3.7 Flash medium रिलीज़: 2026-05-29
स्कोर 7.9 7.9
रैंक #60 #61
विश्वसनीयता 10.0 10.0
संगति 8.6 8.9
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 69.7% 68.2%
अस्थिर टेस्ट 4 3
कुल रन 66 66
प्रति परिणाम लागत 4.564 3.801
कुल लागत $0.594 $0.495
इनपुट कीमत $1.750 / 1M $0.200 / 1M
आउटपुट कीमत $14.000 / 1M $1.150 / 1M
कुल इनपुट टोकन 101,104 114,191
आउटपुट टोकन 29,742 409,709
रीजनिंग टोकन 0 0
प्रतिक्रिया समय (औसत) 7.73s 23.51s
प्रतिक्रिया समय (अधिकतम) 38.52s 152.83s
प्रतिक्रिया समय (कुल) 162.40s 517.21s
पैरामीटर ~400B कुल (~17B सक्रिय) 198B कुल (11B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 GPT-5.2 Chat

none
लागत
$0.010
समय
15.3s
टोकन
797 tok

#61 Step 3.7 Flash

medium
लागत
$0.006
समय
46.2s
टोकन
4,466 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.2 Chat 8.8 7.8 88.9% 1 9.82s 7,305 6,731 0
Step 3.7 Flash 8.8 7.8 88.9% 1 27.42s 7,437 44,797 0

त्वरित तुलना

तुलना जोड़ी बदलें