नेविगेशन
Advertise here

GPT-6 Luna (medium) vs Step 3.7 Flash (medium)

average score लगभग बराबर है: 7.9 vs 7.9. GPT-6 Luna (medium) की benchmark लागत कम है: $0.031 vs $0.495. GPT-6 Luna (medium) तेज है: 15.87s vs 23.51s, pass rates 72.7% vs 68.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-23

तुलना किए गए मॉडल

रैंक
#94
कुल आउटपुट टोकन
45,154
प्रतिक्रिया समय (औसत)
15.87s
कुल लागत
$0.031
रैंक
#92
कुल आउटपुट टोकन
409,709
प्रतिक्रिया समय (औसत)
23.51s
कुल लागत
$0.495
अनुशंसित मॉडल GPT-6 Luna (medium)

It has the best score here (7.9), while costing about 16.2x less than Step 3.7 Flash (medium).

विस्तृत तुलना

मेट्रिक GPT-6 Luna GPT-6 Luna medium रिलीज़: 2026-09-23 Step 3.7 Flash Step 3.7 Flash medium रिलीज़: 2026-05-29
स्कोर 7.9 7.9
रैंक #94 #92
विश्वसनीयता 10.0 10.0
संगति 8.9 8.9
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 72.7% 68.2%
अस्थिर टेस्ट 3 3
कुल रन 66 66
प्रति परिणाम लागत 0.218 3.801
कुल लागत $0.031 $0.495
इनपुट कीमत $0.100 / 1M $0.200 / 1M
आउटपुट कीमत $0.500 / 1M $1.150 / 1M
कुल इनपुट टोकन 78,946 114,191
आउटपुट टोकन 4,635 409,709
रीजनिंग टोकन 40,519 0
प्रतिक्रिया समय (औसत) 15.87s 23.51s
प्रतिक्रिया समय (अधिकतम) 35.14s 152.83s
प्रतिक्रिया समय (कुल) 349.09s 517.21s
पैरामीटर ~400B कुल (~17B सक्रिय) 198B कुल (11B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#94 GPT-6 Luna

medium
लागत
$0.002
समय
23.6s
टोकन
2,966 tok

#92 Step 3.7 Flash

medium
लागत
$0.006
समय
46.2s
टोकन
4,466 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-6 Luna 6.6 4.6 77.8% 2 23.63s 7,302 438 10,222
Step 3.7 Flash 8.8 7.8 88.9% 1 27.42s 7,437 44,797 0

त्वरित तुलना

तुलना जोड़ी बदलें