नेविगेशन
Advertise here

GPT-6 Luna (high) vs Step 3.7 Flash (medium)

Step 3.7 Flash (medium) average score में आगे है: 7.8 vs 7.7. GPT-6 Luna (high) की benchmark लागत कम है: $0.074 vs $0.571. GPT-6 Luna (high) तेज है: 20.37s vs 26.57s, pass rates 73.9% vs 68.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#111
कुल आउटपुट टोकन
101,587
प्रतिक्रिया समय (औसत)
20.37s
कुल लागत
$0.074
रैंक
#106
कुल आउटपुट टोकन
440,835
प्रतिक्रिया समय (औसत)
26.57s
कुल लागत
$0.571
अनुशंसित मॉडल GPT-6 Luna (high)

Its score stays close to the best score here (7.7 vs 7.8), while costing about 7.7x less than Step 3.7 Flash (medium).

विस्तृत तुलना

मेट्रिक GPT-6 Luna GPT-6 Luna high रिलीज़: 2026-09-23 Step 3.7 Flash Step 3.7 Flash medium रिलीज़: 2026-05-29
स्कोर 7.7 7.8
रैंक #111 #106
विश्वसनीयता 10.0 10.0
संगति 8.7 8.7
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 73.9% 68.1%
अस्थिर टेस्ट 4 4
कुल रन 69 69
प्रति परिणाम लागत 0.492 4.392
कुल लागत $0.074 $0.571
इनपुट कीमत $0.100 / 1M $0.200 / 1M
आउटपुट कीमत $0.500 / 1M $1.150 / 1M
कुल इनपुट टोकन 229,986 319,524
आउटपुट टोकन 6,037 440,835
रीजनिंग टोकन 95,550 0
प्रतिक्रिया समय (औसत) 20.37s 26.57s
प्रतिक्रिया समय (अधिकतम) 106.93s 152.83s
प्रतिक्रिया समय (कुल) 468.52s 611.09s
पैरामीटर ~400B कुल (~17B सक्रिय) 198B कुल (11B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#111 GPT-6 Luna

high
लागत
$0.003
समय
49.2s
टोकन
5,231 tok

#106 Step 3.7 Flash

medium
लागत
$0.006
समय
46.2s
टोकन
4,466 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-6 Luna 7.8 7.4 77.8% 1 24.69s 7,302 483 15,691
Step 3.7 Flash 8.8 7.8 88.9% 1 27.42s 7,437 44,797 0

त्वरित तुलना

तुलना जोड़ी बदलें