नेविगेशन
AI BENCHY
Advertise here

Claude Sonnet 4.6 vs GPT-5.6 Luna (medium)

GPT-5.6 Luna (medium) average score में आगे है: 7.4 vs 7.3. GPT-5.6 Luna (medium) की benchmark लागत कम है: $0.072 vs $0.661. GPT-5.6 Luna (medium) तेज है: 7.43s vs 7.67s, pass rates 57.6% vs 62.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-20

रैंक
#98
कुल आउटपुट टोकन
19,362
प्रतिक्रिया समय (औसत)
7.67s
कुल लागत
$0.661
रैंक
#93
कुल आउटपुट टोकन
44,525
प्रतिक्रिया समय (औसत)
7.43s
कुल लागत
$0.072
अनुशंसित मॉडल GPT-5.6 Luna (medium)

It has the best score here (7.4), while costing about 9.3x less than Claude Sonnet 4.6.

विस्तृत तुलना

मेट्रिक Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17 GPT-5.6 Luna GPT-5.6 Luna medium रिलीज़: 2026-07-09
स्कोर 7.3 7.4
रैंक #98 #93
विश्वसनीयता 10.0 10.0
संगति 9.7 9.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 57.6% 62.1%
अस्थिर टेस्ट 1 2
कुल रन 66 66
प्रति परिणाम लागत 5.503 2.601
कुल लागत $0.661 $0.072
इनपुट कीमत $3.000 / 1M $0.200 / 1M
आउटपुट कीमत $15.000 / 1M $1.200 / 1M
कुल इनपुट टोकन 123,273 89,685
आउटपुट टोकन 19,362 5,701
रीजनिंग टोकन 0 38,824
प्रतिक्रिया समय (औसत) 7.67s 7.43s
प्रतिक्रिया समय (अधिकतम) 51.18s 29.85s
प्रतिक्रिया समय (कुल) 122.78s 163.54s
पैरामीटर ~1T कुल (~100B सक्रिय) ~400B कुल (~17B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#98 Claude Sonnet 4.6

none
लागत
$0.038
समय
27.3s
टोकन
2,598 tok

#93 GPT-5.6 Luna

medium
लागत
$0.014
समय
14.6s
टोकन
2,362 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
GPT-5.6 Luna 5.4 7.2 44.4% 1 10.38s 7,302 564 9,928

त्वरित तुलना

तुलना जोड़ी बदलें