नेविगेशन
AI BENCHY
Advertise here

GPT-5.6 Luna (low) vs Qwen3.7 Flash

GPT-5.6 Luna (low) average score में आगे है: 6.2 vs 6.1. Qwen3.7 Flash की benchmark लागत कम है: $0.019 vs $0.125. GPT-5.6 Luna (low) तेज है: 5.04s vs 10.06s, pass rates 56.1% vs 36.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-28

रैंक
#131
कुल आउटपुट टोकन
25,438
प्रतिक्रिया समय (औसत)
5.04s
कुल लागत
$0.125
रैंक
#136
कुल आउटपुट टोकन
90,507
प्रतिक्रिया समय (औसत)
10.06s
कुल लागत
$0.019
अनुशंसित मॉडल Qwen3.7 Flash

Its score stays close to the best score here (6.1 vs 6.2), while costing about 6.8x less than GPT-5.6 Luna (low).

विस्तृत तुलना

मेट्रिक GPT-5.6 Luna GPT-5.6 Luna low रिलीज़: 2026-07-09 Qwen3.7 Flash Qwen3.7 Flash none रिलीज़: 2026-07-28
स्कोर 6.2 6.1
रैंक #131 #136
विश्वसनीयता 10.0 10.0
संगति 8.2 9.2
सही परीक्षण
प्रति प्रयास पास दर 56.1% 36.4%
अस्थिर टेस्ट 5 2
कुल रन 66 66
प्रति परिणाम लागत 2.490 0.262
कुल लागत $0.125 $0.019
इनपुट कीमत $0.500 / 1M $0.030 / 1M
आउटपुट कीमत $3.000 / 1M $0.130 / 1M
कुल इनपुट टोकन 96,346 218,731
आउटपुट टोकन 8,211 90,507
रीजनिंग टोकन 17,227 0
प्रतिक्रिया समय (औसत) 5.04s 10.06s
प्रतिक्रिया समय (अधिकतम) 19.44s 186.24s
प्रतिक्रिया समय (कुल) 110.88s 221.34s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#131 GPT-5.6 Luna

low
लागत
$0.011
समय
10.2s
टोकन
1,897 tok

#136 Qwen3.7 Flash

none
लागत
$0.001
समय
34.0s
टोकन
4,814 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.6 Luna 5.5 10.0 33.3% 0 4.61s 7,302 557 3,535
Qwen3.7 Flash 5.5 10.0 33.3% 0 1.55s 7,911 855 0

त्वरित तुलना

तुलना जोड़ी बदलें