नेविगेशन
AI BENCHY
Advertise here

GPT-5.6 Luna (high) vs Qwen3.7 Flash (high)

Qwen3.7 Flash (high) average score में आगे है: 7.8 vs 7.7. Qwen3.7 Flash (high) की benchmark लागत कम है: $0.051 vs $0.509. GPT-5.6 Luna (high) तेज है: 18.68s vs 39.77s, pass rates 72.7% vs 72.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-28

रैंक
#52
कुल आउटपुट टोकन
155,998
प्रतिक्रिया समय (औसत)
18.68s
कुल लागत
$0.509
रैंक
#48
कुल आउटपुट टोकन
359,703
प्रतिक्रिया समय (औसत)
39.77s
कुल लागत
$0.051
अनुशंसित मॉडल Qwen3.7 Flash (high)

It has the best score here (7.8), while costing about 10.1x less than GPT-5.6 Luna (high).

विस्तृत तुलना

मेट्रिक GPT-5.6 Luna GPT-5.6 Luna high रिलीज़: 2026-07-09 Qwen3.7 Flash Qwen3.7 Flash high रिलीज़: 2026-07-28
स्कोर 7.7 7.8
रैंक #52 #48
विश्वसनीयता 10.0 10.0
संगति 8.9 7.8
सही परीक्षण
प्रति प्रयास पास दर 72.7% 72.7%
अस्थिर टेस्ट 3 6
कुल रन 66 66
प्रति परिणाम लागत 6.780 0.387
कुल लागत $0.509 $0.051
इनपुट कीमत $0.500 / 1M $0.030 / 1M
आउटपुट कीमत $3.000 / 1M $0.130 / 1M
कुल इनपुट टोकन 80,918 116,322
आउटपुट टोकन 5,088 12,332
रीजनिंग टोकन 150,910 347,371
प्रतिक्रिया समय (औसत) 18.68s 39.77s
प्रतिक्रिया समय (अधिकतम) 111.09s 431.47s
प्रतिक्रिया समय (कुल) 411.05s 875.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#52 GPT-5.6 Luna

high
लागत
$0.033
समय
34.2s
टोकन
5,484 tok

#48 Qwen3.7 Flash

high
अमान्य SVG
लागत
$0.000
समय
600.0s
टोकन
0 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
GPT-5.6 Luna 5.5 4.7 55.6% 2 15.63s 7,302 510 17,746
Qwen3.7 Flash 8.2 9.7 66.7% 0 58.84s 7,893 503 62,350

त्वरित तुलना

तुलना जोड़ी बदलें