नेव्हिगेशन
AI BENCHY
Advertise here

GPT-5.5 (medium) vs Qwen3.8 Max (medium)

Qwen3.8 Max (medium) average score मध्ये पुढे आहे: 9.1 vs 9.0. Qwen3.8 Max (medium) चा benchmark खर्च कमी आहे: $0.728 vs $4.137. Qwen3.8 Max (medium) वेगवान आहे: 21.53s vs 38.42s, pass rates 87.9% vs 84.9%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-04

क्रमांक
#15
एकूण आउटपुट टोकन्स
124,436
प्रतिसाद वेळ (सरासरी)
38.42s
एकूण खर्च
$4.137
क्रमांक
#14
एकूण आउटपुट टोकन्स
84,826
प्रतिसाद वेळ (सरासरी)
21.53s
एकूण खर्च
$0.728
शिफारस केलेले मॉडेल Qwen3.8 Max (medium)

It has the best score here (9.1), while costing about 5.7x less than GPT-5.5 (medium).

तपशीलवार तुलना

मेट्रिक GPT-5.5 GPT-5.5 medium प्रकाशन: 2026-04-24 Qwen3.8 Max Qwen3.8 Max medium प्रकाशन: 2026-08-04
स्कोअर 9.0 9.1
क्रमांक #15 #14
विश्वसनीयता 10.0 10.0
सुसंगतता 8.9 9.7
बेंचमार्क कव्हरेज 22/22 चाचण्या · 66/66 प्रयत्न 22/22 चाचण्या · 66/66 प्रयत्न
बरोबर चाचण्या
प्रति प्रयत्न पास दर 87.9% 84.9%
अस्थिर चाचण्या 3 1
एकूण रन 66 66
प्रति निकाल खर्च 22.980 4.040
एकूण खर्च $4.137 $0.728
इनपुट किंमत $5.000 / 1M $2.000 / 1M
आउटपुट किंमत $30.000 / 1M $6.000 / 1M
एकूण इनपुट टोकन्स 80,659 109,046
आउटपुट टोकन्स 5,617 6,567
रिझनिंग टोकन्स 118,819 78,259
प्रतिसाद वेळ (सरासरी) 38.42s 21.53s
प्रतिसाद वेळ (कमाल) 332.10s 126.60s
प्रतिसाद वेळ (एकूण) 845.35s 473.75s

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#15 GPT-5.5

medium
खर्च
$0.112
वेळ
71.9s
टोकन्स
3,807 tok

#14 Qwen3.8 Max

medium
खर्च
$0.028
वेळ
71.9s
टोकन्स
4,750 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
GPT-5.5 8.8 7.8 88.9% 1 59.77s 7,305 362 24,959
Qwen3.8 Max 10.0 10.0 100.0% 0 41.35s 7,893 430 23,804

झटपट तुलना

तुलना जोडी बदला