नेव्हिगेशन
AI BENCHY
Advertise here

GPT-5.4 (medium) vs Qwen3.8 Max (low)

Qwen3.8 Max (low) average score मध्ये पुढे आहे: 8.7 vs 8.5. Qwen3.8 Max (low) चा benchmark खर्च कमी आहे: $0.687 vs $1.533. Qwen3.8 Max (low) वेगवान आहे: 21.19s vs 23.10s, pass rates 77.3% vs 84.9%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-04

क्रमांक
#27
एकूण आउटपुट टोकन्स
88,670
प्रतिसाद वेळ (सरासरी)
23.10s
एकूण खर्च
$1.533
क्रमांक
#23
एकूण आउटपुट टोकन्स
81,411
प्रतिसाद वेळ (सरासरी)
21.19s
एकूण खर्च
$0.687
शिफारस केलेले मॉडेल Qwen3.8 Max (low)

It has the best score here (8.7), while costing about 2.2x less than GPT-5.4 (medium).

तपशीलवार तुलना

मेट्रिक GPT-5.4 GPT-5.4 medium प्रकाशन: 2026-03-05 Qwen3.8 Max Qwen3.8 Max low प्रकाशन: 2026-08-04
स्कोअर 8.5 8.7
क्रमांक #27 #23
विश्वसनीयता 10.0 10.0
सुसंगतता 8.6 9.0
बेंचमार्क कव्हरेज 22/22 चाचण्या · 66/66 प्रयत्न 22/22 चाचण्या · 66/66 प्रयत्न
बरोबर चाचण्या
प्रति प्रयत्न पास दर 77.3% 84.9%
अस्थिर चाचण्या 4 3
एकूण रन 66 66
प्रति निकाल खर्च 10.220 4.041
एकूण खर्च $1.533 $0.687
इनपुट किंमत $2.500 / 1M $2.000 / 1M
आउटपुट किंमत $15.000 / 1M $6.000 / 1M
एकूण इनपुट टोकन्स 81,127 99,172
आउटपुट टोकन्स 6,155 6,132
रिझनिंग टोकन्स 82,515 75,279
प्रतिसाद वेळ (सरासरी) 23.10s 21.19s
प्रतिसाद वेळ (कमाल) 100.41s 155.75s
प्रतिसाद वेळ (एकूण) 508.26s 466.14s

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#27 GPT-5.4

medium
खर्च
$0.214
वेळ
199.6s
टोकन्स
14,349 tok

#23 Qwen3.8 Max

low
खर्च
$0.026
वेळ
68.5s
टोकन्स
4,280 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
GPT-5.4 8.8 7.8 88.9% 1 44.36s 7,305 433 24,216
Qwen3.8 Max 8.4 7.4 88.9% 1 28.69s 8,127 512 15,952

झटपट तुलना

तुलना जोडी बदला