Advertise here
#46

Qwen3.8 2.4T A95B

Qwen रिलीज़: 2026-08-12 परीक्षण किया गया: 2026-08-12 23:44 qwen/qwen3.8-2.4t-a95b::low
2.4T कुल (95B सक्रिय)MoEवेट उपलब्ध
(high) (low)

सारांश

Qwen3.8 2.4T A95B AI BENCHY पर 8.2 स्कोर करता है और #46 पर है। इसकी reliability 9.1, pass rate 78.8%, कुल लागत $3.113, और औसत response time 132.39s है।

Qwen3.8 2.4T A95B को अलग क्या बनाता है: यह डोमेन-विशिष्ट में सबसे अलग दिखता है, जहाँ इसकी रैंक #4 है; जबकि कोडिंग इसकी सबसे कमजोर जगह है, जहाँ यह #17 पर है। यह असामान्य रूप से अधिक reasoning tokens इस्तेमाल करता है, जिससे धीमे या महंगे runs समझ में आ सकते हैं।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
2.4T कुल (95B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
वेट उपलब्ध
लाइसेंस
Apache-2.0

संगति

8.9

कुल आउटपुट टोकन

554,485

कुल इनपुट टोकन

113,340

इनपुट कीमत

$2.000 / 1M

आउटपुट कीमत

$6.000 / 1M

सही परीक्षण

गलत टेस्ट: 6

प्रति प्रयास पास दर: 78.8%

अस्थिर टेस्ट

3

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

132.39s

प्रतिक्रिया समय (अधिकतम): 534.21s

प्रतिक्रिया समय (कुल): 2912.56s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#46 Qwen3.8 2.4T A95B

low
लागत
$0.100
समय
193.2s
टोकन
16,767 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 04:16 दोबारा परीक्षण 8.1 9.4 $2.672 तुलना करें
2026-08-12 23:44 पहला रन 8.2 9.1 $3.113 वर्तमान रन

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-08-12 23:44 · पहला रन66/66 प्रयास8.28.99.116/223554,485113,340$3.113132.39s
2026-08-14 04:16 · दोबारा परीक्षण66/66 प्रयास8.19.29.415/222495,541113,279$2.672118.97s
अंतर—+0.1-0.3-0.3+1+1+58944+61+$0.441+13416ms

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-08-12 23:12 $2.000 / 1M $6.000 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 10.0 10.0
कोडिंग 7.6 7.2
संयुक्त 8.2 6.9
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.5 9.3
Samanya Buddhimatta 6.1 3.1
निर्देश पालन 9.8 10.0
पहेली समाधान 10.0 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल