Advertise here
#78

Qwen3.8 2.4T A95B

Qwen रिलीज़: 2026-08-12 परीक्षण किया गया: 2026-08-14 04:16 qwen/qwen3.8-2.4t-a95b::low
2.4T कुल (95B सक्रिय)MoEवेट उपलब्ध
(high) (low)

सारांश

Qwen3.8 2.4T A95B AI BENCHY पर 8.1 स्कोर करता है और #78 पर है। इसकी reliability 9.4, pass rate 72.7%, कुल लागत $2.672, और औसत response time 118.97s है।

Qwen3.8 2.4T A95B को अलग क्या बनाता है: यह पहेली समाधान में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि डोमेन-विशिष्ट इसकी सबसे कमजोर जगह है, जहाँ यह #13 पर है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
2.4T कुल (95B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
वेट उपलब्ध
लाइसेंस
Apache-2.0

संगति

9.2

कुल आउटपुट टोकन

495,541

कुल इनपुट टोकन

113,279

इनपुट कीमत

$2.000 / 1M

आउटपुट कीमत

$6.000 / 1M

सही परीक्षण

गलत टेस्ट: 7

प्रति प्रयास पास दर: 72.7%

अस्थिर टेस्ट

2

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

118.97s

प्रतिक्रिया समय (अधिकतम): 534.21s

प्रतिक्रिया समय (कुल): 2617.41s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 Qwen3.8 2.4T A95B

low
लागत
$0.100
समय
193.2s
टोकन
16,767 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 04:16 दोबारा परीक्षण 8.1 9.4 $2.672 वर्तमान रन
2026-08-12 23:44 पहला रन 8.2 9.1 $3.113 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-08-14 04:16 · वर्तमान रन66/66 प्रयास8.19.29.415/222495,541113,279$2.672118.97s
2026-08-12 23:44 · पहला रन66/66 प्रयास8.28.99.116/223554,485113,340$3.113132.39s
अंतर—-0.1+0.3+0.3-1-1-58944-61-$0.441-13416ms

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-08-14 12:51 $2.000 / 1M $6.000 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 10.0 10.0
कोडिंग 7.8 9.3
संयुक्त 8.2 6.9
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 3.2 9.3
Samanya Buddhimatta 6.1 3.1
निर्देश पालन 9.8 10.0
पहेली समाधान 10.0 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल