Advertise here
#225

Qwen3.5-35B-A3B

Qwen रिलीज़: 2026-02-24 परीक्षण किया गया: 2026-10-01 01:09 qwen/qwen3.5-35b-a3b::medium
35B कुल (3B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

Qwen3.5-35B-A3B AI BENCHY पर 6.3 स्कोर करता है और #225 पर है। इसकी reliability 10.0, pass rate 65.2%, कुल लागत $0.716, और औसत response time 111.54s है।

Qwen3.5-35B-A3B को अलग क्या बनाता है: यह स्वायत्त एजेंट कार्य में सबसे अलग दिखता है, जहाँ इसकी रैंक #2 है; जबकि Samanya Buddhimatta इसकी सबसे कमजोर जगह है, जहाँ यह #15 पर है। यह असामान्य रूप से अधिक reasoning tokens इस्तेमाल करता है, जिससे धीमे या महंगे runs समझ में आ सकते हैं।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
35B कुल (3B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
Apache-2.0

संगति

7.5

कुल लागत (वर्तमान कीमत)

$0.716 ↓ -38.1%

परीक्षण के समय: $1.156

कुल आउटपुट टोकन

913,343

कुल इनपुट टोकन

378,048

इनपुट कीमत

$0.080 / 1M

आउटपुट कीमत

$0.750 / 1M

कैश पढ़ने की कीमत

$0.040 / 1M

कैश लिखने की कीमत

लागू नहीं

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

सही परीक्षण

गलत टेस्ट: 12

प्रति प्रयास पास दर: 65.2%

अस्थिर टेस्ट

7

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

111.54s

प्रतिक्रिया समय (अधिकतम): 950.25s

प्रतिक्रिया समय (कुल): 2565.38s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#225 Qwen3.5-35B-A3B

medium
लागत
$0.009
समय
71.4s
टोकन
8,631 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-10-01 01:09 दोबारा परीक्षण 6.3 10.0 $0.716 ↓ वर्तमान रन
2026-07-16 22:51 नया टेस्ट जोड़ा गया 6.2 10.0 $0.837 ↓ तुलना करें
2026-06-04 13:42 नया टेस्ट जोड़ा गया 7.1 8.9 $0.401 ↓ तुलना करें
2026-05-22 00:15 सूट बदला गया 7.0 6.7 $0.547 तुलना करें
2026-04-11 01:44 पहला दर्ज रन 7.4 लागू नहीं $0.398 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-10-01 01:09 · वर्तमान रन69/69 प्रयास6.37.510.011/237913,343378,048$0.716111.54s
2026-07-16 22:51 · नया टेस्ट जोड़ा गया66/66 प्रयास6.27.610.011/226826,670130,388$0.837112.47s
अंतर—+0.2-0.10.00+1+86673+247660-$0.122-929ms

बेंचमार्क कवरेज अलग है: 69/69 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 66/66 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत कैश पढ़ने की कीमत कैश लिखने की कीमत
2026-06-04 15:40 $0.140 / 1M $1.000 / 1M लागू नहीं लागू नहीं
2026-08-13 00:05 $0.250 / 1M $1.250 / 1M लागू नहीं लागू नहीं
2026-08-14 12:51 $0.225 / 1M $1.800 / 1M लागू नहीं लागू नहीं
2026-10-06 14:54 $0.080 / 1M $0.750 / 1M $0.040 / 1M लागू नहीं

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
स्वायत्त एजेंट कार्य 7.4 3.8
एंटी-एआई ट्रिक्स 10.0 10.0
कोडिंग 5.9 9.3
संयुक्त 3.8 5.8
डेटा पार्सिंग और निष्कर्षण 7.3 5.9
डोमेन-विशिष्ट 3.5 4.4
Samanya Buddhimatta 2.8 1.6
निर्देश पालन 10.0 10.0
पहेली समाधान 8.2 7.2
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल