AI BENCHY
Advertise here
#102

Qwen3.5-35B-A3B

Qwen रिलीज़: 2026-02-24 परीक्षण किया गया: 2026-05-22 00:00 qwen/qwen3.5-35b-a3b::none
35B कुल (3B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

Qwen3.5-35B-A3B AI BENCHY पर 5.8 स्कोर करता है और #102 पर है। इसकी reliability 10.0, pass rate 45.0%, कुल लागत $0.016, और औसत response time 3.50s है।

Qwen3.5-35B-A3B को अलग क्या बनाता है: यह डोमेन-विशिष्ट में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि एंटी-एआई ट्रिक्स इसकी सबसे कमजोर जगह है, जहाँ यह #18 पर है। इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है। यह समान मॉडलों की तुलना में काफ़ी तेज है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
35B कुल (3B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
Apache-2.0

संगति

8.9

कुल आउटपुट टोकन

4,334

कुल इनपुट टोकन

0

इनपुट कीमत

$0.139 / 1M

आउटपुट कीमत

$1.000 / 1M

सही परीक्षण

गलत टेस्ट: 13

प्रति प्रयास पास दर: 45.0%

अस्थिर टेस्ट

3

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

3.50s

प्रतिक्रिया समय (अधिकतम): 47.43s

प्रतिक्रिया समय (कुल): 69.99s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#102 Qwen3.5-35B-A3B

none
लागत
$0.005
समय
28.4s
टोकन
4,518 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 01:53 दोबारा परीक्षण 5.9 10.0 $0.187 तुलना करें
2026-07-16 22:11 नया टेस्ट जोड़ा गया 6.1 10.0 $0.106 तुलना करें
2026-06-04 13:29 नया टेस्ट जोड़ा गया 5.6 10.0 $0.012 तुलना करें
2026-05-22 00:00 सूट बदला गया 5.8 10.0 $0.016 वर्तमान रन
2026-04-11 01:19 पहला दर्ज रन 6.1 लागू नहीं $0.016 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-05-22 00:00 · सूट बदला गया60/60 प्रयास5.88.910.07/2034,3340$0.0163.50s
2026-06-04 13:29 · नया टेस्ट जोड़ा गया63/63 प्रयास5.68.910.07/2134,34348,194$0.0123.37s
अंतर+0.20.00.000-9-48194+$0.005+130ms

बेंचमार्क कवरेज अलग है: 60/60 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 63/63 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 3.4 7.9
कोडिंग 6.8 10.0
संयुक्त 3.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 7.7 10.0
Samanya Buddhimatta 6.5 3.4
निर्देश पालन 6.3 10.0
पहेली समाधान 3.7 7.4
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल