AI BENCHY
Advertise here
#102

Qwen3.5-35B-A3B

Qwen प्रकाशन: 2026-02-24 चाचणी तारीख: 2026-05-22 00:00 qwen/qwen3.5-35b-a3b::none
35B एकूण (3B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

Qwen3.5-35B-A3B AI BENCHY वर 5.8 स्कोर करते आणि #102 वर आहे. याची reliability 10.0, pass rate 45.0%, एकूण खर्च $0.016, आणि सरासरी response time 3.50s आहे.

Qwen3.5-35B-A3B खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर अँटी-एआय युक्त्या हा सर्वात कमकुवत भाग आहे, rank #18. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे. समान मॉडेल्सच्या तुलनेत हे लक्षणीय वेगवान आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
35B एकूण (3B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
Apache-2.0

सुसंगतता

8.9

एकूण आउटपुट टोकन्स

4,334

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.139 / 1M

आउटपुट किंमत

$1.000 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 13

प्रति प्रयत्न पास दर: 45.0%

अस्थिर चाचण्या

3

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

3.50s

प्रतिसाद वेळ (कमाल): 47.43s

प्रतिसाद वेळ (एकूण): 69.99s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#102 Qwen3.5-35B-A3B

none
खर्च
$0.005
वेळ
28.4s
टोकन्स
4,518 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 01:53 पुन्हा चाचणी 5.9 10.0 $0.187 तुलना करा
2026-07-16 22:11 नवीन चाचणी जोडली 6.1 10.0 $0.106 तुलना करा
2026-06-04 13:29 नवीन चाचणी जोडली 5.6 10.0 $0.012 तुलना करा
2026-05-22 00:00 सूट बदलला 5.8 10.0 $0.016 सध्याची रन
2026-04-11 01:19 पहिली नोंदलेली रन 6.1 लागू नाही $0.016 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-22 00:00 · सूट बदलला60/60 प्रयत्न5.88.910.07/2034,3340$0.0163.50s
2026-08-14 01:53 · पुन्हा चाचणी66/66 प्रयत्न5.98.610.06/22486,616134,530$0.18712.73s
फरक-0.1+0.30.0+1-1-82282-134530-$0.171-9226ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 66/66 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 3.4 7.9
कोडिंग 6.8 10.0
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 7.7 10.0
Samanya Buddhimatta 6.5 3.4
सूचनांचे पालन 6.3 10.0
कोडी सोडवणे 3.7 7.4
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स