Advertise here
#20

Qwen3.5-122B-A10B

Qwen प्रकाशन: 2026-02-24 चाचणी तारीख: 2026-04-11 01:44 qwen/qwen3.5-122b-a10b::medium
122B एकूण (10B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

Qwen3.5-122B-A10B AI BENCHY वर 8.1 स्कोर करते आणि #20 वर आहे. याची reliability लागू नाही, pass rate 79.6%, एकूण खर्च $0.528, आणि सरासरी response time 31.38s आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
122B एकूण (10B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
Apache-2.0

सुसंगतता

8.6

विश्वसनीयता

लागू नाही

एकूण आउटपुट टोकन्स

180,303

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.260 / 1M

आउटपुट किंमत

$2.080 / 1M

कॅश वाचण्याची किंमत

लागू नाही

कॅश लिहिण्याची किंमत

लागू नाही

कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.

बरोबर चाचण्या

चुकीच्या चाचण्या: 5

प्रति प्रयत्न पास दर: 79.6%

अस्थिर चाचण्या

3

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

31.38s

प्रतिसाद वेळ (कमाल): 119.29s

प्रतिसाद वेळ (एकूण): 564.84s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#20 Qwen3.5-122B-A10B

medium
खर्च
$0.019
वेळ
48.7s
टोकन्स
6,034 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 01:54 पुन्हा चाचणी 7.1 10.0 $1.207 ↑ तुलना करा
2026-07-16 22:21 नवीन चाचणी जोडली 7.1 10.0 $1.046 ↓ तुलना करा
2026-06-04 13:31 नवीन चाचणी जोडली 7.8 10.0 $0.588 ↓ तुलना करा
2026-05-22 00:03 सूट बदलला 7.7 10.0 $0.650 तुलना करा
2026-04-11 01:44 पहिली नोंदलेली रन 8.1 लागू नाही $0.528 सध्याची रन

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-04-11 01:44 · पहिली नोंदलेली रन54/54 प्रयत्न8.18.6लागू नाही13/183180,3030$0.52831.38s
2026-06-04 13:31 · नवीन चाचणी जोडली63/63 प्रयत्न7.88.810.014/213277,21541,832$0.58842.49s
फरक—+0.4-0.2-10-96912-41832-$0.060-11111ms

बेंचमार्क कव्हरेज वेगळे आहे: 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 10.0 10.0
कोडिंग 4.7 1.6
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 2.9 7.2
Samanya Buddhimatta 3.4 2.2
सूचनांचे पालन 10.0 10.0
कोडी सोडवणे 10.0 10.0
टूल कॉलिंग 10.0 10.0

तुलना केलेली मॉडेल्स