AI BENCHY
Advertise here
#100

Qwen3 Coder Next

Qwen प्रकाशन: 2026-02-03 चाचणी तारीख: 2026-04-14 00:56 qwen/qwen3-coder-next::medium
80B एकूण (3B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

Qwen3 Coder Next AI BENCHY वर 4.7 स्कोर करते आणि #100 वर आहे. याची reliability लागू नाही, pass rate 27.8%, एकूण खर्च $0.008, आणि सरासरी response time 10.75s आहे.

Qwen3 Coder Next खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #2 आहे; तर अँटी-एआय युक्त्या हा सर्वात कमकुवत भाग आहे, rank #18. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
80B एकूण (3B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
Apache-2.0

सुसंगतता

8.7

विश्वसनीयता

लागू नाही

एकूण आउटपुट टोकन्स

3,241

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.150 / 1M

आउटपुट किंमत

$0.800 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 15

प्रति प्रयत्न पास दर: 27.8%

अस्थिर चाचण्या

3

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

10.75s

प्रतिसाद वेळ (कमाल): 81.80s

प्रतिसाद वेळ (एकूण): 129.01s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#100 Qwen3 Coder Next

medium
अवैध SVG
खर्च
$0.000
वेळ
300.0s
टोकन्स
0 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 01:38 पुन्हा चाचणी 4.6 10.0 $0.034 तुलना करा
2026-07-16 21:16 नवीन चाचणी जोडली 4.7 10.0 $0.032 तुलना करा
2026-06-04 13:09 नवीन चाचणी जोडली 4.6 10.0 $0.008 तुलना करा
2026-05-21 23:45 सूट बदलला 4.7 10.0 $0.008 तुलना करा
2026-04-14 00:56 पहिली नोंदलेली रन 4.7 लागू नाही $0.008 सध्याची रन

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-04-14 00:56 · पहिली नोंदलेली रन54/54 प्रयत्न4.78.7लागू नाही3/1833,2410$0.00810.75s
2026-06-04 13:09 · नवीन चाचणी जोडली63/63 प्रयत्न4.68.910.04/2133,31947,250$0.0088.58s
फरक+0.1-0.2-10-78-47250-$0.001+2171ms

बेंचमार्क कव्हरेज वेगळे आहे: 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 3.5 8.1
कोडिंग 4.7 1.6
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 6.5 10.0
डोमेन-विशिष्ट 5.3 10.0
Samanya Buddhimatta 6.3 3.4
सूचनांचे पालन 4.8 10.0
कोडी सोडवणे 3.1 10.0
टूल कॉलिंग 10.0 10.0

तुलना केलेली मॉडेल्स