AI BENCHY
Advertise here
#94

Qwen3 Coder Next

Qwen प्रकाशन: 2026-02-03 चाचणी तारीख: 2026-04-14 00:56 qwen/qwen3-coder-next::none
80B एकूण (3B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

Qwen3 Coder Next AI BENCHY वर 5.1 स्कोर करते आणि #94 वर आहे. याची reliability लागू नाही, pass rate 25.9%, एकूण खर्च $0.008, आणि सरासरी response time 10.18s आहे.

Qwen3 Coder Next खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #4 आहे; तर अँटी-एआय युक्त्या हा सर्वात कमकुवत भाग आहे, rank #18. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
80B एकूण (3B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
Apache-2.0

सुसंगतता

9.7

विश्वसनीयता

लागू नाही

एकूण आउटपुट टोकन्स

3,617

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.150 / 1M

आउटपुट किंमत

$0.800 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 14

प्रति प्रयत्न पास दर: 25.9%

अस्थिर चाचण्या

1

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

10.18s

प्रतिसाद वेळ (कमाल): 45.14s

प्रतिसाद वेळ (एकूण): 122.13s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#94 Qwen3 Coder Next

none
अवैध SVG
खर्च
$0.058
वेळ
246.3s
टोकन्स
64,126 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 01:38 पुन्हा चाचणी 5.1 10.0 $0.026 तुलना करा
2026-07-16 21:14 नवीन चाचणी जोडली 5.1 10.0 $0.025 तुलना करा
2026-06-04 13:09 नवीन चाचणी जोडली 4.9 10.0 $0.009 तुलना करा
2026-05-21 23:44 सूट बदलला 5.1 10.0 $0.008 तुलना करा
2026-04-14 00:56 पहिली नोंदलेली रन 5.1 लागू नाही $0.008 सध्याची रन

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-04-14 00:56 · पहिली नोंदलेली रन54/54 प्रयत्न5.19.7लागू नाही4/1813,6170$0.00810.18s
2026-07-16 21:14 · नवीन चाचणी जोडली66/66 प्रयत्न5.19.710.05/22111,808134,218$0.0259.12s
फरक0.00.0-10-8191-134218-$0.017+1056ms

बेंचमार्क कव्हरेज वेगळे आहे: 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 66/66 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 3.6 10.0
कोडिंग 7.3 3.7
संयुक्त 3.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 6.5 10.0
डोमेन-विशिष्ट 5.3 10.0
Samanya Buddhimatta 10.0 10.0
सूचनांचे पालन 4.8 10.0
कोडी सोडवणे 3.2 10.0
टूल कॉलिंग 10.0 10.0

तुलना केलेली मॉडेल्स