- स्कोअर
- 9.4 (+3.05 गुण)
- एकूण खर्च (सध्याची किंमत)
- $0.183 · 4.0% महाग
- प्रतिसाद वेळ (सरासरी)
- 6.24s · 68.9% वेगवान
सारांश
Qwen3.5 Plus 2026-02-15 AI BENCHY वर 6.3 स्कोर करते आणि #221 वर आहे. याची reliability 10.0, pass rate 52.2%, एकूण खर्च $0.176, आणि सरासरी response time 20.07s आहे.
Qwen3.5 Plus 2026-02-15 खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर कोडिंग हा सर्वात कमकुवत भाग आहे, rank #14.
शिफारस केलेले पर्याय
त्याऐवजी यापैकी एक मॉडेल निवडण्याची शिफारस करतो:
- स्कोअर
- 8.3 (+1.96 गुण)
- एकूण खर्च (सध्याची किंमत)
- $0.047 · 73.2% स्वस्त
- प्रतिसाद वेळ (सरासरी)
- 18.07s · 10.0% वेगवान
- स्कोअर
- 6.8 (+0.50 गुण)
- एकूण खर्च (सध्याची किंमत)
- $0.039 · 78.1% स्वस्त
- प्रतिसाद वेळ (सरासरी)
- 6.66s · 66.8% वेगवान
मॉडेलची माहिती
संशोधन दिनांक: 2026-08-12
- पॅरामीटर्स
- ~397B एकूण (~17B सक्रिय)
- आर्किटेक्चर
- MoE
- उपलब्धता
- बंद स्रोत
- परवाना
- -
सार्वजनिक पुराव्यावर आधारित सर्वोत्तम अंदाज; प्रदात्याने सर्व मूल्ये जाहीर केलेली नाहीत.
6.3
सुसंगतता
9.1
10.0
$0.176
एकूण आउटपुट टोकन्स
53,060
एकूण इनपुट टोकन्स
346,064
इनपुट किंमत
$0.260 / 1M
आउटपुट किंमत
$1.560 / 1M
कॅश वाचण्याची किंमत
लागू नाही
कॅश लिहिण्याची किंमत
लागू नाही
कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.
अस्थिर चाचण्या
3
अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#221 Qwen3.5 Plus 2026-02-15
none- खर्च
- $0.012
- वेळ
- 153.2s
- टोकन्स
- 7,787 tok
रन इतिहास
| चाचणी तारीख | स्कोअर | विश्वसनीयता | बरोबर चाचण्या | एकूण खर्च | तुलना करा |
|---|---|---|---|---|---|
| 2026-10-01 09:33 पुन्हा चाचणी | 6.3 | 10.0 | $0.176 | सध्याची रन | |
| 2026-07-16 21:22 नवीन चाचणी जोडली | 6.4 | 10.0 | $0.073 ↓ | तुलना करा | |
| 2026-06-04 13:10 नवीन चाचणी जोडली | 6.3 | 10.0 | $0.016 ↓ | तुलना करा | |
| 2026-05-21 23:45 सूट बदलला | 6.4 | 10.0 | $0.018 | तुलना करा | |
| 2026-04-11 01:19 पहिली नोंदलेली रन | 6.8 | लागू नाही | $0.017 | तुलना करा |
या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.
रन तुलना
| रन | बेंचमार्क कव्हरेज | स्कोअर | सुसंगतता | विश्वसनीयता | बरोबर चाचण्या | अस्थिर चाचण्या | एकूण आउटपुट टोकन्स | एकूण इनपुट टोकन्स | एकूण खर्च | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-10-01 09:33 · सध्याची रन | 69/69 प्रयत्न | 6.3 | 9.1 | 10.0 | 11/23 | 3 | 53,060 | 346,064 | $0.176 | 20.07s |
| 2026-05-21 23:45 · सूट बदलला | 60/60 प्रयत्न | 6.4 | 9.3 | 10.0 | 9/20 | 2 | 2,496 | 0 | $0.018 | 2.41s |
| फरक | — | -0.1 | -0.2 | 0.0 | +2 | +1 | +50564 | +346064 | +$0.158 | +17661ms |
बेंचमार्क कव्हरेज वेगळे आहे: 69/69 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.
या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.
चार्ट्स
पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.
स्कोअरनुसार शीर्ष मॉडेल्स
स्कोअर vs एकूण खर्च
प्रतिसाद वेळ (सरासरी)
स्कोअर vs प्रतिसाद वेळ (सरासरी)
एकूण आउटपुट टोकन्स
स्कोअर vs एकूण आउटपुट टोकन्स
झटपट तुलना
श्रेणीवार तपशील
| श्रेणी | स्कोअर | सुसंगतता | बरोबर चाचण्या |
|---|---|---|---|
| स्वायत्त एजंट कार्ये | 5.2 | 3.2 | |
| अँटी-एआय युक्त्या | 4.8 | 10.0 | |
| कोडिंग | 4.3 | 7.9 | |
| संयुक्त | 6.5 | 10.0 | |
| डेटा पार्सिंग आणि निष्कर्षण | 10.0 | 10.0 | |
| डोमेन-विशिष्ट | 7.7 | 10.0 | |
| Samanya Buddhimatta | 4.4 | 3.0 | |
| सूचनांचे पालन | 10.0 | 10.0 | |
| कोडी सोडवणे | 7.7 | 10.0 | |
| टूल कॉलिंग | 10.0 | 10.0 | |
| सामान्य ज्ञान | 3.0 | 10.0 |