AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#115

DeepSeek V3.2

DeepSeek प्रकाशन: 2025-12-01 चाचणी तारीख: 2026-05-22 00:35 deepseek/deepseek-v3.2::none
671B एकूण (37B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

DeepSeek V3.2 AI BENCHY वर 5.6 स्कोर करते आणि #115 वर आहे. याची reliability 10.0, pass rate 46.7%, एकूण खर्च $0.018, आणि सरासरी response time 14.46s आहे.

DeepSeek V3.2 खास का आहे: हे Samanya Buddhimatta मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #4 आहे; तर अँटी-एआय युक्त्या हा सर्वात कमकुवत भाग आहे, rank #18. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
671B एकूण (37B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
MIT

सुसंगतता

8.0

एकूण आउटपुट टोकन्स

11,163

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.252 / 1M

आउटपुट किंमत

$0.378 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 13

प्रति प्रयत्न पास दर: 46.7%

अस्थिर चाचण्या

5

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

14.46s

प्रतिसाद वेळ (कमाल): 115.89s

प्रतिसाद वेळ (एकूण): 289.21s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#115 DeepSeek V3.2

none
खर्च
$0.002
वेळ
7.0s
टोकन्स
1,046 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:58 पुन्हा चाचणी 5.0 10.0 $0.054 तुलना करा
2026-07-16 23:15 नवीन चाचणी जोडली 5.0 10.0 $0.054 तुलना करा
2026-06-04 14:22 नवीन चाचणी जोडली 5.2 10.0 $0.017 तुलना करा
2026-05-22 00:35 सूट बदलला 5.6 10.0 $0.018 सध्याची रन
2026-05-08 15:31 सूट बदलला 5.7 10.0 $0.016 तुलना करा
2026-04-20 17:48 पहिली नोंदलेली रन 6.1 लागू नाही $0.016 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-22 00:35 · सूट बदलला60/60 प्रयत्न5.68.010.07/20511,1630$0.01814.46s
2026-06-04 14:22 · नवीन चाचणी जोडली63/63 प्रयत्न5.27.610.06/21611,16555,997$0.01713.83s
फरक+0.3+0.40.0+1-1-2-55997+$0.002+630ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 3.3 8.2
कोडिंग 3.1 5.4
संयुक्त 6.5 10.0
डेटा पार्सिंग आणि निष्कर्षण 6.3 5.8
डोमेन-विशिष्ट 3.0 6.9
Samanya Buddhimatta 7.6 10.0
सूचनांचे पालन 10.0 10.0
कोडी सोडवणे 7.5 7.7
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स