AI BENCHY
Advertise here
#104

DeepSeek V3.2

DeepSeek प्रकाशन: 2025-12-01 चाचणी तारीख: 2026-05-08 15:31 deepseek/deepseek-v3.2::none
671B एकूण (37B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

DeepSeek V3.2 AI BENCHY वर 5.7 स्कोर करते आणि #104 वर आहे. याची reliability 10.0, pass rate 49.1%, एकूण खर्च $0.016, आणि सरासरी response time 13.43s आहे.

DeepSeek V3.2 खास का आहे: हे सूचनांचे पालन मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर अँटी-एआय युक्त्या हा सर्वात कमकुवत भाग आहे, rank #18. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
671B एकूण (37B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
MIT

सुसंगतता

7.9

एकूण आउटपुट टोकन्स

7,194

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.252 / 1M

आउटपुट किंमत

$0.378 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 12

प्रति प्रयत्न पास दर: 49.1%

अस्थिर चाचण्या

5

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

13.43s

प्रतिसाद वेळ (कमाल): 115.89s

प्रतिसाद वेळ (एकूण): 255.10s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#104 DeepSeek V3.2

none
खर्च
$0.002
वेळ
7.0s
टोकन्स
1,046 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:58 पुन्हा चाचणी 5.0 10.0 $0.054 तुलना करा
2026-07-16 23:15 नवीन चाचणी जोडली 5.0 10.0 $0.054 तुलना करा
2026-06-04 14:22 नवीन चाचणी जोडली 5.2 10.0 $0.017 तुलना करा
2026-05-22 00:35 सूट बदलला 5.6 10.0 $0.018 तुलना करा
2026-05-08 15:31 सूट बदलला 5.7 10.0 $0.016 सध्याची रन
2026-04-20 17:48 पहिली नोंदलेली रन 6.1 लागू नाही $0.016 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-08 15:31 · सूट बदलला57/57 प्रयत्न5.77.910.07/1957,1940$0.01613.43s
2026-04-20 17:48 · पहिली नोंदलेली रन54/54 प्रयत्न6.18.1लागू नाही7/1848,3840$0.01612.09s
फरक-0.5-0.20+1-11900-$0.001+1340ms

बेंचमार्क कव्हरेज वेगळे आहे: 57/57 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 3.3 8.2
कोडिंग 2.4 1.3
संयुक्त 6.5 10.0
डेटा पार्सिंग आणि निष्कर्षण 6.3 5.8
डोमेन-विशिष्ट 3.0 6.9
Samanya Buddhimatta 7.6 10.0
सूचनांचे पालन 10.0 10.0
कोडी सोडवणे 7.5 7.7
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स