AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#69

DeepSeek V3.2

DeepSeek प्रकाशन: 2025-12-01 चाचणी तारीख: 2026-04-20 17:48 deepseek/deepseek-v3.2::none
671B एकूण (37B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

DeepSeek V3.2 AI BENCHY वर 6.1 स्कोर करते आणि #69 वर आहे. याची reliability लागू नाही, pass rate 50.0%, एकूण खर्च $0.016, आणि सरासरी response time 12.09s आहे.

DeepSeek V3.2 खास का आहे: या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
671B एकूण (37B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
MIT

सुसंगतता

8.1

विश्वसनीयता

लागू नाही

एकूण आउटपुट टोकन्स

8,384

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.252 / 1M

आउटपुट किंमत

$0.378 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 11

प्रति प्रयत्न पास दर: 50.0%

अस्थिर चाचण्या

4

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

12.09s

प्रतिसाद वेळ (कमाल): 115.89s

प्रतिसाद वेळ (एकूण): 217.56s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#69 DeepSeek V3.2

none
खर्च
$0.002
वेळ
7.0s
टोकन्स
1,046 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:58 पुन्हा चाचणी 5.0 10.0 $0.054 तुलना करा
2026-07-16 23:15 नवीन चाचणी जोडली 5.0 10.0 $0.054 तुलना करा
2026-06-04 14:22 नवीन चाचणी जोडली 5.2 10.0 $0.017 तुलना करा
2026-05-22 00:35 सूट बदलला 5.6 10.0 $0.018 तुलना करा
2026-05-08 15:31 सूट बदलला 5.7 10.0 $0.016 तुलना करा
2026-04-20 17:48 पहिली नोंदलेली रन 6.1 लागू नाही $0.016 सध्याची रन

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-04-20 17:48 · पहिली नोंदलेली रन54/54 प्रयत्न6.18.1लागू नाही7/1848,3840$0.01612.09s
2026-05-08 15:31 · सूट बदलला57/57 प्रयत्न5.77.910.07/1957,1940$0.01613.43s
फरक+0.5+0.20-1+11900+$0.001-1340ms

बेंचमार्क कव्हरेज वेगळे आहे: 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 57/57 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 3.2 9.8
कोडिंग 2.4 1.3
संयुक्त 6.5 10.0
डेटा पार्सिंग आणि निष्कर्षण 6.3 5.8
डोमेन-विशिष्ट 3.6 7.2
Samanya Buddhimatta 10.0 10.0
सूचनांचे पालन 10.0 10.0
कोडी सोडवणे 8.5 7.5
टूल कॉलिंग 10.0 10.0

तुलना केलेली मॉडेल्स