AI BENCHY
Advertise here
#59

DeepSeek V3.2

DeepSeek रिलीज़: 2025-12-01 परीक्षण किया गया: 2026-05-08 15:27 deepseek/deepseek-v3.2::medium
671B कुल (37B सक्रिय)MoEमुक्त स्रोत
(medium) (none)

सारांश

DeepSeek V3.2 AI BENCHY पर 7.2 स्कोर करता है और #59 पर है। इसकी reliability 10.0, pass rate 72.8%, कुल लागत $0.031, और औसत response time 46.06s है।

DeepSeek V3.2 को अलग क्या बनाता है: इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
671B कुल (37B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
लाइसेंस
MIT

संगति

7.5

कुल आउटपुट टोकन

60,800

कुल इनपुट टोकन

0

इनपुट कीमत

$0.252 / 1M

आउटपुट कीमत

$0.378 / 1M

सही परीक्षण

गलत टेस्ट: 8

प्रति प्रयास पास दर: 72.8%

अस्थिर टेस्ट

6

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

46.06s

प्रतिक्रिया समय (अधिकतम): 180.92s

प्रतिक्रिया समय (कुल): 875.23s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#59 DeepSeek V3.2

medium
लागत
$0.001
समय
53.6s
टोकन
1,932 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 03:00 दोबारा परीक्षण 7.0 10.0 $0.078 तुलना करें
2026-07-16 23:13 नया टेस्ट जोड़ा गया 7.0 10.0 $0.078 तुलना करें
2026-06-04 14:41 नया टेस्ट जोड़ा गया 7.0 10.0 $0.044 तुलना करें
2026-05-22 00:46 सूट बदला गया 7.0 9.1 $0.037 तुलना करें
2026-05-08 15:27 सूट बदला गया 7.2 10.0 $0.031 वर्तमान रन
2026-04-20 17:48 पहला दर्ज रन 8.0 लागू नहीं $0.029 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-05-08 15:27 · सूट बदला गया57/57 प्रयास7.27.510.011/19660,8000$0.03146.06s
2026-08-14 03:00 · दोबारा परीक्षण66/66 प्रयास7.07.410.011/227128,787101,056$0.07868.43s
अंतर+0.2+0.10.00-1-67987-101056-$0.047-22368ms

बेंचमार्क कवरेज अलग है: 57/57 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 66/66 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 9.2 10.0
कोडिंग 4.7 1.6
संयुक्त 10.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 2.9 4.4
Samanya Buddhimatta 3.8 2.5
निर्देश पालन 10.0 10.0
पहेली समाधान 6.7 5.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल