AI BENCHY
Advertise here

#79

DeepSeek V4 Pro

DeepSeek रिलीज़: 2026-04-24 परीक्षण किया गया: 2026-05-22 00:54 deepseek/deepseek-v4-pro::high
(high) (none)

संगति

8.7

कुल आउटपुट टोकन

66,202

इनपुट कीमत

$0.435 / 1M

आउटपुट कीमत

$0.870 / 1M

सही परीक्षण

गलत टेस्ट: 9

प्रति प्रयास पास दर: 63.3%

अस्थिर टेस्ट

3

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

58.92s

प्रतिक्रिया समय (अधिकतम): 358.35s

प्रतिक्रिया समय (कुल): 1119.51s

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-05-22 00:54 सूट बदला गया 6.6 9.0 $0.212 वर्तमान रन
2026-04-29 14:47 दोबारा परीक्षण 7.5 9.3 $0.209 तुलना करें
2026-04-26 10:50 दोबारा परीक्षण 7.5 8.4 $0.201 तुलना करें
2026-04-25 21:53 पहला रन 8.2 लागू नहीं $0.329 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-05-22 00:54 · वर्तमान रन7.08.78.911/20366,202$0.21358.92s
2026-04-25 21:53 · पहला रन8.29.2लागू नहीं13/18284,562$0.32972.92s
अंतर-1.2-0.5-2+1-18360-$0.116-14000ms

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 8.3 10.0
कोडिंग 3.0 5.0
संयुक्त 10.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 3.2 6.9
Samanya Buddhimatta 6.1 3.1
निर्देश पालन 10.0 10.0
पहेली समाधान 7.7 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल