نیویگیشن
AI BENCHY
Advertise here

Claude Opus 4.6 (medium) vs DeepSeek V4 Pro (high)

average score تقریباً برابر ہے: 7.7 vs 7.7. DeepSeek V4 Pro (high) کی benchmark لاگت کم ہے: $0.200 vs $3.059. Claude Opus 4.6 (medium) تیز ہے: 34.27s vs 79.14s، pass rates 63.6% vs 63.6%.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-08-01

درجہ
#55
کل آؤٹ پٹ ٹوکنز
100,601
ردِعمل کا وقت (اوسط)
34.27s
کل لاگت
$3.059
درجہ
#58
کل آؤٹ پٹ ٹوکنز
189,181
ردِعمل کا وقت (اوسط)
79.14s
کل لاگت
$0.200
تجویز کردہ ماڈل DeepSeek V4 Pro (high)

It has the best score here (7.7), while costing about 15.3x less than Claude Opus 4.6 (medium).

تفصیلی موازنہ

میٹرک Claude Opus 4.6 Claude Opus 4.6 medium اجرا: 2026-02-05 DeepSeek V4 Pro DeepSeek V4 Pro high اجرا: 2026-04-24
اسکور 7.7 7.7
درجہ #55 #58
اعتماد پذیری 10.0 10.0
تسلسل 8.8 7.7
درست ٹیسٹس
فی کوشش کامیابی کی شرح 63.6% 63.6%
غیر مستحکم ٹیسٹ 3 6
کل رنز 66 66
فی نتیجہ لاگت 23.524 2.000
کل لاگت $3.059 $0.200
ان پٹ قیمت $5.000 / 1M $0.435 / 1M
آؤٹ پٹ قیمت $25.000 / 1M $0.870 / 1M
کل ان پٹ ٹوکنز 108,615 90,748
آؤٹ پٹ ٹوکنز 72,286 10,462
ریزننگ ٹوکنز 28,315 178,719
ردِعمل کا وقت (اوسط) 34.27s 79.14s
ردِعمل کا وقت (زیادہ سے زیادہ) 151.51s 416.76s
ردِعمل کا وقت (کل) 513.99s 1740.97s

ماڈل جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#55 Claude Opus 4.6

medium
غلط SVG
لاگت
$0.000
وقت
300.0s
ٹوکنز
0 tok

#58 DeepSeek V4 Pro

high
لاگت
$0.023
وقت
257.6s
ٹوکنز
14,870 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
DeepSeek V4 Pro 6.3 8.7 33.3% 0 243.00s 5,090 383 84,580

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں