नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Anthropic: Claude Sonnet 4.6 vs DeepSeek: DeepSeek V3.2

Claude Sonnet 4.6 average score में आगे है: 7.3 vs 7.0. DeepSeek V3.2 (medium) की benchmark लागत कम है: $0.078 vs $0.661. Claude Sonnet 4.6 तेज है: 8.12s vs 68.62s, pass rates 57.6% vs 65.2%.

अनुशंसित मॉडलClaude Sonnet 4.6It has the best score here (7.3), while responding about 8.5x faster than DeepSeek V3.2 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-25

मेट्रिक Claude Sonnet 4.6 Claude Sonnet 4.6 none रिलीज़: 2026-02-17 DeepSeek V3.2 DeepSeek V3.2 medium रिलीज़: 2025-12-01
स्कोर 7.3 7.0
रैंक #71 #84
विश्वसनीयता 10.0 10.0
संगति 9.7 7.4
सही परीक्षण
प्रति प्रयास पास दर 57.6% 65.2%
अस्थिर टेस्ट 1 7
कुल रन 66 66
प्रति परिणाम लागत 5.502 0.671
कुल लागत $0.661 $0.078
इनपुट कीमत $3.000 / 1M $0.269 / 1M
आउटपुट कीमत $15.000 / 1M $0.400 / 1M
कुल इनपुट टोकन 123,264 101,047
आउटपुट टोकन 19,362 11,834
रीजनिंग टोकन 0 117,014
प्रतिक्रिया समय (औसत) 8.12s 68.62s
प्रतिक्रिया समय (अधिकतम) 51.18s 376.10s
प्रतिक्रिया समय (कुल) 121.78s 1509.53s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#71 Claude Sonnet 4.6

none
लागत
$0.038
समय
27.3s
टोकन
2,598 tok

#84 DeepSeek V3.2

medium
लागत
$0.001
समय
53.6s
टोकन
1,932 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
DeepSeek V3.2 6.0 7.2 55.6% 1 248.68s 5,717 649 52,014

त्वरित तुलना

तुलना जोड़ी बदलें