नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (high) vs DeepSeek V3.2

DeepSeek V3.2 average score में आगे है: 5.0 vs 4.8. DeepSeek V3.2 की benchmark लागत कम है: $0.054 vs $0.632. DeepSeek V3.2 तेज है: 18.25s vs 77.22s, pass rates 39.4% vs 37.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-28

रैंक
#202
कुल आउटपुट टोकन
953,758
प्रतिक्रिया समय (औसत)
77.22s
कुल लागत
$0.632
रैंक
#194
कुल आउटपुट टोकन
42,097
प्रतिक्रिया समय (औसत)
18.25s
कुल लागत
$0.054
अनुशंसित मॉडल DeepSeek V3.2

It has the best score here (5.0), while costing about 11.8x less than Trinity Large Thinking (high).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking high रिलीज़: 2026-07-28 DeepSeek V3.2 DeepSeek V3.2 none रिलीज़: 2025-12-01
स्कोर 4.8 5.0
रैंक #202 #194
विश्वसनीयता 9.9 10.0
संगति 7.2 7.7
सही परीक्षण
प्रति प्रयास पास दर 39.4% 37.9%
अस्थिर टेस्ट 8 6
कुल रन 66 66
प्रति परिणाम लागत 12.640 0.870
कुल लागत $0.632 $0.054
इनपुट कीमत $0.220 / 1M $0.269 / 1M
आउटपुट कीमत $0.850 / 1M $0.400 / 1M
कुल इनपुट टोकन 101,767 135,780
आउटपुट टोकन 286,218 42,097
रीजनिंग टोकन 667,540 0
प्रतिक्रिया समय (औसत) 77.22s 18.25s
प्रतिक्रिया समय (अधिकतम) 510.21s 115.89s
प्रतिक्रिया समय (कुल) 1698.89s 401.60s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#202 Trinity Large Thinking

high
लागत
$0.028
समय
130.1s
टोकन
34,387 tok

#194 DeepSeek V3.2

none
लागत
$0.002
समय
7.0s
टोकन
1,046 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
DeepSeek V3.2 3.1 6.9 11.1% 1 14.54s 7,279 4,528 0

त्वरित तुलना

तुलना जोड़ी बदलें