नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (high) vs Grok 4.20

Trinity Large Thinking (high) average score में आगे है: 4.8 vs 4.1. Grok 4.20 की benchmark लागत कम है: $0.057 vs $0.632. Grok 4.20 तेज है: 1.11s vs 77.22s, pass rates 39.4% vs 27.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-28

रैंक
#202
कुल आउटपुट टोकन
953,758
प्रतिक्रिया समय (औसत)
77.22s
कुल लागत
$0.632
रैंक
#220
कुल आउटपुट टोकन
1,923
प्रतिक्रिया समय (औसत)
1.11s
कुल लागत
$0.057
अनुशंसित मॉडल Grok 4.20

Its score stays close to the best score here (4.1 vs 4.8), while costing about 11.2x less than Trinity Large Thinking (high).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking high रिलीज़: 2026-07-28 Grok 4.20 Grok 4.20 none रिलीज़: 2026-03-31
स्कोर 4.8 4.1
रैंक #202 #220
विश्वसनीयता 9.9 लागू नहीं
संगति 7.2 8.1
सही परीक्षण
प्रति प्रयास पास दर 39.4% 27.3%
अस्थिर टेस्ट 8 0
कुल रन 66 54
प्रति परिणाम लागत 12.640 1.570
कुल लागत $0.632 $0.057
इनपुट कीमत $0.220 / 1M $1.250 / 1M
आउटपुट कीमत $0.850 / 1M $2.500 / 1M
कुल इनपुट टोकन 101,767 41,313
आउटपुट टोकन 286,218 1,923
रीजनिंग टोकन 667,540 0
प्रतिक्रिया समय (औसत) 77.22s 1.11s
प्रतिक्रिया समय (अधिकतम) 510.21s 6.04s
प्रतिक्रिया समय (कुल) 1698.89s 19.96s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#202 Trinity Large Thinking

high
लागत
$0.028
समय
130.1s
टोकन
34,387 tok

#220 xAI: Grok 4.20

none
लागत
$0.004
समय
6.5s
टोकन
1,367 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
Grok 4.20 1.1 3.1 0.0% 0 1.22s 1,074 312 0

त्वरित तुलना

तुलना जोड़ी बदलें