नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (high) vs GPT-5.4

Trinity Large Thinking (high) average score में आगे है: 5.7 vs 5.6. GPT-5.4 की benchmark लागत कम है: $0.690 vs $0.794. GPT-5.4 तेज है: 3.89s vs 74.52s, pass rates 42.0% vs 33.3%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-02

तुलना किए गए मॉडल

रैंक
#256
कुल आउटपुट टोकन
943,044
प्रतिक्रिया समय (औसत)
74.52s
कुल लागत
$0.794
रैंक
#263
कुल आउटपुट टोकन
9,372
प्रतिक्रिया समय (औसत)
3.89s
कुल लागत
$0.690
अनुशंसित मॉडल GPT-5.4

Its score stays close to the best score here (5.6 vs 5.7), while responding about 19.2x faster than Trinity Large Thinking (high).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking high रिलीज़: 2026-07-28 GPT-5.4 GPT-5.4 none रिलीज़: 2026-03-05
स्कोर 5.7 5.6
रैंक #256 #263
विश्वसनीयता 10.0 10.0
संगति 7.3 9.3
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 42.0% 33.3%
अस्थिर टेस्ट 8 2
कुल रन 69 69
प्रति परिणाम लागत 11.289 9.845
कुल लागत $0.794 $0.690
इनपुट कीमत $0.250 / 1M $2.500 / 1M
आउटपुट कीमत $0.800 / 1M $15.000 / 1M
कैश पढ़ने की कीमत $0.060 / 1M $0.250 / 1M
कैश लिखने की कीमत लागू नहीं लागू नहीं
कुल इनपुट टोकन 283,116 219,404
आउटपुट टोकन 277,920 9,372
रीजनिंग टोकन 665,124 0
प्रतिक्रिया समय (औसत) 74.52s 3.89s
प्रतिक्रिया समय (अधिकतम) 510.21s 43.73s
प्रतिक्रिया समय (कुल) 1713.90s 89.48s
पैरामीटर 398B कुल (13B सक्रिय) ~1.5T कुल (~100B सक्रिय)
उपलब्धता वेट उपलब्ध बंद स्रोत

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#256 Trinity Large Thinking

high
लागत
$0.028
समय
130.1s
टोकन
34,387 tok

#263 GPT-5.4

none
लागत
$0.026
समय
18.1s
टोकन
1,792 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
GPT-5.4 5.5 10.0 33.3% 0 1.62s 7,305 516 0

त्वरित तुलना

तुलना जोड़ी बदलें