नेविगेशन
Advertise here

Trinity Large Thinking (high) vs GPT-5.4 Mini

average score लगभग बराबर है: 5.7 vs 5.7. GPT-5.4 Mini की benchmark लागत कम है: $0.170 vs $0.645. GPT-5.4 Mini तेज है: 3.34s vs 74.52s, pass rates 42.0% vs 30.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#253
कुल आउटपुट टोकन
943,044
प्रतिक्रिया समय (औसत)
74.52s
कुल लागत
$0.645
रैंक
#255
कुल आउटपुट टोकन
8,828
प्रतिक्रिया समय (औसत)
3.34s
कुल लागत
$0.170
अनुशंसित मॉडल GPT-5.4 Mini

It has the best score here (5.7), while costing about 3.8x less than Trinity Large Thinking (high).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking high रिलीज़: 2026-07-28 GPT-5.4 Mini GPT-5.4 Mini none रिलीज़: 2026-03-17
स्कोर 5.7 5.7
रैंक #253 #255
विश्वसनीयता 10.0 10.0
संगति 7.3 9.3
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 42.0% 30.4%
अस्थिर टेस्ट 8 2
कुल रन 69 69
प्रति परिणाम लागत 11.289 2.818
कुल लागत $0.645 $0.170
इनपुट कीमत $0.250 / 1M $0.750 / 1M
आउटपुट कीमत $0.800 / 1M $4.500 / 1M
कुल इनपुट टोकन 283,116 172,438
आउटपुट टोकन 277,920 8,828
रीजनिंग टोकन 665,124 0
प्रतिक्रिया समय (औसत) 74.52s 3.34s
प्रतिक्रिया समय (अधिकतम) 510.21s 41.98s
प्रतिक्रिया समय (कुल) 1713.90s 76.84s
पैरामीटर 398B कुल (13B सक्रिय) ~400B कुल (~17B सक्रिय)
उपलब्धता वेट उपलब्ध बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#253 Trinity Large Thinking

high
लागत
$0.028
समय
130.1s
टोकन
34,387 tok

#255 GPT-5.4 Mini

none
लागत
$0.010
समय
11.7s
टोकन
2,151 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
GPT-5.4 Mini 5.5 10.0 33.3% 0 913ms 7,305 401 0

त्वरित तुलना

तुलना जोड़ी बदलें