नेविगेशन
Advertise here

Trinity Large Thinking (medium) vs Mistral Large 4 (medium)

Mistral Large 4 (medium) average score में आगे है: 6.2 vs 6.1. Trinity Large Thinking (medium) की benchmark लागत कम है: $0.862 vs $1.456. Trinity Large Thinking (medium) तेज है: 84.01s vs 265.03s, pass rates 49.3% vs 55.1%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-06

तुलना किए गए मॉडल

रैंक
#242
कुल आउटपुट टोकन
925,046
प्रतिक्रिया समय (औसत)
84.01s
कुल लागत
$0.862
रैंक
#240
कुल आउटपुट टोकन
627,233
प्रतिक्रिया समय (औसत)
265.03s
कुल लागत
$1.456
अनुशंसित मॉडल Trinity Large Thinking (medium)

Its score stays close to the best score here (6.1 vs 6.2), while costing about 1.7x less than Mistral Large 4 (medium).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking medium रिलीज़: 2026-07-28 Mistral Large 4 Mistral Large 4 medium रिलीज़: 2026-10-06
स्कोर 6.1 6.2
रैंक #242 #240
विश्वसनीयता 10.0 9.2
संगति 7.7 7.6
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 49.3% 55.1%
अस्थिर टेस्ट 7 7
कुल रन 69 69
प्रति परिणाम लागत 10.772 16.168
कुल लागत $0.862 $1.456
इनपुट कीमत $0.250 / 1M $0.680 / 1M
आउटपुट कीमत $0.800 / 1M $2.090 / 1M
कैश पढ़ने की कीमत $0.060 / 1M $0.070 / 1M
कैश लिखने की कीमत लागू नहीं लागू नहीं
कुल इनपुट टोकन 319,352 212,024
आउटपुट टोकन 158,447 166,422
रीजनिंग टोकन 875,524 562,095
प्रतिक्रिया समय (औसत) 84.01s 265.03s
प्रतिक्रिया समय (अधिकतम) 525.14s 1760.20s
प्रतिक्रिया समय (कुल) 1932.24s 6095.69s
पैरामीटर 398B कुल (13B सक्रिय) 1.05T कुल (49B सक्रिय)
उपलब्धता वेट उपलब्ध बंद स्रोत

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#242 Trinity Large Thinking

medium
लागत
$0.016
समय
75.9s
टोकन
19,401 tok

#240 Mistral Large 4

medium
लागत
$0.011
समय
63.4s
टोकन
5,291 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
Mistral Large 4 3.4 7.2 22.2% 1 1201.87s 7,189 33,530 303,140

त्वरित तुलना

तुलना जोड़ी बदलें