नेव्हिगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (high) vs Mistral Large 4

average score जवळपास समान आहे: 5.7 vs 5.7. Mistral Large 4 चा benchmark खर्च कमी आहे: $0.290 vs $0.794. Mistral Large 4 वेगवान आहे: 20.43s vs 74.52s, pass rates 42.0% vs 31.9%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-10-07

तुलना केलेली मॉडेल्स

क्रमांक
#269
एकूण आउटपुट टोकन्स
717,762
प्रतिसाद वेळ (सरासरी)
74.52s
एकूण खर्च
$0.794
क्रमांक
#272
एकूण आउटपुट टोकन्स
54,388
प्रतिसाद वेळ (सरासरी)
20.43s
एकूण खर्च
$0.290
शिफारस केलेले मॉडेल Mistral Large 4

It has the best score here (5.7), while costing about 2.7x less than Trinity Large Thinking (high).

तपशीलवार तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking high प्रकाशन: 2026-07-28 Mistral Large 4 Mistral Large 4 none प्रकाशन: 2026-10-06
स्कोअर 5.7 5.7
क्रमांक #269 #272
विश्वसनीयता 10.0 9.7
सुसंगतता 7.3 9.3
प्रयत्न 69/69 69/69
बरोबर चाचण्या
प्रति प्रयत्न पास दर 42.0% 31.9%
अस्थिर चाचण्या 8 2
एकूण रन 69 69
प्रति निकाल खर्च 11.289 4.818
एकूण खर्च $0.794 $0.290
इनपुट किंमत $0.250 / 1M $0.680 / 1M
आउटपुट किंमत $0.800 / 1M $2.090 / 1M
कॅश वाचण्याची किंमत $0.060 / 1M $0.070 / 1M
कॅश लिहिण्याची किंमत लागू नाही लागू नाही
एकूण इनपुट टोकन्स 283,116 257,872
आउटपुट टोकन्स 277,920 54,388
रिझनिंग टोकन्स 665,124 0
प्रतिसाद वेळ (सरासरी) 74.52s 20.43s
प्रतिसाद वेळ (कमाल) 510.21s 192.80s
प्रतिसाद वेळ (एकूण) 1713.90s 469.88s
पॅरामीटर्स 398B एकूण (13B सक्रिय) 1.05T एकूण (49B सक्रिय)
उपलब्धता वेट्स उपलब्ध बंद स्रोत

कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#269 Trinity Large Thinking

high
खर्च
$0.028
वेळ
130.1s
टोकन्स
34,387 tok

#272 Mistral Large 4

none
खर्च
$0.005
वेळ
33.0s
टोकन्स
2,461 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
Mistral Large 4 4.7 7.5 22.2% 1 85.04s 7,431 39,805 0

तुलना जोडी बदला