नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (medium) vs gpt-oss-120b (medium)

average score जवळपास समान आहे: 6.1 vs 6.1. gpt-oss-120b (medium) चा benchmark खर्च कमी आहे: $0.019 vs $0.798. gpt-oss-120b (medium) वेगवान आहे: 20.81s vs 85.44s, pass rates 48.5% vs 50.0%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-15

क्रमांक
#174
एकूण आउटपुट टोकन्स
1,016,785
प्रतिसाद वेळ (सरासरी)
85.44s
एकूण खर्च
$0.798
क्रमांक
#169
एकूण आउटपुट टोकन्स
98,282
प्रतिसाद वेळ (सरासरी)
20.81s
एकूण खर्च
$0.019
शिफारस केलेले मॉडेल gpt-oss-120b (medium)

It has the best score here (6.1), while costing about 43.7x less than Trinity Large Thinking (medium).

तपशीलवार तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking medium प्रकाशन: 2026-07-28 gpt-oss-120b gpt-oss-120b medium प्रकाशन: 2025-08-05
स्कोअर 6.1 6.1
क्रमांक #174 #169
विश्वसनीयता 10.0 10.0
सुसंगतता 7.9 8.0
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 48.5% 50.0%
अस्थिर चाचण्या 6 5
एकूण रन 66 66
प्रति निकाल खर्च 9.972 0.224
एकूण खर्च $0.798 $0.019
इनपुट किंमत $0.220 / 1M $0.030 / 1M
आउटपुट किंमत $0.850 / 1M $0.170 / 1M
एकूण इनपुट टोकन्स 118,486 108,767
आउटपुट टोकन्स 156,166 29,378
रिझनिंग टोकन्स 860,619 68,904
प्रतिसाद वेळ (सरासरी) 85.44s 20.81s
प्रतिसाद वेळ (कमाल) 525.14s 68.16s
प्रतिसाद वेळ (एकूण) 1879.75s 332.88s
पॅरामीटर्स 398B एकूण (13B सक्रिय) 117B एकूण (5.1B सक्रिय)
उपलब्धता वेट्स उपलब्ध मुक्त स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#174 Trinity Large Thinking

medium
खर्च
$0.016
वेळ
75.9s
टोकन्स
19,401 tok

#169 gpt-oss-120b

medium
खर्च
$0.001
वेळ
26.7s
टोकन्स
555 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

झटपट तुलना

तुलना जोडी बदला