नेव्हिगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (low) vs gpt-oss-120b (medium)

gpt-oss-120b (medium) average score मध्ये पुढे आहे: 6.1 vs 6.0. gpt-oss-120b (medium) चा benchmark खर्च कमी आहे: $0.020 vs $0.625. gpt-oss-120b (medium) वेगवान आहे: 20.81s vs 96.61s, pass rates 47.0% vs 50.0%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-09-10

तुलना केलेली मॉडेल्स

क्रमांक
#208
एकूण आउटपुट टोकन्स
818,359
प्रतिसाद वेळ (सरासरी)
96.61s
एकूण खर्च
$0.625
क्रमांक
#198
एकूण आउटपुट टोकन्स
98,282
प्रतिसाद वेळ (सरासरी)
20.81s
एकूण खर्च
$0.020
शिफारस केलेले मॉडेल gpt-oss-120b (medium)

It has the best score here (6.1), while costing about 32.8x less than Trinity Large Thinking (low).

तपशीलवार तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking low प्रकाशन: 2026-07-28 gpt-oss-120b gpt-oss-120b medium प्रकाशन: 2025-08-05
स्कोअर 6.0 6.1
क्रमांक #208 #198
विश्वसनीयता 10.0 10.0
सुसंगतता 8.3 8.0
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 47.0% 50.0%
अस्थिर चाचण्या 5 5
एकूण रन 66 66
प्रति निकाल खर्च 8.221 0.224
एकूण खर्च $0.625 $0.020
इनपुट किंमत $0.250 / 1M $0.037 / 1M
आउटपुट किंमत $0.800 / 1M $0.170 / 1M
एकूण इनपुट टोकन्स 122,854 108,767
आउटपुट टोकन्स 119,810 29,378
रिझनिंग टोकन्स 698,549 68,904
प्रतिसाद वेळ (सरासरी) 96.61s 20.81s
प्रतिसाद वेळ (कमाल) 540.96s 68.16s
प्रतिसाद वेळ (एकूण) 2125.51s 332.88s
पॅरामीटर्स 398B एकूण (13B सक्रिय) 117B एकूण (5.1B सक्रिय)
उपलब्धता वेट्स उपलब्ध मुक्त स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#208 Trinity Large Thinking

low
खर्च
$0.021
वेळ
173.2s
टोकन्स
24,586 tok

#198 gpt-oss-120b

medium
खर्च
$0.001
वेळ
26.7s
टोकन्स
555 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

झटपट तुलना

तुलना जोडी बदला