नेविगेशन
AI BENCHY
Advertise here

Trinity Large Thinking (low) vs gpt-oss-120b (medium)

gpt-oss-120b (medium) average score में आगे है: 6.1 vs 6.0. gpt-oss-120b (medium) की benchmark लागत कम है: $0.019 vs $0.656. gpt-oss-120b (medium) तेज है: 21.91s vs 96.78s, pass rates 48.5% vs 50.0%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-28

रैंक
#145
कुल आउटपुट टोकन
815,220
प्रतिक्रिया समय (औसत)
96.78s
कुल लागत
$0.656
रैंक
#135
कुल आउटपुट टोकन
97,816
प्रतिक्रिया समय (औसत)
21.91s
कुल लागत
$0.019
अनुशंसित मॉडल gpt-oss-120b (medium)

It has the best score here (6.1), while costing about 35.0x less than Trinity Large Thinking (low).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking low रिलीज़: 2026-07-28 gpt-oss-120b gpt-oss-120b medium रिलीज़: 2025-08-05
स्कोर 6.0 6.1
रैंक #145 #135
विश्वसनीयता 9.7 10.0
संगति 7.9 8.0
सही परीक्षण
प्रति प्रयास पास दर 48.5% 50.0%
अस्थिर टेस्ट 6 5
कुल रन 66 66
प्रति परिणाम लागत 8.199 0.221
कुल लागत $0.656 $0.019
इनपुट कीमत $0.220 / 1M $0.037 / 1M
आउटपुट कीमत $0.850 / 1M $0.170 / 1M
कुल इनपुट टोकन 122,845 108,747
आउटपुट टोकन 117,704 29,772
रीजनिंग टोकन 697,516 68,044
प्रतिक्रिया समय (औसत) 96.78s 21.91s
प्रतिक्रिया समय (अधिकतम) 540.96s 68.16s
प्रतिक्रिया समय (कुल) 2129.13s 328.70s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#145 Trinity Large Thinking

low
लागत
$0.021
समय
173.2s
टोकन
24,586 tok

#135 gpt-oss-120b

medium
लागत
$0.001
समय
26.7s
टोकन
555 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

त्वरित तुलना

तुलना जोड़ी बदलें