নেভিগেশন
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (low) vs gpt-oss-120b (medium)

gpt-oss-120b (medium) average score-এ এগিয়ে: 6.1 vs 6.0. gpt-oss-120b (medium)-এর benchmark খরচ কম: $0.020 vs $0.625. gpt-oss-120b (medium) দ্রুত: 20.81s vs 96.61s, pass rates 47.0% vs 50.0%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-09-10

তুলনা করা মডেল

র‍্যাঙ্ক
#208
মোট আউটপুট টোকেন
818,359
প্রতিক্রিয়া সময় (গড়)
96.61s
মোট খরচ
$0.625
র‍্যাঙ্ক
#198
মোট আউটপুট টোকেন
98,282
প্রতিক্রিয়া সময় (গড়)
20.81s
মোট খরচ
$0.020
প্রস্তাবিত মডেল gpt-oss-120b (medium)

It has the best score here (6.1), while costing about 32.8x less than Trinity Large Thinking (low).

বিস্তারিত তুলনা

মেট্রিক Trinity Large Thinking Trinity Large Thinking low প্রকাশ: 2026-07-28 gpt-oss-120b gpt-oss-120b medium প্রকাশ: 2025-08-05
স্কোর 6.0 6.1
র‍্যাঙ্ক #208 #198
নির্ভরযোগ্যতা 10.0 10.0
ধারাবাহিকতা 8.3 8.0
প্রচেষ্টা 66/66 66/66
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 47.0% 50.0%
অস্থির টেস্ট 5 5
মোট রান 66 66
প্রতি ফলাফলে খরচ 8.221 0.224
মোট খরচ $0.625 $0.020
ইনপুট মূল্য $0.250 / 1M $0.037 / 1M
আউটপুট মূল্য $0.800 / 1M $0.170 / 1M
মোট ইনপুট টোকেন 122,854 108,767
আউটপুট টোকেন 119,810 29,378
রিজনিং টোকেন 698,549 68,904
প্রতিক্রিয়া সময় (গড়) 96.61s 20.81s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 540.96s 68.16s
প্রতিক্রিয়া সময় (মোট) 2125.51s 332.88s
প্যারামিটার 398B মোট (13B সক্রিয়) 117B মোট (5.1B সক্রিয়)
উপলভ্যতা ওজন উপলভ্য উন্মুক্ত উৎস

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#208 Trinity Large Thinking

low
খরচ
$0.021
সময়
173.2s
টোকেন
24,586 tok

#198 gpt-oss-120b

medium
খরচ
$0.001
সময়
26.7s
টোকেন
555 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

দ্রুত তুলনা

তুলনার জুটি বদলান