নেভিগেশন
AI BENCHY
Advertise here

Trinity Large Thinking (high) vs Grok 4.20

Trinity Large Thinking (high) average score-এ এগিয়ে: 4.8 vs 4.1. Grok 4.20-এর benchmark খরচ কম: $0.057 vs $0.632. Grok 4.20 দ্রুত: 1.11s vs 77.22s, pass rates 39.4% vs 27.3%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-28

র‍্যাঙ্ক
#202
মোট আউটপুট টোকেন
953,758
প্রতিক্রিয়া সময় (গড়)
77.22s
মোট খরচ
$0.632
র‍্যাঙ্ক
#220
মোট আউটপুট টোকেন
1,923
প্রতিক্রিয়া সময় (গড়)
1.11s
মোট খরচ
$0.057
প্রস্তাবিত মডেল Grok 4.20

Its score stays close to the best score here (4.1 vs 4.8), while costing about 11.2x less than Trinity Large Thinking (high).

বিস্তারিত তুলনা

মেট্রিক Trinity Large Thinking Trinity Large Thinking high প্রকাশ: 2026-07-28 Grok 4.20 Grok 4.20 none প্রকাশ: 2026-03-31
স্কোর 4.8 4.1
র‍্যাঙ্ক #202 #220
নির্ভরযোগ্যতা 9.9 প্রযোজ্য নয়
ধারাবাহিকতা 7.2 8.1
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 39.4% 27.3%
অস্থির টেস্ট 8 0
মোট রান 66 54
প্রতি ফলাফলে খরচ 12.640 1.570
মোট খরচ $0.632 $0.057
ইনপুট মূল্য $0.220 / 1M $1.250 / 1M
আউটপুট মূল্য $0.850 / 1M $2.500 / 1M
মোট ইনপুট টোকেন 101,767 41,313
আউটপুট টোকেন 286,218 1,923
রিজনিং টোকেন 667,540 0
প্রতিক্রিয়া সময় (গড়) 77.22s 1.11s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 510.21s 6.04s
প্রতিক্রিয়া সময় (মোট) 1698.89s 19.96s

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#202 Trinity Large Thinking

high
খরচ
$0.028
সময়
130.1s
টোকেন
34,387 tok

#220 xAI: Grok 4.20

none
খরচ
$0.004
সময়
6.5s
টোকেন
1,367 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
Grok 4.20 1.1 3.1 0.0% 0 1.22s 1,074 312 0

দ্রুত তুলনা

তুলনার জুটি বদলান