নেভিগেশন
AI BENCHY
Advertise here

Trinity Large Thinking (high) vs Mistral Small 4

Mistral Small 4 average score-এ এগিয়ে: 5.1 vs 4.8. Mistral Small 4-এর benchmark খরচ কম: $0.022 vs $0.632. Mistral Small 4 দ্রুত: 1.20s vs 77.22s, pass rates 39.4% vs 25.8%.

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-07-28

র‍্যাঙ্ক
#202
মোট আউটপুট টোকেন
953,758
প্রতিক্রিয়া সময় (গড়)
77.22s
মোট খরচ
$0.632
র‍্যাঙ্ক
#185
মোট আউটপুট টোকেন
9,812
প্রতিক্রিয়া সময় (গড়)
1.20s
মোট খরচ
$0.022
প্রস্তাবিত মডেল Mistral Small 4

It has the best score here (5.1), while costing about 29.3x less than Trinity Large Thinking (high).

বিস্তারিত তুলনা

মেট্রিক Trinity Large Thinking Trinity Large Thinking high প্রকাশ: 2026-07-28 Mistral Small 4 Mistral Small 4 none প্রকাশ: 2026-03-16
স্কোর 4.8 5.1
র‍্যাঙ্ক #202 #185
নির্ভরযোগ্যতা 9.9 10.0
ধারাবাহিকতা 7.2 9.6
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 39.4% 25.8%
অস্থির টেস্ট 8 1
মোট রান 66 66
প্রতি ফলাফলে খরচ 12.640 0.432
মোট খরচ $0.632 $0.022
ইনপুট মূল্য $0.220 / 1M $0.150 / 1M
আউটপুট মূল্য $0.850 / 1M $0.600 / 1M
মোট ইনপুট টোকেন 101,767 104,708
আউটপুট টোকেন 286,218 9,812
রিজনিং টোকেন 667,540 0
প্রতিক্রিয়া সময় (গড়) 77.22s 1.20s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 510.21s 13.16s
প্রতিক্রিয়া সময় (মোট) 1698.89s 26.38s

মডেল জেনারেশন শোকেস

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#202 Trinity Large Thinking

high
খরচ
$0.028
সময়
130.1s
টোকেন
34,387 tok

#185 Mistral Small 4

none
খরচ
$0.002
সময়
10.4s
টোকেন
2,370 tok

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

কোডিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) ইনপুট টোকেন আউটপুট টোকেন রিজনিং টোকেন
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
Mistral Small 4 3.7 9.7 0.0% 0 901ms 7,636 619 0

দ্রুত তুলনা

তুলনার জুটি বদলান