নেভিগেশন
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

StepFun: Step 3.5 Flash vs xAI: Grok 4.20 Beta

AI BENCHY টেস্ট স্যুট থেকে বেঞ্চমার্ক তৈরি হয়েছে: 2026-03-12

মেট্রিক Step 3.5 Flash Step 3.5 Flash medium প্রকাশ: 2026-02-01 বিনামূল্যে উপলভ্য Grok 4.20 Beta Grok 4.20 Beta none প্রকাশ: 2026-03-12
র‍্যাঙ্ক #14 #52
গড় স্কোর 7.4 4.4
ধারাবাহিকতা 9.1 9.1
প্রতি ফলাফলে খরচ 0.000 2.214
মোট খরচ $0.000 $0.089
সঠিক টেস্ট
প্রতি চেষ্টায় পাস রেট 68.8% 33.3%
অস্থির টেস্ট 2 2
মোট রান 48 48
আউটপুট টোকেন 71,452 1,511
রিজনিং টোকেন 155,147 0
প্রতিক্রিয়া সময় (গড়) 29.10s 1.22s
প্রতিক্রিয়া সময় (সর্বোচ্চ) 170.45s 6.48s
প্রতিক্রিয়া সময় (মোট) 290.96s 19.53s

স্কোর অনুযায়ী শীর্ষ মডেল

স্কোর বনাম মোট খরচ

প্রতিক্রিয়া সময় (গড়)

গড় স্কোর vs প্রতিক্রিয়া সময় (গড়)

মোট আউটপুট টোকেন

গড় স্কোর vs মোট আউটপুট টোকেন

বিভাগভিত্তিক বিশ্লেষণ

অ্যান্টি-এআই কৌশল স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) আউটপুট টোকেন রিজনিং টোকেন
Step 3.5 Flash 10.0 10.0 100.0% 0 18.54s 13,924 17,208
Grok 4.20 Beta 3.3 7.9 22.2% 1 562ms 245 0
সমন্বিত স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) আউটপুট টোকেন রিজনিং টোকেন
Step 3.5 Flash 10.0 10.0 100.0% 0 29.57s 1,176 12,984
Grok 4.20 Beta 10.0 10.0 0.0% 0 6.48s 282 0
ডেটা পার্সিং ও নিষ্কাশন স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) আউটপুট টোকেন রিজনিং টোকেন
Step 3.5 Flash 10.0 10.0 100.0% 0 15.01s 600 13,886
Grok 4.20 Beta 9.9 10.0 100.0% 0 601ms 197 0
ডোমেইন-নির্দিষ্ট স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) আউটপুট টোকেন রিজনিং টোকেন
Step 3.5 Flash 4.0 7.2 44.4% 1 170.45s 45,350 90,436
Grok 4.20 Beta 10.0 10.0 0.0% 0 611ms 160 0
Sadharon Buddhimotta স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) আউটপুট টোকেন রিজনিং টোকেন
Step 3.5 Flash 6.0 10.0 0.0% 0 6.54s 2,214 2,584
Grok 4.20 Beta 5.0 10.0 0.0% 0 541ms 87 0
নির্দেশনা অনুসরণ স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) আউটপুট টোকেন রিজনিং টোকেন
Step 3.5 Flash 9.0 6.8 83.3% 1 4.98s 2,284 3,412
Grok 4.20 Beta 4.5 10.0 0.0% 0 687ms 60 0
Puzzle Solving স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) আউটপুট টোকেন রিজনিং টোকেন
Step 3.5 Flash 4.0 10.0 33.3% 0 7.72s 5,629 10,835
Grok 4.20 Beta 4.0 7.2 55.6% 1 541ms 291 0
টুল কলিং স্কোর ধারাবাহিকতা প্রতি চেষ্টায় পাস রেট অস্থির টেস্ট সঠিক টেস্ট প্রতিক্রিয়া সময় (গড়) আউটপুট টোকেন রিজনিং টোকেন
Step 3.5 Flash 10.0 10.0 100.0% 0 11.91s 275 3,802
Grok 4.20 Beta 10.0 10.0 100.0% 0 4.79s 189 0

দ্রুত তুলনা

তুলনার জুটি বদলান