نیویگیشن
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Inception: Mercury 2 vs StepFun: Step 3.7 Flash

خلاصہ

Mercury 2 vs Step 3.7 Flash benchmark موازنہ: Step 3.7 Flash average score میں آگے ہے: 7.7 vs 7.5. Mercury 2 کی benchmark لاگت کم ہے: $0.058 vs $0.341. Mercury 2 تیز ہے: 2.24s vs 15.74s، pass rates 54.0% vs 68.3%.

تجویز کردہ ماڈل: Mercury 2 - Its score stays close to the best score here (7.5 vs 7.7), while costing about 5.9x less than Step 3.7 Flash.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-06-12

میٹرک Mercury 2 Mercury 2 medium اجرا: 2026-02-24 Step 3.7 Flash Step 3.7 Flash low اجرا: 2026-05-29
اسکور 7.5 7.7
درجہ #46 #42
اعتماد پذیری 10.0 10.0
تسلسل 8.8 8.4
درست ٹیسٹس
فی کوشش کامیابی کی شرح 54.0% 68.3%
غیر مستحکم ٹیسٹ 3 4
کل رنز 63 63
فی نتیجہ لاگت 0.578 2.840
کل لاگت $0.058 $0.341
ان پٹ قیمت $0.250 / 1M $0.200 / 1M
آؤٹ پٹ قیمت $0.750 / 1M $1.150 / 1M
کل ان پٹ ٹوکنز 35,116 40,101
آؤٹ پٹ ٹوکنز 4,048 289,325
ریزننگ ٹوکنز 61,219 0
ردِعمل کا وقت (اوسط) 2.24s 15.74s
ردِعمل کا وقت (زیادہ سے زیادہ) 14.63s 124.75s
ردِعمل کا وقت (کل) 44.72s 330.63s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#46 Mercury 2

medium
Cost
$0.002
Time
2.1s
Tokens
1,702 tok

#42 Step 3.7 Flash

low
Invalid SVG
Cost
$0.004
Time
25.3s
Tokens
3,072 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

اینٹی اے آئی چالیں اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 6.9 9.9 50.0% 0 1.12s 554 2,546 2,609
Step 3.7 Flash 8.7 7.9 91.7% 1 4.02s 756 10,896 0
کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 8.2 7.7 77.8% 1 2.04s 7,065 296 11,328
Step 3.7 Flash 8.2 7.2 88.9% 1 9.46s 7,437 18,685 0
مشترکہ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 10.0 10.0 100.0% 0 3.28s 12,909 268 4,887
Step 3.7 Flash 10.0 10.0 100.0% 0 7.98s 13,683 6,426 0
ڈیٹا پارسنگ اور استخراج اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 7.3 5.9 83.3% 1 1.11s 6,234 183 1,656
Step 3.7 Flash 7.3 5.8 83.3% 1 2.29s 7,398 2,667 0
ڈومین مخصوص اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 2.9 7.2 11.1% 1 6.48s 695 41 30,754
Step 3.7 Flash 5.3 7.2 44.4% 1 43.31s 828 104,487 0
عمومی ذہانت اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 4.8 10.0 0.0% 0 821ms 456 137 542
Step 3.7 Flash 3.4 9.3 0.0% 0 7.00s 525 4,604 0
ہدایات کی پیروی اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 10.0 10.0 100.0% 0 1.07s 340 14 958
Step 3.7 Flash 9.8 10.0 100.0% 0 1.58s 735 1,857 0
پہیلی حل کرنا اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 5.4 10.0 33.3% 0 949ms 601 361 2,781
Step 3.7 Flash 5.5 9.9 33.3% 0 1.84s 756 3,564 0
ٹول کالنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 10.0 10.0 100.0% 0 1.89s 6,080 180 1,956
Step 3.7 Flash 10.0 10.0 100.0% 0 3.25s 7,746 1,360 0
معلومات عامہ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 3.0 10.0 0.0% 0 2.58s 182 22 3,748
Step 3.7 Flash 3.0 10.0 0.0% 0 124.75s 237 134,779 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں