نیویگیشن
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Inception: Mercury 2 vs OpenAI: GPT-5.4

خلاصہ

Mercury 2 vs GPT-5.4 benchmark موازنہ: GPT-5.4 average score میں آگے ہے: 5.8 vs 4.6. Mercury 2 کی benchmark لاگت کم ہے: $0.011 vs $0.122. Mercury 2 تیز ہے: 653ms vs 1.42s، pass rates 23.8% vs 36.5%.

تجویز کردہ ماڈل: Mercury 2 - It offers the best overall trade-off: a competitive score (4.6), lower cost than GPT-5.4, and balanced response time.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-06-18

میٹرک Mercury 2 Mercury 2 none اجرا: 2026-02-24 GPT-5.4 GPT-5.4 none اجرا: 2026-03-05
اسکور 4.6 5.8
درجہ #151 #112
اعتماد پذیری 10.0 10.0
تسلسل 9.2 9.2
درست ٹیسٹس
فی کوشش کامیابی کی شرح 23.8% 36.5%
غیر مستحکم ٹیسٹ 2 2
کل رنز 63 63
فی نتیجہ لاگت 0.259 1.740
کل لاگت $0.011 $0.122
ان پٹ قیمت $0.250 / 1M $2.500 / 1M
آؤٹ پٹ قیمت $0.750 / 1M $15.000 / 1M
کل ان پٹ ٹوکنز 28,113 34,212
آؤٹ پٹ ٹوکنز 4,439 2,417
ریزننگ ٹوکنز 0 0
ردِعمل کا وقت (اوسط) 653ms 1.42s
ردِعمل کا وقت (زیادہ سے زیادہ) 1.43s 2.95s
ردِعمل کا وقت (کل) 13.72s 29.87s

جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#151 Mercury 2

none
لاگت
$0.002
وقت
1.8s
ٹوکنز
1,514 tok

#112 GPT-5.4

none
لاگت
$0.026
وقت
18.1s
ٹوکنز
1,792 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

اینٹی اے آئی چالیں اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 3.0 10.0 0.0% 0 483ms 631 286 0
GPT-5.4 3.2 8.0 8.3% 1 1.21s 606 406 0
کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 3.4 9.6 0.0% 0 1.03s 7,229 3,088 0
GPT-5.4 5.5 10.0 33.3% 0 1.62s 7,305 516 0
مشترکہ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 3.0 10.0 0.0% 0 606ms 4,821 131 0
GPT-5.4 3.0 10.0 0.0% 0 2.89s 11,019 291 0
ڈیٹا پارسنگ اور استخراج اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 7.3 5.9 83.3% 1 667ms 6,362 180 0
GPT-5.4 10.0 10.0 100.0% 0 1.04s 7,140 222 0
ڈومین مخصوص اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 5.3 7.2 44.4% 1 534ms 784 46 0
GPT-5.4 5.3 7.2 44.4% 1 1.07s 723 50 0
عمومی ذہانت اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 4.8 10.0 0.0% 0 628ms 495 159 0
GPT-5.4 4.4 9.9 0.0% 0 1.78s 477 184 0
ہدایات کی پیروی اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 6.5 10.0 50.0% 0 551ms 691 82 0
GPT-5.4 6.5 10.0 50.0% 0 1.07s 660 81 0
پہیلی حل کرنا اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 3.1 10.0 0.0% 0 535ms 694 251 0
GPT-5.4 5.6 9.8 33.3% 0 1.44s 642 381 0
ٹول کالنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 10.0 10.0 100.0% 0 1.27s 6,193 197 0
GPT-5.4 10.0 10.0 100.0% 0 2.75s 5,445 246 0
معلومات عامہ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
Mercury 2 3.0 10.0 0.0% 0 548ms 213 19 0
GPT-5.4 3.0 10.0 0.0% 0 990ms 195 40 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں