نیویگیشن
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

OpenAI: GPT-5.2 vs StepFun: Step 3.7 Flash

خلاصہ

GPT-5.2 vs Step 3.7 Flash benchmark موازنہ: Step 3.7 Flash average score میں آگے ہے: 8.5 vs 8.4. Step 3.7 Flash کی benchmark لاگت کم ہے: $0.376 vs $0.548. GPT-5.2 تیز ہے: 16.88s vs 20.35s، pass rates 71.4% vs 73.0%.

تجویز کردہ ماڈل: Step 3.7 Flash - It has the strongest score in this comparison (8.5) and the best overall balance of cost and response time across all 2 models.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-07-02

میٹرک GPT-5.2 GPT-5.2 medium اجرا: 2025-12-11 Step 3.7 Flash Step 3.7 Flash medium اجرا: 2026-05-29
اسکور 8.4 8.5
درجہ #22 #20
اعتماد پذیری 10.0 9.9
تسلسل 8.4 9.3
درست ٹیسٹس
فی کوشش کامیابی کی شرح 71.4% 73.0%
غیر مستحکم ٹیسٹ 4 2
کل رنز 63 61
فی نتیجہ لاگت 4.209 2.686
کل لاگت $0.548 $0.376
ان پٹ قیمت $1.750 / 1M $0.200 / 1M
آؤٹ پٹ قیمت $14.000 / 1M $1.150 / 1M
کل ان پٹ ٹوکنز 33,967 39,981
آؤٹ پٹ ٹوکنز 2,901 319,958
ریزننگ ٹوکنز 31,932 0
ردِعمل کا وقت (اوسط) 16.88s 20.35s
ردِعمل کا وقت (زیادہ سے زیادہ) 77.80s 113.98s
ردِعمل کا وقت (کل) 236.34s 427.42s

جنریشن شوکیس

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#22 GPT-5.2

medium
لاگت
$0.047
وقت
49.2s
ٹوکنز
3,396 tok

#20 Step 3.7 Flash

medium
لاگت
$0.006
وقت
46.2s
ٹوکنز
4,466 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

اینٹی اے آئی چالیں اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.2 6.5 8.0 58.3% 1 7.81s 606 567 2,002
Step 3.7 Flash 8.7 7.9 91.7% 1 9.65s 756 32,185 0
کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.2 10.0 10.0 100.0% 0 22.73s 7,302 511 11,912
Step 3.7 Flash 8.8 7.8 88.9% 1 27.42s 7,437 44,797 0
مشترکہ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.2 10.0 10.0 100.0% 0 14.06s 11,019 291 1,757
Step 3.7 Flash 10.0 10.0 100.0% 0 9.06s 13,683 7,106 0
ڈیٹا پارسنگ اور استخراج اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.2 10.0 10.0 100.0% 0 3.15s 7,140 234 420
Step 3.7 Flash 10.0 10.0 100.0% 0 2.75s 7,398 3,020 0
ڈومین مخصوص اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.2 5.9 7.2 55.6% 1 77.80s 473 42 10,342
Step 3.7 Flash 7.7 10.0 66.7% 0 48.27s 708 70,347 0
عمومی ذہانت اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.2 3.7 9.7 0.0% 0 4.32s 477 162 269
Step 3.7 Flash 4.0 10.0 0.0% 0 6.85s 525 3,987 0
ہدایات کی پیروی اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.2 9.9 10.0 100.0% 0 3.12s 660 94 614
Step 3.7 Flash 9.8 10.0 100.0% 0 1.83s 735 2,166 0
پہیلی حل کرنا اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.2 7.5 7.3 77.8% 1 5.80s 642 735 924
Step 3.7 Flash 5.7 9.9 33.3% 0 6.19s 756 15,071 0
ٹول کالنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.2 4.7 1.6 66.7% 1 10.30s 5,453 239 469
Step 3.7 Flash 10.0 10.0 100.0% 0 4.16s 7,746 2,115 0
معلومات عامہ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.2 3.0 10.0 0.0% 0 28.18s 195 26 3,223
Step 3.7 Flash 3.0 10.0 0.0% 0 113.98s 237 139,164 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں