نیویگیشن
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

OpenAI: GPT-5.5 vs StepFun: Step 3.7 Flash

خلاصہ

GPT-5.5 vs Step 3.7 Flash benchmark موازنہ: Step 3.7 Flash average score میں آگے ہے: 7.0 vs 6.4. GPT-5.5 کی benchmark لاگت کم ہے: $0.231 vs $1.148. GPT-5.5 تیز ہے: 1.89s vs 64.46s، pass rates 54.0% vs 63.5%.

تجویز کردہ ماڈل: GPT-5.5 - Its score stays close to the best score here (6.4 vs 7.0), while costing about 5.0x less than Step 3.7 Flash.

بینچ مارکس AI BENCHY ٹیسٹ سوئٹس سے اس وقت تیار کیے گئے: 2026-06-04

میٹرک GPT-5.5 GPT-5.5 none اجرا: 2026-04-24 Step 3.7 Flash Step 3.7 Flash high اجرا: 2026-05-29
اسکور 6.4 7.0
درجہ #91 #71
اعتماد پذیری 10.0 10.0
تسلسل 8.8 8.2
درست ٹیسٹس
فی کوشش کامیابی کی شرح 54.0% 63.5%
غیر مستحکم ٹیسٹ 3 4
کل رنز 63 63
فی نتیجہ لاگت 2.302 10.434
کل لاگت $0.231 $1.148
ان پٹ قیمت $5.000 / 1M $0.200 / 1M
آؤٹ پٹ قیمت $30.000 / 1M $1.150 / 1M
کل ان پٹ ٹوکنز 34,212 38,391
آؤٹ پٹ ٹوکنز 1,971 991,355
ریزننگ ٹوکنز 0 0
ردِعمل کا وقت (اوسط) 1.89s 64.46s
ردِعمل کا وقت (زیادہ سے زیادہ) 5.56s 364.99s
ردِعمل کا وقت (کل) 39.64s 1353.57s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#91 GPT-5.5

none
Cost
$0.090
Time
54.3s
Tokens
3,063 tok

#71 Step 3.7 Flash

high
Cost
$0.007
Time
63.6s
Tokens
6,030 tok

اسکور کے لحاظ سے سرفہرست ماڈلز

اسکور بمقابلہ کل لاگت

ردِعمل کا وقت (اوسط)

اسکور vs ردِعمل کا وقت (اوسط)

کل آؤٹ پٹ ٹوکنز

اسکور vs کل آؤٹ پٹ ٹوکنز

زمرہ وار تفصیل

اینٹی اے آئی چالیں اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.5 6.9 7.9 66.7% 1 1.31s 606 213 0
Step 3.7 Flash 10.0 10.0 100.0% 0 13.40s 696 42,656 0
کوڈنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.5 5.5 10.0 33.3% 0 1.35s 7,305 462 0
Step 3.7 Flash 4.0 6.0 22.2% 1 206.21s 6,057 327,340 0
مشترکہ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.5 3.0 10.0 0.0% 0 5.56s 11,019 300 0
Step 3.7 Flash 10.0 10.0 100.0% 0 13.01s 13,638 8,802 0
ڈیٹا پارسنگ اور استخراج اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.5 10.0 10.0 100.0% 0 1.18s 7,140 222 0
Step 3.7 Flash 10.0 10.0 100.0% 0 14.72s 7,368 23,113 0
ڈومین مخصوص اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.5 2.9 7.2 11.1% 1 1.31s 723 52 0
Step 3.7 Flash 4.1 4.4 44.5% 2 149.64s 783 410,502 0
عمومی ذہانت اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.5 10.0 10.0 100.0% 0 3.41s 477 124 0
Step 3.7 Flash 5.5 10.0 0.0% 0 4.17s 510 2,862 0
ہدایات کی پیروی اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.5 6.2 5.8 66.7% 1 1.15s 660 81 0
Step 3.7 Flash 9.8 10.0 100.0% 0 1.52s 705 2,010 0
پہیلی حل کرنا اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.5 7.7 10.0 66.7% 0 1.29s 642 252 0
Step 3.7 Flash 5.3 7.2 44.4% 1 10.22s 711 25,422 0
ٹول کالنگ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.5 10.0 10.0 100.0% 0 3.90s 5,445 247 0
Step 3.7 Flash 10.0 10.0 100.0% 0 2.79s 7,701 1,172 0
معلومات عامہ اسکور تسلسل فی کوشش کامیابی کی شرح غیر مستحکم ٹیسٹ درست ٹیسٹس ردِعمل کا وقت (اوسط) ان پٹ ٹوکنز آؤٹ پٹ ٹوکنز ریزننگ ٹوکنز
GPT-5.5 3.0 10.0 0.0% 0 5.01s 195 18 0
Step 3.7 Flash 3.0 10.0 0.0% 0 149.34s 222 147,476 0

فوری موازنہ

موازنہ کی جوڑی تبدیل کریں