AI BENCHY
Advertise here
#39

Step 3.7 Flash

Stepfun प्रकाशन: 2026-05-29 चाचणी तारीख: 2026-06-04 13:49 stepfun/step-3.7-flash::low

सारांश

Step 3.7 Flash AI BENCHY वर 7.7 स्कोर करते आणि #39 वर आहे. याची reliability 10.0, pass rate 68.3%, एकूण खर्च $0.341, आणि सरासरी response time 15.74s आहे.

Step 3.7 Flash खास का आहे: हे कोडिंग मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर डेटा पार्सिंग आणि निष्कर्षण हा सर्वात कमकुवत भाग आहे, rank #17.

सुसंगतता

8.4

एकूण आउटपुट टोकन्स

289,325

एकूण इनपुट टोकन्स

40,101

इनपुट किंमत

$0.200 / 1M

आउटपुट किंमत

$1.150 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 9

प्रति प्रयत्न पास दर: 68.3%

अस्थिर चाचण्या

4

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

15.74s

प्रतिसाद वेळ (कमाल): 124.75s

प्रतिसाद वेळ (एकूण): 330.63s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#39 Step 3.7 Flash

low
अवैध SVG
खर्च
$0.004
वेळ
25.3s
टोकन्स
3,072 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-06-04 13:49 नवीन चाचणी जोडली 7.3 10.0 $0.341 सध्याची रन
2026-05-29 11:49 पहिला रन 7.4 10.0 $0.336 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

रन तुलना

रनस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-06-04 13:49 · सध्याची रन7.78.410.012/214289,32540,101$0.34115.74s
2026-05-29 11:49 · पहिला रन7.48.710.012/203285,2090$0.33616.06s
फरक+0.3-0.30.00+1+4116+40101+$0.006-311ms

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

किंमत इतिहास

OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.

तारीख इनपुट किंमत आउटपुट किंमत
2026-06-04 15:40 $0.200 / 1M $1.150 / 1M

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 8.7 7.9
कोडिंग 8.2 7.2
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 7.3 5.8
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 3.4 9.3
सूचनांचे पालन 9.8 10.0
कोडी सोडवणे 5.5 9.9
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स