नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY तुलना

ByteDance Seed: Seed-2.0-Lite vs StepFun: Step 3.5 Flash

सारांश

Seed-2.0-Lite vs Step 3.5 Flash benchmark तुलना: Step 3.5 Flash average score में आगे है: 6.6 vs 6.2. Seed-2.0-Lite की benchmark लागत कम है: $0.019 vs $0.070. Seed-2.0-Lite तेज है: 2.49s vs 72.53s, pass rates 46.0% vs 54.0%.

अनुशंसित मॉडल: Seed-2.0-Lite - Its score stays close to the best score here (6.2 vs 6.6), while costing about 3.8x less than Step 3.5 Flash.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-18

मेट्रिक Seed-2.0-Lite Seed-2.0-Lite none रिलीज़: 2026-02-14 Step 3.5 Flash Step 3.5 Flash medium रिलीज़: 2026-02-01
स्कोर 6.2 6.6
रैंक #92 #80
विश्वसनीयता 10.0 10.0
संगति 8.4 8.9
सही परीक्षण
प्रति प्रयास पास दर 46.0% 54.0%
अस्थिर टेस्ट 4 1
कुल रन 63 60
प्रति परिणाम लागत 0.228 0.198
कुल लागत $0.019 $0.070
इनपुट कीमत $0.250 / 1M $0.090 / 1M
आउटपुट कीमत $2.000 / 1M $0.300 / 1M
कुल इनपुट टोकन 46,573 34,431
आउटपुट टोकन 3,259 91,587
रीजनिंग टोकन 0 195,973
प्रतिक्रिया समय (औसत) 2.49s 72.53s
प्रतिक्रिया समय (अधिकतम) 6.70s 453.94s
प्रतिक्रिया समय (कुल) 52.26s 1015.47s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#92 Seed-2.0-Lite

none
लागत
$0.005
समय
83.8s
टोकन
2,311 tok

#80 Step 3.5 Flash

medium
लागत
$0.008
समय
277.1s
टोकन
23,695 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Lite 3.0 5.9 16.7% 2 2.43s 894 709 0
Step 3.5 Flash 10.0 10.0 100.0% 0 40.57s 694 20,391 24,176
कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Lite 5.6 10.0 33.3% 0 2.83s 8,215 410 0
Step 3.5 Flash 2.4 5.2 0.0% 0 258.38s 2,211 13,207 22,429
संयुक्त स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Lite 3.0 10.0 0.0% 0 6.59s 16,215 498 0
Step 3.5 Flash 10.0 10.0 100.0% 0 29.57s 13,638 1,176 12,984
डेटा पार्सिंग और निष्कर्षण स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Lite 10.0 10.0 100.0% 0 1.82s 8,538 246 0
Step 3.5 Flash 10.0 10.0 100.0% 0 15.01s 7,368 600 13,886
डोमेन-विशिष्ट स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Lite 3.6 7.2 22.2% 1 1.33s 939 17 0
Step 3.5 Flash 5.3 7.2 44.4% 1 170.45s 673 45,350 90,436
Samanya Buddhimatta स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Lite 10.0 10.0 100.0% 0 3.45s 570 294 0
Step 3.5 Flash 5.5 10.0 0.0% 0 22.39s 509 240 3,506
निर्देश पालन स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Lite 10.0 10.0 100.0% 0 1.06s 810 73 0
Step 3.5 Flash 8.3 10.0 50.0% 0 4.78s 705 2,364 3,521
पहेली समाधान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Lite 5.3 7.2 44.4% 1 2.78s 858 709 0
Step 3.5 Flash 5.3 10.0 33.3% 0 7.22s 711 5,630 10,861
टूल कॉलिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Lite 10.0 10.0 100.0% 0 3.94s 9,270 292 0
Step 3.5 Flash 10.0 10.0 100.0% 0 11.91s 7,701 275 3,802
सामान्य ज्ञान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Seed-2.0-Lite 3.0 10.0 0.0% 0 1.96s 264 11 0
Step 3.5 Flash 3.0 10.0 0.0% 0 108.45s 221 2,354 10,372

त्वरित तुलना

तुलना जोड़ी बदलें