नेविगेशन
AI BENCHY
Advertise here

Trinity Large Thinking (low) vs Step 3.5 Flash (medium)

average score लगभग बराबर है: 6.0 vs 6.0. Step 3.5 Flash (medium) की benchmark लागत कम है: $0.108 vs $0.656. Trinity Large Thinking (low) तेज है: 96.78s vs 174.22s, pass rates 48.5% vs 51.5%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-28

रैंक
#145
कुल आउटपुट टोकन
815,220
प्रतिक्रिया समय (औसत)
96.78s
कुल लागत
$0.656
रैंक
#146
कुल आउटपुट टोकन
402,554
प्रतिक्रिया समय (औसत)
174.22s
कुल लागत
$0.108
अनुशंसित मॉडल Step 3.5 Flash (medium)

It has the best score here (6.0), while costing about 6.1x less than Trinity Large Thinking (low).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking low रिलीज़: 2026-07-28 Step 3.5 Flash Step 3.5 Flash medium रिलीज़: 2026-02-01
स्कोर 6.0 6.0
रैंक #145 #146
विश्वसनीयता 9.7 9.2
संगति 7.9 9.0
सही परीक्षण
प्रति प्रयास पास दर 48.5% 51.5%
अस्थिर टेस्ट 6 1
कुल रन 66 63
प्रति परिणाम लागत 8.199 0.540
कुल लागत $0.656 $0.108
इनपुट कीमत $0.220 / 1M $0.100 / 1M
आउटपुट कीमत $0.850 / 1M $0.300 / 1M
कुल इनपुट टोकन 122,845 65,707
आउटपुट टोकन 117,704 108,561
रीजनिंग टोकन 697,516 293,993
प्रतिक्रिया समय (औसत) 96.78s 174.22s
प्रतिक्रिया समय (अधिकतम) 540.96s 1597.85s
प्रतिक्रिया समय (कुल) 2129.13s 2613.32s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#145 Trinity Large Thinking

low
लागत
$0.021
समय
173.2s
टोकन
24,586 tok

#146 Step 3.5 Flash

medium
लागत
$0.008
समय
277.1s
टोकन
23,695 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
Step 3.5 Flash 2.4 5.2 0.0% 0 258.38s 2,211 13,207 22,429

त्वरित तुलना

तुलना जोड़ी बदलें