नेविगेशन
AI BENCHY
Advertise here

Trinity Large Thinking (medium) vs Seed-2.0-Lite

Seed-2.0-Lite average score में आगे है: 6.2 vs 6.1. Seed-2.0-Lite की benchmark लागत कम है: $0.066 vs $0.798. Seed-2.0-Lite तेज है: 4.37s vs 85.44s, pass rates 48.5% vs 40.9%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-08-15

रैंक
#174
कुल आउटपुट टोकन
1,016,785
प्रतिक्रिया समय (औसत)
85.44s
कुल लागत
$0.798
रैंक
#163
कुल आउटपुट टोकन
14,744
प्रतिक्रिया समय (औसत)
4.37s
कुल लागत
$0.066
अनुशंसित मॉडल Seed-2.0-Lite

It has the best score here (6.2), while costing about 12.3x less than Trinity Large Thinking (medium).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking medium रिलीज़: 2026-07-28 Seed-2.0-Lite Seed-2.0-Lite none रिलीज़: 2026-02-14
स्कोर 6.1 6.2
रैंक #174 #163
विश्वसनीयता 10.0 10.0
संगति 7.9 8.9
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 48.5% 40.9%
अस्थिर टेस्ट 6 3
कुल रन 66 66
प्रति परिणाम लागत 9.972 0.813
कुल लागत $0.798 $0.066
इनपुट कीमत $0.220 / 1M $0.250 / 1M
आउटपुट कीमत $0.850 / 1M $2.000 / 1M
कुल इनपुट टोकन 118,486 142,206
आउटपुट टोकन 156,166 14,744
रीजनिंग टोकन 860,619 0
प्रतिक्रिया समय (औसत) 85.44s 4.37s
प्रतिक्रिया समय (अधिकतम) 525.14s 44.58s
प्रतिक्रिया समय (कुल) 1879.75s 96.20s
पैरामीटर 398B कुल (13B सक्रिय) ~200B कुल (~20B सक्रिय)
उपलब्धता वेट उपलब्ध बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#174 Trinity Large Thinking

medium
लागत
$0.016
समय
75.9s
टोकन
19,401 tok

#163 Seed-2.0-Lite

none
लागत
$0.005
समय
83.8s
टोकन
2,311 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
Seed-2.0-Lite 5.6 10.0 33.3% 0 2.83s 8,215 410 0

त्वरित तुलना

तुलना जोड़ी बदलें