नेविगेशन
AI BENCHY
Advertise here

Trinity Large Thinking (high) vs Qwen3.5-9B (medium)

Trinity Large Thinking (high) average score में आगे है: 4.8 vs 3.8. Qwen3.5-9B (medium) की benchmark लागत कम है: $0.036 vs $0.632. Trinity Large Thinking (high) तेज है: 77.22s vs 82.24s, pass rates 39.4% vs 25.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-28

रैंक
#202
कुल आउटपुट टोकन
953,758
प्रतिक्रिया समय (औसत)
77.22s
कुल लागत
$0.632
रैंक
#227
कुल आउटपुट टोकन
238,561
प्रतिक्रिया समय (औसत)
82.24s
कुल लागत
$0.036
अनुशंसित मॉडल Trinity Large Thinking (high)

It has the strongest score in this comparison (4.8) and the best overall balance of cost and response time across all 2 models.

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking high रिलीज़: 2026-07-28 Qwen3.5-9B Qwen3.5-9B medium रिलीज़: 2026-03-02
स्कोर 4.8 3.8
रैंक #202 #227
विश्वसनीयता 9.9 5.0
संगति 7.2 8.1
सही परीक्षण
प्रति प्रयास पास दर 39.4% 25.8%
अस्थिर टेस्ट 8 5
कुल रन 66 66
प्रति परिणाम लागत 12.640 1.187
कुल लागत $0.632 $0.036
इनपुट कीमत $0.220 / 1M $0.100 / 1M
आउटपुट कीमत $0.850 / 1M $0.150 / 1M
कुल इनपुट टोकन 101,767 17,070
आउटपुट टोकन 286,218 29,045
रीजनिंग टोकन 667,540 209,516
प्रतिक्रिया समय (औसत) 77.22s 82.24s
प्रतिक्रिया समय (अधिकतम) 510.21s 226.38s
प्रतिक्रिया समय (कुल) 1698.89s 1315.88s

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#202 Trinity Large Thinking

high
लागत
$0.028
समय
130.1s
टोकन
34,387 tok

#227 Qwen3.5-9B

medium
लागत
$0.001
समय
35.9s
टोकन
3,030 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
Qwen3.5-9B 2.9 10.0 0.0% 0 100.88s 2,396 7,890 41,129

त्वरित तुलना

तुलना जोड़ी बदलें