नेविगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (high) vs Qwen3.5-35B-A3B

Trinity Large Thinking (high) average score में आगे है: 5.7 vs 5.6. Qwen3.5-35B-A3B की benchmark लागत कम है: $0.169 vs $0.794. Qwen3.5-35B-A3B तेज है: 18.31s vs 74.52s, pass rates 42.0% vs 37.7%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-02

तुलना किए गए मॉडल

रैंक
#256
कुल आउटपुट टोकन
943,044
प्रतिक्रिया समय (औसत)
74.52s
कुल लागत
$0.794
रैंक
#266
कुल आउटपुट टोकन
135,768
प्रतिक्रिया समय (औसत)
18.31s
कुल लागत
$0.169
अनुशंसित मॉडल Qwen3.5-35B-A3B

Its score stays close to the best score here (5.6 vs 5.7), while costing about 4.7x less than Trinity Large Thinking (high).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking high रिलीज़: 2026-07-28 Qwen3.5-35B-A3B Qwen3.5-35B-A3B none रिलीज़: 2026-02-24
स्कोर 5.7 5.6
रैंक #256 #266
विश्वसनीयता 10.0 10.0
संगति 7.3 8.6
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 42.0% 37.7%
अस्थिर टेस्ट 8 4
कुल रन 69 69
प्रति परिणाम लागत 11.289 3.135
कुल लागत $0.794 $0.169
इनपुट कीमत $0.250 / 1M $0.150 / 1M
आउटपुट कीमत $0.800 / 1M $1.000 / 1M
कैश पढ़ने की कीमत $0.060 / 1M $0.050 / 1M
कैश लिखने की कीमत लागू नहीं लागू नहीं
कुल इनपुट टोकन 283,116 218,886
आउटपुट टोकन 277,920 135,768
रीजनिंग टोकन 665,124 0
प्रतिक्रिया समय (औसत) 74.52s 18.31s
प्रतिक्रिया समय (अधिकतम) 510.21s 209.15s
प्रतिक्रिया समय (कुल) 1713.90s 421.19s
पैरामीटर 398B कुल (13B सक्रिय) 35B कुल (3B सक्रिय)
उपलब्धता वेट उपलब्ध मुक्त स्रोत

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#256 Trinity Large Thinking

high
लागत
$0.028
समय
130.1s
टोकन
34,387 tok

#266 Qwen3.5-35B-A3B

none
लागत
$0.005
समय
28.4s
टोकन
4,518 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
Qwen3.5-35B-A3B 5.5 10.0 33.3% 0 1.39s 7,808 571 0

त्वरित तुलना

तुलना जोड़ी बदलें