AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#203

Trinity Large Thinking

Arcee AI रिलीज़: 2026-07-28 परीक्षण किया गया: 2026-08-14 04:05 arcee-ai/trinity-large-thinking::medium
398B कुल (13B सक्रिय)MoEवेट उपलब्ध
(high) (medium) (low)

सारांश

Trinity Large Thinking AI BENCHY पर 6.1 स्कोर करता है और #203 पर है। इसकी reliability 10.0, pass rate 48.5%, कुल लागत $0.756, और औसत response time 85.44s है।

Trinity Large Thinking को अलग क्या बनाता है: यह कोडिंग में सबसे अलग दिखता है, जहाँ इसकी रैंक #1 है; जबकि संयुक्त इसकी सबसे कमजोर जगह है, जहाँ यह #16 पर है। यह असामान्य रूप से अधिक reasoning tokens इस्तेमाल करता है, जिससे धीमे या महंगे runs समझ में आ सकते हैं।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
398B कुल (13B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
वेट उपलब्ध
लाइसेंस
OpenMDW

संगति

7.9

कुल लागत (वर्तमान कीमत)

$0.756 ↓ -5.2%

परीक्षण के समय: $0.798

कुल आउटपुट टोकन

1,016,785

कुल इनपुट टोकन

118,486

इनपुट कीमत

$0.250 / 1M

आउटपुट कीमत

$0.800 / 1M

सही परीक्षण

गलत टेस्ट: 14

प्रति प्रयास पास दर: 48.5%

अस्थिर टेस्ट

6

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

85.44s

प्रतिक्रिया समय (अधिकतम): 525.14s

प्रतिक्रिया समय (कुल): 1879.75s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#203 Trinity Large Thinking

medium
लागत
$0.016
समय
75.9s
टोकन
19,401 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 04:05 दोबारा परीक्षण 6.1 10.0 $0.756 वर्तमान रन
2026-07-28 10:51 पहला रन 6.0 10.0 $0.792 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

कीमत का इतिहास

OpenRouter से इस मॉडल का ऐतिहासिक मूल्य डेटा।

तारीख इनपुट कीमत आउटपुट कीमत
2026-08-14 12:51 $0.220 / 1M $0.850 / 1M
2026-09-02 00:25 $0.250 / 1M $0.800 / 1M

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 6.8 9.8
कोडिंग 7.5 10.0
संयुक्त 2.9 6.0
डेटा पार्सिंग और निष्कर्षण 6.3 5.8
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 10.0 10.0
निर्देश पालन 4.4 6.9
पहेली समाधान 5.2 5.4
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल