नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (low) vs Qwen3.5-Flash (medium)

Qwen3.5-Flash (medium) average score मध्ये पुढे आहे: 6.1 vs 6.0. Qwen3.5-Flash (medium) चा benchmark खर्च कमी आहे: $0.142 vs $0.658. Qwen3.5-Flash (medium) वेगवान आहे: 84.44s vs 96.61s, pass rates 47.0% vs 65.2%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-14

क्रमांक
#174
एकूण आउटपुट टोकन्स
818,359
प्रतिसाद वेळ (सरासरी)
96.61s
एकूण खर्च
$0.658
क्रमांक
#167
एकूण आउटपुट टोकन्स
512,846
प्रतिसाद वेळ (सरासरी)
84.44s
एकूण खर्च
$0.142
शिफारस केलेले मॉडेल Qwen3.5-Flash (medium)

It has the best score here (6.1), while costing about 4.7x less than Trinity Large Thinking (low).

तपशीलवार तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking low प्रकाशन: 2026-07-28 Qwen3.5-Flash Qwen3.5-Flash medium प्रकाशन: 2026-02-24
स्कोअर 6.0 6.1
क्रमांक #174 #167
विश्वसनीयता 10.0 10.0
सुसंगतता 8.3 7.8
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 47.0% 65.2%
अस्थिर चाचण्या 5 6
एकूण रन 66 66
प्रति निकाल खर्च 8.221 1.491
एकूण खर्च $0.658 $0.142
इनपुट किंमत $0.220 / 1M $0.065 / 1M
आउटपुट किंमत $0.850 / 1M $0.260 / 1M
एकूण इनपुट टोकन्स 122,854 118,508
आउटपुट टोकन्स 119,810 35,457
रिझनिंग टोकन्स 698,549 477,389
प्रतिसाद वेळ (सरासरी) 96.61s 84.44s
प्रतिसाद वेळ (कमाल) 540.96s 515.38s
प्रतिसाद वेळ (एकूण) 2125.51s 1773.20s
पॅरामीटर्स 398B एकूण (13B सक्रिय) ~35B एकूण (~3B सक्रिय)
उपलब्धता वेट्स उपलब्ध बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#174 Trinity Large Thinking

low
खर्च
$0.021
वेळ
173.2s
टोकन्स
24,586 tok

#167 Qwen3.5-Flash

medium
खर्च
$0.002
वेळ
25.8s
टोकन्स
4,294 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
Qwen3.5-Flash 3.7 7.2 22.2% 1 58.87s 6,685 302 90,081

झटपट तुलना

तुलना जोडी बदला