नेव्हिगेशन
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (high) vs Qwen3.7 Flash

Qwen3.7 Flash average score मध्ये पुढे आहे: 5.9 vs 5.7. Qwen3.7 Flash चा benchmark खर्च कमी आहे: $0.028 vs $0.794. Qwen3.7 Flash वेगवान आहे: 14.70s vs 74.52s, pass rates 42.0% vs 36.2%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-10-05

तुलना केलेली मॉडेल्स

क्रमांक
#263
एकूण आउटपुट टोकन्स
943,044
प्रतिसाद वेळ (सरासरी)
74.52s
एकूण खर्च
$0.794
क्रमांक
#257
एकूण आउटपुट टोकन्स
117,742
प्रतिसाद वेळ (सरासरी)
14.70s
एकूण खर्च
$0.028
शिफारस केलेले मॉडेल Qwen3.7 Flash

It has the best score here (5.9), while costing about 28.7x less than Trinity Large Thinking (high).

तपशीलवार तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking high प्रकाशन: 2026-07-28 Qwen3.7 Flash Qwen3.7 Flash none प्रकाशन: 2026-07-28
स्कोअर 5.7 5.9
क्रमांक #263 #257
विश्वसनीयता 10.0 10.0
सुसंगतता 7.3 9.0
प्रयत्न 69/69 69/69
बरोबर चाचण्या
प्रति प्रयत्न पास दर 42.0% 36.2%
अस्थिर चाचण्या 8 3
एकूण रन 69 69
प्रति निकाल खर्च 11.289 0.395
एकूण खर्च $0.794 $0.028
इनपुट किंमत $0.250 / 1M $0.030 / 1M
आउटपुट किंमत $0.800 / 1M $0.130 / 1M
कॅश वाचण्याची किंमत $0.060 / 1M $0.006 / 1M
कॅश लिहिण्याची किंमत लागू नाही $0.039 / 1M
एकूण इनपुट टोकन्स 283,116 410,787
आउटपुट टोकन्स 277,920 117,742
रिझनिंग टोकन्स 665,124 0
प्रतिसाद वेळ (सरासरी) 74.52s 14.70s
प्रतिसाद वेळ (कमाल) 510.21s 186.24s
प्रतिसाद वेळ (एकूण) 1713.90s 338.13s
पॅरामीटर्स 398B एकूण (13B सक्रिय) ~35B एकूण (~3B सक्रिय)
उपलब्धता वेट्स उपलब्ध बंद स्रोत

कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#263 Trinity Large Thinking

high
खर्च
$0.028
वेळ
130.1s
टोकन्स
34,387 tok

#257 Qwen3.7 Flash

none
खर्च
$0.001
वेळ
34.0s
टोकन्स
4,814 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
Qwen3.7 Flash 5.5 10.0 33.3% 0 1.55s 7,911 855 0

झटपट तुलना

तुलना जोडी बदला