नेव्हिगेशन
AI BENCHY
Advertise here

Trinity Large Thinking (high) vs KAT-Coder-Air V2.5

average score जवळपास समान आहे: 4.8 vs 4.8. KAT-Coder-Air V2.5 चा benchmark खर्च कमी आहे: $0.067 vs $0.632. KAT-Coder-Air V2.5 वेगवान आहे: 12.17s vs 77.22s, pass rates 39.4% vs 37.9%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-28

क्रमांक
#202
एकूण आउटपुट टोकन्स
953,758
प्रतिसाद वेळ (सरासरी)
77.22s
एकूण खर्च
$0.632
क्रमांक
#204
एकूण आउटपुट टोकन्स
93,913
प्रतिसाद वेळ (सरासरी)
12.17s
एकूण खर्च
$0.067
शिफारस केलेले मॉडेल KAT-Coder-Air V2.5

It has the best score here (4.8), while costing about 9.5x less than Trinity Large Thinking (high).

तपशीलवार तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking high प्रकाशन: 2026-07-28 KAT-Coder-Air V2.5 KAT-Coder-Air V2.5 none प्रकाशन: 2026-07-14
स्कोअर 4.8 4.8
क्रमांक #202 #204
विश्वसनीयता 9.9 10.0
सुसंगतता 7.2 6.9
बरोबर चाचण्या
प्रति प्रयत्न पास दर 39.4% 37.9%
अस्थिर चाचण्या 8 8
एकूण रन 66 66
प्रति निकाल खर्च 12.640 1.336
एकूण खर्च $0.632 $0.067
इनपुट किंमत $0.220 / 1M $0.150 / 1M
आउटपुट किंमत $0.850 / 1M $0.600 / 1M
एकूण इनपुट टोकन्स 101,767 69,367
आउटपुट टोकन्स 286,218 93,913
रिझनिंग टोकन्स 667,540 0
प्रतिसाद वेळ (सरासरी) 77.22s 12.17s
प्रतिसाद वेळ (कमाल) 510.21s 121.05s
प्रतिसाद वेळ (एकूण) 1698.89s 267.83s

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#202 Trinity Large Thinking

high
खर्च
$0.028
वेळ
130.1s
टोकन्स
34,387 tok

#204 KAT-Coder-Air V2.5

none
खर्च
$0.002
वेळ
14.5s
टोकन्स
2,619 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Trinity Large Thinking 3.7 4.7 33.3% 2 245.04s 7,204 83,616 266,836
KAT-Coder-Air V2.5 3.3 9.6 0.0% 0 14.31s 6,472 16,918 0

झटपट तुलना

तुलना जोडी बदला