比較するチャート方法論

言語:

❤️ Made by XCS

AI BENCHY Compare

Trinity Large Preview vs Inception: Mercury 2

比較する:

ベンチマークは AI BENCHY テストスイートから次の日時に生成: 2026-03-06

指標	Trinity Large Preview none リリース: 2026-01-27 無料で利用可能	Inception: Mercury 2 medium リリース: 2026-02-24
順位	#45	#36
平均スコア	4.2	5.3
一貫性	9.6	8.4
結果あたりのコスト	0.000	0.631
合計コスト	$0.000	$0.045
正解テスト
試行ごとの合格率	33.3%	54.2%
不安定なテスト	1	3
総実行回数	48	48
出力トークン	1,837	3,708
推論トークン	0	45,921
応答時間（平均）	3.15s	2.36s
応答時間（最大）	8.91s	14.63s
応答時間（合計）	50.46s	35.39s

スコア上位モデル

スコア vs 総コスト

応答時間（平均）

平均スコア vs 応答時間（平均）

カテゴリ内訳

反AIトリック	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Trinity Large Preview	10.0	10.0	0.0%	0		3.59s	587	0
Inception: Mercury 2	7.3	9.8	66.7%	0		1.30s	2,531	2,410

複合	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Trinity Large Preview	10.0	10.0	0.0%	0		8.91s	294	0
Inception: Mercury 2	10.0	10.0	100.0%	0		3.28s	268	4,887

データ解析と抽出	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Trinity Large Preview	9.9	10.0	100.0%	0		3.26s	186	0
Inception: Mercury 2	5.5	5.9	83.3%	1		1.11s	183	1,656

ドメイン特化	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Trinity Large Preview	4.0	10.0	33.3%	0		877ms	25	0
Inception: Mercury 2	10.0	7.2	11.1%	1		6.48s	41	30,754

汎用知能	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Trinity Large Preview	3.0	9.9	0.0%	0		2.86s	124	0
Inception: Mercury 2	4.0	10.0	0.0%	0		821ms	137	542

指示追従	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Trinity Large Preview	3.5	6.7	16.7%	1		1.09s	63	0
Inception: Mercury 2	10.0	10.0	100.0%	0		1.07s	14	958

Puzzle Solving	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Trinity Large Preview	4.0	10.0	33.3%	0		3.30s	291	0
Inception: Mercury 2	1.7	7.5	22.2%	1		934ms	354	2,758

ツール呼び出し	スコア	一貫性	試行ごとの合格率	不安定なテスト	正解テスト	応答時間（平均）	出力トークン	推論トークン
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	267	0
Inception: Mercury 2	10.0	10.0	100.0%	0		1.89s	180	1,956

クイック比較

比較ペアを切り替え

Mercury 2mediumvsQwen3.5-Flashnone Gemini 2.5 FlashnonevsMercury 2medium DeepSeek V3.2nonevsMercury 2medium Mercury 2mediumvsQwen3.5-122B-A10Bnone Mercury 2mediumvsQwen3.5-27Bnone Trinity Large Previewnone無料で利用可能vsMiniMax M2.5medium Mercury 2mediumvsQwen3.5-35B-A3Bnone Mercury 2mediumvsGLM 5none Trinity Large Previewnone無料で利用可能vsQwen3 Coder Nextmedium Mercury 2mediumvsGPT-5.4none Trinity Large Previewnone無料で利用可能vsgpt-oss-120bmedium無料で利用可能 Mercury 2mediumvsQwen3.5 Plus 2026-02-15none