無効なツール呼び出し失敗ランキング

どのAIモデルで無効なツール呼び出しが起きやすいかを確認し、選ぶ前に信頼性のリスクを見極められます。並び替え: 正解テスト ↓.

表示モデル数

総失敗数

100

最も影響を受けたモデル

Gemini 3.5 Flash 1

カテゴリ

複合カテゴリで91 ツール呼び出しカテゴリで9

83/83

順位	モデル	企業	無効なツール呼び出し件数	スコア	合計コスト	正解テスト	応答時間（平均）
#110	Gemma 4 31B medium	Google	1	6.3	$0.163	14/22	75.4s
合計テスト数 22 誤答テスト数 8 合計コスト $0.163 応答時間（平均） 75.4s
#24	Muse Spark 1.1 low	Meta	1	8.3	$0.647	13/22	11.5s
合計テスト数 22 誤答テスト数 9 合計コスト $0.647 応答時間（平均） 11.5s
#45	DeepSeek V4 Flash high	DeepSeek	1	7.7	$0.042	13/22	49.7s
合計テスト数 22 誤答テスト数 9 合計コスト $0.042 応答時間（平均） 49.7s
#51	Nemotron 3 Ultra medium	NVIDIA	1	7.5	$0.774	13/22	32.2s
合計テスト数 22 誤答テスト数 9 合計コスト $0.774 応答時間（平均） 32.2s
#55	GPT-5.6 Terra low	OpenAI	1	7.5	$0.519	13/22	5.31s
合計テスト数 22 誤答テスト数 9 合計コスト $0.519 応答時間（平均） 5.31s
#58	Qwen3.5-27B medium	Qwen	1	7.4	$1.627	13/22	111.9s
合計テスト数 22 誤答テスト数 9 合計コスト $1.627 応答時間（平均） 111.9s
#64	Gemini 3.1 Flash Lite Preview medium	Google	1	7.3	$0.115	13/22	4.61s
合計テスト数 22 誤答テスト数 9 合計コスト $0.115 応答時間（平均） 4.61s
#65	Gemini 3.1 Flash Lite medium	Google	1	7.3	$0.117	13/22	4.27s
合計テスト数 22 誤答テスト数 9 合計コスト $0.117 応答時間（平均） 4.27s
#90	Qwen3.6 35B A3B medium	Qwen	1	6.7	$0.746	13/22	58.1s
合計テスト数 22 誤答テスト数 9 合計コスト $0.746 応答時間（平均） 58.1s
#104	Gemini 3.1 Flash Lite Preview low	Google	1	6.5	$0.646	13/22	16.7s
合計テスト数 22 誤答テスト数 9 合計コスト $0.646 応答時間（平均） 16.7s
#27	Muse Spark 1.1 high	Meta	2	8.1	$1.694	12/22	31.5s
合計テスト数 22 誤答テスト数 10 合計コスト $1.694 応答時間（平均） 31.5s
#56	GPT-5.4 Mini medium	OpenAI	1	7.5	$0.756	12/22	25.9s
合計テスト数 22 誤答テスト数 10 合計コスト $0.756 応答時間（平均） 25.9s
#67	Step 3.7 Flash low	Stepfun	1	7.3	$0.454	12/22	20.7s
合計テスト数 22 誤答テスト数 10 合計コスト $0.454 応答時間（平均） 20.7s
#68	Kimi K2.6 medium	Moonshot AI	1	7.2	$1.036	12/22	110.0s
合計テスト数 22 誤答テスト数 10 合計コスト $1.036 応答時間（平均） 110.0s
#75	Grok 4.20 medium	X AI	1	7.1	$0.777	12/22	29.5s
合計テスト数 22 誤答テスト数 10 合計コスト $0.777 応答時間（平均） 29.5s

←

1 2 3 4 5 6

→

無効なツール呼び出しの失敗

モデルを絞り込む

無効なツール呼び出し件数上位モデル

無効なツール呼び出し件数対スコア

応答時間（平均）上位モデル

無効なツール呼び出し の失敗

モデルを絞り込む

無効なツール呼び出し 件数 上位モデル

無効なツール呼び出し 件数 対 スコア

応答時間（平均） 上位モデル

無効なツール呼び出しの失敗

無効なツール呼び出し件数上位モデル

無効なツール呼び出し件数対スコア

応答時間（平均）上位モデル