- 順位
- #30
- 合計出力トークン
- 310,388
- 応答時間(平均)
- 31.70s
- 合計コスト
- $0.416
Inkling Small (high) vs Grok 4.5 (low)
平均スコアは 8.4 vs 8.4 でほぼ同等です。 Inkling Small (high) の benchmark コストが低く、$0.416 vs $0.935 です。 Grok 4.5 (low) の方が高速で、15.56s vs 31.70s です、成功率は 69.7% vs 75.8% です。
- 順位
- #28
- 合計出力トークン
- 113,951
- 応答時間(平均)
- 15.56s
- 合計コスト
- $0.935
おすすめモデル
Inkling Small (high)
ここでは最高スコア(8.4)で、Grok 4.5 (low) より約 2.3 倍低コストです。
詳細比較
| 指標 | Inkling Small Inkling Small high | Grok 4.5 Grok 4.5 low |
|---|---|---|
| スコア | 8.4 | 8.4 |
| 順位 | #30 | #28 |
| 信頼性 | 10.0 | 10.0 |
| 一貫性 | 9.2 | 9.7 |
| 正解テスト | ||
| 試行ごとの合格率 | 69.7% | 75.8% |
| 不安定なテスト | 2 | 1 |
| 総実行回数 | 66 | 66 |
| 結果あたりのコスト | 2.967 | 5.844 |
| 合計コスト | $0.416 | $0.935 |
| 入力価格 | $0.500 / 1M | $2.000 / 1M |
| 出力価格 | $1.200 / 1M | $6.000 / 1M |
| 合計入力トークン | 85,660 | 125,596 |
| 出力トークン | 6,092 | 7,505 |
| 推論トークン | 304,296 | 106,446 |
| 応答時間(平均) | 31.70s | 15.56s |
| 応答時間(最大) | 122.60s | 205.28s |
| 応答時間(合計) | 697.30s | 342.32s |
モデル生成ショーケース
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#30 Thinking Machines: Inkling Small
high- コスト
- $0.006
- 時間
- 34.7s
- トークン
- 4,735 tok
#28 xAI: Grok 4.5
low- コスト
- $0.011
- 時間
- 12.4s
- トークン
- 2,018 tok
スコア上位モデル
スコア vs 総コスト
応答時間(平均)
スコア vs 応答時間(平均)
合計出力トークン
スコア vs 合計出力トークン
カテゴリ内訳
| 反AIトリック | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Inkling Small | 10.0 | 10.0 | 100.0% | 0 | 6.30s | 702 | 335 | 9,678 | |
| Grok 4.5 | 10.0 | 10.0 | 100.0% | 0 | 2.75s | 2,991 | 261 | 3,000 |
| コーディング | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Inkling Small | 10.0 | 10.0 | 100.0% | 0 | 93.23s | 7,374 | 463 | 120,474 | |
| Grok 4.5 | 10.0 | 10.0 | 100.0% | 0 | 13.72s | 9,579 | 303 | 15,641 |
| 複合 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Inkling Small | 9.9 | 10.0 | 100.0% | 0 | 40.41s | 61,630 | 4,001 | 28,812 | |
| Grok 4.5 | 6.5 | 10.0 | 50.0% | 0 | 12.75s | 82,028 | 6,031 | 3,583 |
| データ解析と抽出 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Inkling Small | 10.0 | 10.0 | 100.0% | 0 | 3.99s | 7,068 | 216 | 2,763 | |
| Grok 4.5 | 10.0 | 10.0 | 100.0% | 0 | 3.44s | 8,937 | 225 | 2,549 |
| ドメイン特化 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Inkling Small | 5.3 | 10.0 | 33.3% | 0 | 65.58s | 795 | 69 | 96,073 | |
| Grok 4.5 | 3.0 | 10.0 | 0.0% | 0 | 72.64s | 2,514 | 14 | 70,275 |
| 汎用知能 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Inkling Small | 5.3 | 10.0 | 0.0% | 0 | 3.62s | 501 | 153 | 1,395 | |
| Grok 4.5 | 6.1 | 3.1 | 66.7% | 1 | 4.88s | 1,077 | 98 | 1,253 |
| 指示追従 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Inkling Small | 9.8 | 10.0 | 100.0% | 0 | 3.94s | 708 | 94 | 2,742 | |
| Grok 4.5 | 9.8 | 10.0 | 100.0% | 0 | 2.80s | 1,857 | 57 | 1,878 |
| パズル解決 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Inkling Small | 4.8 | 4.4 | 44.5% | 2 | 14.39s | 714 | 482 | 18,286 | |
| Grok 4.5 | 10.0 | 10.0 | 100.0% | 0 | 3.20s | 2,430 | 217 | 2,590 |
| ツール呼び出し | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Inkling Small | 3.0 | 10.0 | 0.0% | 0 | 2.91s | 5,949 | 249 | 577 | |
| Grok 4.5 | 10.0 | 10.0 | 100.0% | 0 | 5.83s | 13,394 | 284 | 871 |
| 雑学 | スコア | 一貫性 | 試行ごとの合格率 | 不安定なテスト | 正解テスト | 応答時間(平均) | 入力トークン | 出力トークン | 推論トークン |
|---|---|---|---|---|---|---|---|---|---|
| Inkling Small | 3.0 | 10.0 | 0.0% | 0 | 49.27s | 219 | 30 | 23,496 | |
| Grok 4.5 | 3.0 | 10.0 | 0.0% | 0 | 13.98s | 789 | 15 | 4,806 |
クイック比較
比較ペアを切り替え
GPT-5.2mediumvsGrok 4.5lowGPT-5.2mediumvsInkling SmallhighInkling SmallhighvsGrok 4.5mediumQwen3.6 Max PreviewmediumvsGrok 4.5lowClaude Sonnet 5mediumvsInkling SmallhighQwen3.6 Max PreviewmediumvsInkling SmallhighClaude Sonnet 5mediumvsGrok 4.5lowMuse Spark 1.1lowvsInkling SmallhighGPT-5.4mediumvsGrok 4.5lowGemini 2.5 FlashmediumvsInkling SmallhighGPT-5.4mediumvsInkling SmallhighGemini 2.5 FlashmediumvsGrok 4.5low