导航
AI BENCHY
Advertise here

AI BENCHY 对比

Google: Gemini 3 Flash Preview vs MoonshotAI: Kimi K2.5

摘要

Gemini 3 Flash Preview vs Kimi K2.5 benchmark 对比:Gemini 3 Flash Preview 平均分领先,为 9.6 vs 7.5Kimi K2.5 benchmark 成本更低,为 $0.348 vs $0.667Gemini 3 Flash Preview 更快,为 18.64s vs 98.43s,通过率为 98.4% vs 68.3%

推荐模型: Gemini 3 Flash Preview - 它在这里得分最高(9.6),同时响应速度比Kimi K2.5快约 5.3 倍。

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-07-02

指标 Gemini 3 Flash Preview Gemini 3 Flash Preview medium 发布日期: 2025-12-17 Kimi K2.5 Kimi K2.5 medium 发布日期: 2026-01-27
分数 9.6 7.5
排名 #2 #45
可靠性 10.0 10.0
一致性 9.7 6.9
测试正确
尝试通过率 98.4% 68.3%
不稳定测试 1 8
总运行次数 63 63
每个结果成本 3.335 3.704
总成本 $0.667 $0.348
输入价格 $0.500 / 1M $0.375 / 1M
输出价格 $3.000 / 1M $2.025 / 1M
总输入令牌 37,017 34,312
输出令牌 2,006 48,379
推理令牌 214,153 157,747
响应时间(平均) 18.64s 98.43s
响应时间(最大) 117.26s 281.00s
响应时间(总计) 391.35s 1378.03s

生成展示

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#2 Gemini 3 Flash Preview

medium
成本
$0.010
时间
17.9s
令牌
3,236 tok

#45 MoonshotAI: Kimi K2.5

medium
成本
$0.030
时间
58.6s
令牌
8,683 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

反AI技巧 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 3.88s 494 330 3,216
Kimi K2.5 7.3 5.8 83.3% 2 51.38s 634 2,789 8,880
编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 8.6 7.6 88.9% 1 84.40s 8,122 462 161,084
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
综合 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 22.42s 12,873 351 10,485
Kimi K2.5 10.0 10.0 100.0% 0 71.37s 11,280 703 3,713
数据解析与提取 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.43s 7,548 279 4,893
Kimi K2.5 10.0 10.0 100.0% 0 49.78s 7,020 563 7,940
领域专项 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 15.27s 633 12 21,684
Kimi K2.5 3.5 4.4 33.3% 2 137.29s 485 20,753 30,564
通用智能 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.19s 486 72 1,905
Kimi K2.5 6.5 3.4 66.7% 1 69.73s 480 3,815 4,262
指令遵循 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.04s 615 72 2,709
Kimi K2.5 10.0 10.0 100.0% 0 92.47s 675 5,371 6,547
谜题求解 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 4.05s 558 183 4,365
Kimi K2.5 5.3 7.3 44.4% 1 43.23s 659 8,426 12,692
工具调用 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 12.60s 5,532 234 1,487
Kimi K2.5 10.0 10.0 100.0% 0 31.74s 5,933 242 812
常识问答 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 3 Flash Preview 10.0 10.0 100.0% 0 5.50s 156 11 2,325
Kimi K2.5 3.0 10.0 0.0% 0 83.95s 211 12 7,644

快速对比

切换对比组合