导航
AI BENCHY
Advertise here

AI BENCHY 对比

Google: Gemini 2.5 Flash vs OpenAI: GPT-5.3 Chat

摘要

Gemini 2.5 Flash vs GPT-5.3 Chat benchmark 对比:Gemini 2.5 Flash 平均分领先,为 8.2 vs 7.5Gemini 2.5 Flash benchmark 成本更低,为 $0.379 vs $0.433GPT-5.3 Chat 更快,为 6.34s vs 15.49s,通过率为 69.8% vs 66.7%

推荐模型: GPT-5.3 Chat - 它的得分接近这里的最高分(7.5 vs 8.2),同时响应速度比Gemini 2.5 Flash快约 2.4 倍。

基准结果生成自 AI BENCHY 测试套件,时间:: 2026-06-12

指标 Gemini 2.5 Flash Gemini 2.5 Flash medium 发布日期: 2025-06-17 GPT-5.3 Chat GPT-5.3 Chat none 发布日期: 2026-03-03
分数 8.2 7.5
排名 #27 #47
可靠性 10.0 10.0
一致性 9.6 8.1
测试正确
尝试通过率 69.8% 66.7%
不稳定测试 1 5
总运行次数 63 63
每个结果成本 2.701 3.605
总成本 $0.379 $0.433
输入价格 $0.300 / 1M $1.750 / 1M
输出价格 $2.500 / 1M $14.000 / 1M
总输入令牌 34,476 34,209
输出令牌 1,930 26,617
推理令牌 145,145 0
响应时间(平均) 15.49s 6.34s
响应时间(最大) 95.48s 18.33s
响应时间(总计) 325.39s 133.13s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#27 Gemini 2.5 Flash

medium
Invalid SVG
Cost
$0.000
Time
274.0s
Tokens
0 tok

#47 GPT-5.3 Chat

none
Cost
$0.008
Time
8.1s
Tokens
634 tok

按分数排名的模型

分数 vs 总成本

响应时间(平均)

分数 vs 响应时间(平均)

总输出令牌

分数 vs 总输出令牌

类别细分

反AI技巧 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 2.5 Flash 8.4 10.0 75.0% 0 6.30s 492 255 10,233
GPT-5.3 Chat 6.7 8.1 58.3% 1 3.86s 606 3,167 0
编程 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 2.5 Flash 7.8 10.0 66.7% 0 41.01s 6,669 543 32,303
GPT-5.3 Chat 5.6 4.7 55.6% 2 10.52s 7,302 6,632 0
综合 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 2.5 Flash 10.0 10.0 100.0% 0 28.44s 12,522 303 11,922
GPT-5.3 Chat 10.0 10.0 100.0% 0 11.96s 11,019 2,614 0
数据解析与提取 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 2.5 Flash 10.0 10.0 100.0% 0 4.06s 7,257 279 2,325
GPT-5.3 Chat 10.0 10.0 100.0% 0 2.21s 7,140 942 0
领域专项 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 2.5 Flash 5.9 7.2 55.6% 1 37.34s 633 18 80,702
GPT-5.3 Chat 3.5 4.4 33.3% 2 13.01s 723 8,264 0
通用智能 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 2.5 Flash 4.8 10.0 0.0% 0 4.86s 486 92 1,899
GPT-5.3 Chat 4.6 10.0 0.0% 0 1.99s 477 319 0
指令遵循 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 2.5 Flash 9.8 10.0 100.0% 0 2.62s 615 69 1,203
GPT-5.3 Chat 9.8 10.0 100.0% 0 3.51s 660 1,491 0
谜题求解 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 2.5 Flash 7.7 10.0 66.7% 0 3.18s 558 126 2,499
GPT-5.3 Chat 10.0 10.0 100.0% 0 2.99s 642 1,758 0
工具调用 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 2.5 Flash 10.0 10.0 100.0% 0 6.20s 5,088 234 1,140
GPT-5.3 Chat 10.0 10.0 100.0% 0 8.36s 5,445 861 0
常识问答 分数 一致性 尝试通过率 不稳定测试 测试正确 响应时间(平均) 输入令牌 输出令牌 推理令牌
Gemini 2.5 Flash 3.0 10.0 0.0% 0 2.76s 156 11 919
GPT-5.3 Chat 3.0 10.0 0.0% 0 4.38s 195 569 0

快速对比

切换对比组合