AI BENCHY 对比
DeepSeek: DeepSeek V3.2 vs OpenAI: GPT-5.3 Chat
基准结果生成自 AI BENCHY 测试套件,时间:: 2026-06-02
| 指标 | DeepSeek V3.2 DeepSeek V3.2 medium | GPT-5.3 Chat GPT-5.3 Chat none |
|---|---|---|
| 分数 | 6.9 | 7.4 |
| 排名 | #81 | #57 |
| 可靠性 | 10.0 | 10.0 |
| 一致性 | 7.9 | 8.4 |
| 测试正确 | ||
| 尝试通过率 | 63.3% | 68.3% |
| 不稳定测试 | 6 | 4 |
| 总运行次数 | 60 | 60 |
| 每个结果成本 | 0.335 | 3.350 |
| 总成本 | $0.037 | $0.402 |
| 输入价格 | $0.252 / 1M | $1.750 / 1M |
| 输出价格 | $0.378 / 1M | $14.000 / 1M |
| 总输入令牌 | 35,744 | 31,590 |
| 输出令牌 | 7,177 | 24,757 |
| 推理令牌 | 68,297 | 0 |
| 响应时间(平均) | 53.34s | 6.13s |
| 响应时间(最大) | 189.03s | 18.33s |
| 响应时间(总计) | 1066.71s | 122.61s |
分数 vs 总成本
响应时间(平均)
分数 vs 响应时间(平均)
总输出令牌
分数 vs 总输出令牌
类别细分
| 反AI技巧 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2 | 8.7 | 10.0 | 83.3% | 1 | 24.23s | 448 | 3,247 | 6,953 | |
| GPT-5.3 Chat | 6.7 | 8.1 | 58.3% | 1 | 3.86s | 606 | 3,167 | 0 |
| 编程 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2 | 3.9 | 5.8 | 33.3% | 1 | 184.97s | 3,128 | 640 | 21,230 | |
| GPT-5.3 Chat | 6.9 | 6.2 | 66.7% | 1 | 10.52s | 4,683 | 4,772 | 0 |
| 综合 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2 | 10.0 | 10.0 | 100.0% | 0 | 93.11s | 14,283 | 571 | 6,296 | |
| GPT-5.3 Chat | 10.0 | 10.0 | 100.0% | 0 | 11.96s | 11,019 | 2,614 | 0 |
| 数据解析与提取 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2 | 10.0 | 10.0 | 100.0% | 0 | 36.09s | 7,388 | 207 | 7,693 | |
| GPT-5.3 Chat | 10.0 | 10.0 | 100.0% | 0 | 2.21s | 7,140 | 942 | 0 |
| 领域专项 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2 | 2.9 | 4.4 | 22.2% | 2 | 24.27s | 472 | 21 | 6,838 | |
| GPT-5.3 Chat | 3.5 | 4.4 | 33.3% | 2 | 13.01s | 723 | 8,264 | 0 |
| 通用智能 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2 | 3.4 | 2.5 | 33.3% | 1 | 58.29s | 314 | 49 | 2,189 | |
| GPT-5.3 Chat | 4.6 | 10.0 | 0.0% | 0 | 1.99s | 477 | 319 | 0 |
| 指令遵循 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2 | 10.0 | 10.0 | 100.0% | 0 | 35.78s | 627 | 1,397 | 2,845 | |
| GPT-5.3 Chat | 9.8 | 10.0 | 100.0% | 0 | 3.51s | 660 | 1,491 | 0 |
| 谜题求解 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2 | 7.0 | 7.2 | 55.6% | 1 | 37.69s | 594 | 518 | 6,375 | |
| GPT-5.3 Chat | 10.0 | 10.0 | 100.0% | 0 | 2.99s | 642 | 1,758 | 0 |
| 工具调用 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2 | 10.0 | 10.0 | 100.0% | 0 | 34.81s | 8,307 | 507 | 859 | |
| GPT-5.3 Chat | 10.0 | 10.0 | 100.0% | 0 | 8.36s | 5,445 | 861 | 0 |
| 常识问答 | 分数 | 一致性 | 尝试通过率 | 不稳定测试 | 测试正确 | 响应时间(平均) | 输入令牌 | 输出令牌 | 推理令牌 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2 | 3.0 | 10.0 | 0.0% | 0 | 83.99s | 183 | 20 | 7,019 | |
| GPT-5.3 Chat | 3.0 | 10.0 | 0.0% | 0 | 4.38s | 195 | 569 | 0 |
快速对比
切换对比组合
GPT-5.3 ChatnonevsMiMo-V2.5mediumGPT-5.3 ChatnonevsGLM 5.1mediumGemini 3.1 Flash LitelowvsGPT-5.3 ChatnoneGPT-5.3 ChatnonevsStep 3.7 FlashlowKimi K2.6medium免费可用vsGPT-5.3 ChatnoneGPT-5.3 ChatnonevsStep 3.5 FlashmediumGPT-5.3 ChatnonevsGLM 5V TurbomediumMiniMax M3mediumvsGPT-5.3 ChatnoneClaude Sonnet 4.6nonevsDeepSeek V3.2mediumGPT-5.3 ChatnonevsQwen3.5-35B-A3BmediumClaude Sonnet 4.6mediumvsGPT-5.3 ChatnoneRing-2.6-1TmediumvsGPT-5.3 Chatnone