🧮

OpenAI o3

OpenAI最新推理模型,数学和编程能力大幅提升

🚀 访问官网

简介

OpenAI最新推理模型,数学和编程能力大幅提升

💰 价格

💎 付费

🧭 工具简介

OpenAI o3 是 OpenAI 于 2024 年 12 月在"OpenAI 12 天"发布活动最后一天公布的推理模型,属于 o 系列。与直接作答的对话模型不同,o 系列通过强化学习训练出"先思考、后回答"的能力,在数学、编程、科学等需要多步推理的任务上明显强于前代。2025 年 1 月 31 日,更轻量的 o3-mini 上线 ChatGPT 与 API;2025 年 4 月 16 日,完整版 o3 与面向最高难度任务的 o3-pro 向 ChatGPT Plus、Pro、Team 用户开放。

值得注意的是,2025 年 8 月 7 日 OpenAI 发布 GPT-5 后,o3、o3-pro、o4-mini 等旧模型开始逐步退役,推理能力被整合进 GPT-5 系列。因此今天的 o3 更准确地说是"已被取代的里程碑式模型",本文基于其服役期间的公开资料进行回顾性评测。

⚙️ 核心功能

深度推理能力:o3 的定位是"解决人类花几个小时才能完成的任务"。在数学竞赛、编程竞赛、科学问答等基准测试中,o3 相比前代 o1 有显著提升,这也是它发布时引发关注的直接原因。对用户来说,复杂问题的分步推导质量是它最核心的价值。

可控思考时间:o3 系列支持"思考预算"(reasoning effort)调节,用户可以在低、中、高三档之间选择,在响应速度与答案质量之间做权衡。简单任务用低档省时,疑难问题用高档换深度。

o3-pro 高端档位:o3-pro 面向对准确性要求最高的场景,官方称其采用更强的计算资源配置,适合处理关键决策类问题。它最初仅向 ChatGPT Pro 用户开放,2025 年 6 月 19 日起通过 Azure OpenAI 向 API 客户提供,定价为每百万输入 tokens 20 美元、每百万输出 tokens 80 美元。

工具与生态集成:在 ChatGPT 中,o3 支持联网搜索、代码执行等工具调用;在 API 侧,开发者可以像调用其他模型一样把 o3 接入自己的应用,用于数据分析、代码审查、Agent 编排等场景。

安全与对齐机制:OpenAI 在发布 o3 时同步公开了系统卡,介绍了面向推理模型的"审慎对齐"(deliberative alignment)训练方法,以及发布前由外部专家进行的红队测试。这类机制让模型在"思考"阶段就遵循安全准则,而不是只在输出时做过滤,是 o 系列在安全工程上的标志性做法,也为后续 GPT-5 的安全设计奠定了基础。

🖥️ 上手体验

在 o3 服役期间,ChatGPT 用户的使用流程是:在模型选择器里切到 o3 或 o3-mini,输入问题,等待一段"思考中"的过程,然后获得带推理摘要的回答。对于数学证明、算法题这类问题,o3 会给出逐步推导而不是直接抛结论,可读性比普通对话模型好很多。API 开发者则在代码中指定模型名并设置 reasoning effort 参数,即可按需调用。

今天再体验 o3 的方式已经不同:GPT-5 系列中保留了推理模式,旧模型逐步下线。因此对新用户的实际建议是:直接使用 ChatGPT 中的 GPT-5 及推理模式,它们继承了 o3 的能力并做了整合优化;如果出于兼容性需要调用旧模型,需确认其在平台上的可用状态与退役时间表。

对开发者而言,把 o3 接入现有应用在 API 层面的成本并不高:模型名、参数结构与 OpenAI 其他模型保持一致,主要新增的是思考预算设置与更长的响应时间预算。迁移到新模型时需要注意的是提示词兼容性——推理模型对指令的解析方式与对话模型不同,同样的提示词在不同代际模型上的表现可能差异明显,上线前建议做一轮回归测试。

💰 价格方案

o3 系列在 ChatGPT 端包含在订阅内,不单独收费;API 端按 tokens 计费。根据微软 Azure OpenAI 官方公布的数据,2025 年 6 月起 o3 的 API 价格为每百万输入 tokens 2 美元、输出 8 美元,o3-pro 为每百万输入 20 美元、输出 80 美元;o3-mini 的定价显著更低。需要说明的是,这些价格是历史公开数据,随着模型退役与 GPT-5 系列的定价体系调整,已不再作为现行价格参考。

模型API 价格(历史公开)备注
o3$2 / $8(每百万 tokens,2025-06 起)已随 GPT-5 发布逐步退役
o3-pro$20 / $80(每百万 tokens)面向最高难度任务
o3-mini低于 o3 的轻量定价速度优先,已整合进新体系

如果把 o3 系列放进当时的定价体系来看:o3-mini 承担日常推理的性价比定位,完整版 o3 面向中高难度任务,o3-pro 则明确服务于对准确率极度敏感的商业与科研场景。三档搭配让团队可以按任务重要程度选择模型,而不是一律用最贵的档位。这种分层定价的思路后来也被 GPT-5 系列的定价体系继承,可以说 o3 不仅贡献了推理能力,也为 OpenAI 的产品分层确立了模板。

👍 优点与局限

优点:推理质量高,复杂数学与编程任务的表现在发布时处于行业顶尖;思考时间可调,兼顾速度与深度;o3-pro 为关键任务提供了更高可靠性的选项;API 生态与工具链成熟,接入方便。

局限:作为独立模型已被 GPT-5 取代,新项目不宜再围绕它构建;推理模型响应慢、成本高,不适合日常闲聊类任务;思维过程只提供摘要而非完整链条,复杂结论仍需人工核验。

🎯 适合人群

数学与科研人员,需要可靠的符号推理与证明辅助;参加算法竞赛的程序员;需要高质量代码审查与复杂调试的开发者;以及构建 Agent 应用、对推理准确性要求高的技术团队。对新用户而言,直接用 GPT-5 系列是更合适的选择。

🔄 同类工具对比

o3 的直接竞品是前代 o1 与开源的 DeepSeek-R1。o1 是它的"前任",已被取代;DeepSeek-R1 以开源和低价著称,在推理能力上对标 o 系列,形成了鲜明的市场分化。

模型价格功能侧重适合场景
OpenAI o3订阅 + API 按量顶尖推理、工具集成高要求推理任务(已被 GPT-5 整合)
OpenAI o1订阅 + API 按量上一代推理模型已退役
DeepSeek-R1开源 + 低价 API推理能力对标、可自部署成本敏感、私有化部署

❓ 常见问题

o3 现在还能用吗? GPT-5 发布后 o3 逐步退役,建议改用 GPT-5 系列,具体可用状态以 OpenAI 官方说明为准。

o3 和 o3-mini 有什么区别? o3-mini 是轻量版,速度快、成本低,适合一般推理任务;完整版 o3 与 o3-pro 面向更高难度任务。

o3-pro 为什么贵? 它按每百万 tokens 20/80 美元计价(历史公开价格),贵在更强的算力配置与更高的准确性要求。

o3 和 GPT-5 是什么关系? GPT-5 整合了 o 系列的推理能力,是 o3 的继任者。

o3 支持图片输入吗? o3 系列以文本推理为主,视觉等多模态能力由 GPT-4o、GPT-5 等模型承担。

o3 的中文能力怎么样? 支持中文输入与输出,中文逻辑题的处理表现良好;关键场景建议先用中文测试集验证再投入使用。

本文基于公开资料整理,价格与功能以官网实时信息为准。

🔄 同类替代推荐

如果你想了解OpenAI o3的同类替代品,以下工具也值得关注: