OpenAI 发布 GPT-5.6 系列:三档模型重塑 AI 性价比

OpenAI 于 2026 年 7 月底正式推出 GPT-5.6 系列模型,结束了此前 Sol 版本的有限预览。这一次发布最大的变化,是把"前沿智能"和"成本效率"放到了同等重要的位置:整个系列由旗舰模型 Sol、日常均衡模型 Terra 和极具性价比的模型 Luna 组成,并且为每一档都提供了可调的推理强度。对正在搭建网站、SaaS 产品或者 AI 应用的团队来说,这次更新意味着在选择模型 API时,可以在"最强能力"和"单次调用成本"之间做更精细的取舍。

三档模型与定价

GPT-5.6 的三个层级定位清晰:

层级 定位 输入价格(每百万 Token) 输出价格(每百万 Token)
Sol 旗舰,最强能力 $5 $30
Terra 均衡,日常主力 $2.50 $15
Luna 性价比,轻量任务 $1 $6

值得注意的是,发布后 OpenAI 又下调了价格:Luna 降价 80%,Terra 降价 20%。加上新增的可预测提示词缓存(支持显式缓存断点、缓存有效期至少 30 分钟),实际调用成本会比标价更低。缓存写入按非缓存输入费率的 1.25 倍计费,缓存读取则享受 90% 的折扣。对于调用量大、提示词前缀重复度高的场景,这一改动能显著改善成本结构。

编程能力的新纪录

GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 上以 80 分刷新纪录,比上一代竞品高出约 2.8 分,同时输出 Token 减少一半以上、耗时缩短一半、成本降低约三分之一。在 Terminal-Bench 2.1 和 DeepSWE 等考察复杂命令行工作流与长周期工程能力的基准上,它也取得了行业顶尖成绩。

对开发者来说,更有价值的是工程层面的改进:GPT-5.6 可以在工作过程中编写并运行轻量级程序,协调工具、处理中间结果、自主选择下一步。Responses API 的可编程工具调用功能能够过滤大量中间数据,只保留关键信息,在运行时动态调整工作流。这意味着构建 AI 智能体时不再需要为每个步骤写死脚本,模型自身就能完成多步编排。

多智能体与知识型工作

对于值得投入更多算力的难题,GPT-5.6 的 max 选项提供比 xhigh 更长的推理时间,ultra 模式则默认并行协作四个智能体,在 BrowseComp、SEC-Bench Pro 等评估中把"得分-延迟"前沿向左上方推进——更短时间获得更好结果。API 中也提供了多智能体测试功能,开发者可以打造类似 ultra 的体验。

在端到端知识型工作方面,GPT-5.6 能从文档以及 Slack、Notion、Microsoft 365、Google Drive 等日常工作流中提取信息,产出可分享的专家级成果。它的设计能力也有明显提升,可以依据高层指导生成美观、可交互的界面,并通过更强的计算机使用能力检查渲染结果、主动修复视觉与功能问题。

安全与可用性

OpenAI 为 GPT-5.6 构建了迄今最稳健的安全体系,在正式发布前进行了约 70 万 NVIDIA A100 GPU 小时的黑盒自动化红队测试。在生物学与网络安全两个领域,GPT-5.6 的能力均未跨越"严重(Critical)"风险阈值;网络安全方面它更擅长"发现并修复漏洞"而非"自主发起端到端攻击",对防御者反而是利好。

GPT-5.6 已同步上线 ChatGPT、Codex 与 OpenAI API。Plus、Pro、Business、Enterprise 用户可通过不同推理强度使用 Sol,Pro 与 Enterprise 还可选择 Sol Pro;ChatGPT Work 和 Codex 中则可在三档模型间切换。如果你正在规划 AI 功能的模型选型,不妨结合编程辅助工具对比工作流自动化,用真实业务场景跑一轮基准,再决定是选 Sol 的极致能力还是 Luna 的成本优势。

选型建议与接入要点

三个档位怎么选,取决于你的业务在"延迟、成本、质量"上的取舍。以三类典型场景为例:

  • 客服与内容生成(高并发、成本敏感):首选 Luna。这类任务质量要求中等,单次调用价格 Luna 只有 Sol 的五分之一,配合提示词缓存可以把日均十万级调用的成本压到原来的三分之一以内。
  • 知识工作与长文档处理:用 Terra。需要跨文档提取、整理与润色,Terra 在准确性和成本之间最均衡,medium 推理强度通常已经够用。
  • 复杂工程与多智能体编排:上 Sol 或 Sol Pro。编码、自动化、需要长时间推理的任务,多花的推理时间能直接换来更少的人工返工。

接入上,GPT-5.6 兼容现有的 Responses API,迁移时只需更换模型名并调整推理强度参数:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-luna",
    "reasoning": { "effort": "medium" },
    "input": "用三句话总结这段产品文档。"
  }'

有两点要留意。一是提示词缓存对重复前缀收益明显,建议把系统提示、工具定义等稳定内容放在消息开头,避免把每次变化的用户输入塞进前缀;二是先用小流量灰度,把 Luna/Terra 的结果抽样和人工判断对照一周,确认质量达标再全量切换。如果已经在用 GPT-5.4,大部分场景直接换模型名即可,但注意新模型在长上下文下的 token 消耗策略略有变化,建议用真实请求核对一次计费。

原文来源:https://openai.com/index/gpt-5-6/

16IDC 观察

GPT-5.6 系列释放的信号很明确:模型厂商的竞争焦点正从"单项基准第一"转向"每美元智能密度"。三档模型 + 分级推理强度 + 缓存优化,意味着 AI 应用的成本结构会越来越像云计算——按需选择规格、按用量付费。对独立站与中小团队来说,这是好消息:过去只有大厂才用得起的"最强模型",如今有了更灵活的入门路径。