OpenAI 推出 GPT-5.6:Sol、Terra、Luna 与 Codex 超级应用路线

Latent Space17 天前

OpenAI 发布 GPT-5.6 三个新版本

OpenAI 推出 GPT-5.6 系列,包含三个新尺寸:Sol、Terra 和 Luna。这三个名称分别对应太阳、地球和月球的尺度,用于区分模型能力层级。

此次更新还引入了新的 ultra effort level。OpenAI 将其描述为最高能力设置,面向复杂任务时会协调多个智能体并行工作,以更快完成任务。

其中:

  • max 会给予 GPT-5.6 比 xhigh 更多推理时间,用于探索替代方案、执行检查并修正方法。
  • ultra 进一步默认协调 4 个智能体并行,以更高 token 消耗换取更强结果和更短的复杂任务完成时间。

基准测试与成本表现

文章称,在多个基准测试中,GPT-5.6 相比 Fable 或 Opus 具备更高性能和更低成本。

其中提到:

Terra 的表现略高于 Fable 5,Luna 超过 Opus 4.8;两者大约只需三分之一的时间、约一半输出 token,并且估算成本约为四分之一。

GPT-5.6 还被称为在 Terminal-Bench 2.1DeepSWE 上取得新的最佳结果。这两个测试分别关注复杂命令行工作流,以及真实代码库中的长周期工程任务。

不易量化但值得关注的能力

除可量化基准外,文章还提到 GPT-5.6 在以下方面有改进:

  • 计算机使用能力
  • 演示文稿与文档生成
  • 科学研究相关任务

这些能力较难通过单一 benchmark 完整衡量,但作者认为仍应认真看待。

ChatGPT Work 与 Codex 桌面更新

OpenAI 同时推出 ChatGPT Work,并更新了 Codex 桌面应用

文章认为,这可能是 OpenAI “超级应用”策略接近完成前的关键一步。当前仍未明确的问题,是其智能体浏览器后续会如何整合进这一体系。

从现有信息看,OpenAI 正在把模型能力、工作场景、代码能力和桌面端使用体验进一步合并,推动 ChatGPT 与 Codex 从单点工具向更完整的工作入口演进。

评论

请登录后发表观点

暂无数据