引言
OpenAI正式合并了ChatGPT和Codex,备受期待的GPT-5.6系列现已上线。ChatGPT中原先居中的聊天框被Codex风格的工作区取代,标志着纯聊天时代的终结和新AI时代的开启。
GPT-5.6的三款模型
GPT-5.6系列包含三款模型:
- Sol:新旗舰模型,专为复杂推理、编码、研究和长周期Agent工作设计。
- Terra:均衡模型,高效处理日常工作,性能媲美GPT-5.5但成本更低。
- Luna:最快、最高效的模型,适合高容量任务。
三款模型面向所有ChatGPT订阅方案开放,让每位会员都能使用先进的AI能力。
GPT-5.6 Sol:全能模型
经过五小时高强度使用,GPT-5.6 Sol是当今最全面的模型。它提供低价格、强规划能力、卓越的代码执行、极低的幻觉率和高准确率。虽然前端美学和内容创作仍有提升空间,但在这些方面已超越前代模型。
关键性能亮点
- 编码:GPT-5.6 Sol在Artificial Analysis编码Agent指数上得分80,超越Claude Fable 5的77.2分,领先2.8分。
- 效率:输出token延迟降低过半,成本相比其他领先模型降低三分之一。
- 网络安全:GPT-5.6 Sol在ExploitBench网络安全评估中取得与Claude Fable 5相当的成绩,成本仅为零头。
实战应用:网络安全
对于一家频繁遭受DDoS攻击的AI新闻网站,GPT-5.6 Sol证明了其价值。使用Claude Fable 5处理安全任务时,常因安全关键词被限制。而GPT-5.6 Sol使用Ultra Fast模式,仅用21分钟就识别并修复了多个安全漏洞,token消耗极少。
用户体验改进
GPT-5.6 Sol在前端美学方面也有显著提升。例如,可视化台风巴威数据的结果远超GPT-5.5的水平,虽然仍不及Claude的最佳输出。
ChatGPT与Codex合并
OpenAI将ChatGPT转型为ChatGPT Work,让10亿周活跃ChatGPT用户更容易过渡到Codex的能力。用户现在可以在左上角切换Work和Codex模式,原聊天模式位于侧边栏中。
总结
GPT-5.6代表了AI能力的重大飞跃,为编码、网络安全和日常工作提供了强大且高性价比的解决方案。ChatGPT与Codex的合并以及新模型阵容,标志着Agent AI时代的开启,为用户提供了更强大、更多元的工具来应对复杂任务。
常见问题
ChatGPT-Codex合并对现有ChatGPT用户意味着什么?
ChatGPT现在叫"ChatGPT Work"——熟悉的聊天界面仍在侧边栏中,但默认视图变为Codex风格的工作区。这意味着每个ChatGPT用户现在都能使用Agent能力(文件操作、代码执行、浏览器控制),无需安装单独应用。过渡设计为渐进式:简单问题仍可用纯聊天模式,但需要AI真正做事而不只是谈论时,工作区就在那里。对10亿周活跃用户来说,这是ChatGPT上线以来最大的界面变革。
Sol在编码基准上击败Claude Fable 5有多重要?
非常重要。Claude Fable 5曾是无可争议的编码冠军,Sol的80 vs. 77.2分差距有意义——不是统计平局。更重要的是,Sol在实现这一点的同时将延迟降低50%+、成本降低三分之一。这种组合——更好质量、更快速度、更低成本——在AI基准测试中很少见。网络安全结果同样值得关注:以零头成本匹配Claude的安全分析质量,使Sol成为安全敏感开发工作的务实选择。Claude仍领先的领域是前端美学和创意输出质量。
该从Claude切换到GPT-5.6 Sol吗?
取决于你的主要使用场景。编码和Agent工作流方面,Sol现在是更强选择——更好的基准、更低的成本、更快的输出。前端设计和创意内容方面,Claude仍产出更精致的结果。安全敏感工作方面,Sol能在不触发关键词限制的情况下处理安全任务(与Claude不同)是实际优势。聪明做法:两者都用。Sol处理重型编码、Agent任务和安全工作。Claude处理设计、创意写作和需要最精致最终输出的场景。成本差异意味着你可以用Sol处理80%的任务,Claude处理它擅长的20%。
Luna值得用吗,还是只是一个阉割版模型?
Luna专为高容量低复杂度任务设计。它不是"阉割版"——它是为不同工作负载优化的。对于总结100封客户邮件、格式化数据集或生成常规报告等任务,Luna实际上比Sol或Terra更合适,因为它更快更便宜,同时完全胜任这些任务。配套文章(GPT-5.6家族实测)展示了Luna从2.6万条记录生成47页报告——这是真正的工作,不是玩具。关键是任务匹配:不要用Luna做复杂推理,也不要用Sol做简单数据处理。