核心观点
- GPT-5.6 Sol 针对日常对话全面调优:回答更聚焦、事实更可靠、Instant 与 Thinking 体验统一为同一模型,Plus/Pro 用户新增思考强度滑块。
- 内部评估中,需事实细节的金融、医疗、法律提示里,GPT-5.6 Sol 含至少一个事实错误的回答比 GPT-5.5 Instant 少约 68%,Luna 少约 62%。
- 免费与 Go 用户默认模型升级为 GPT-5.6 Luna,并获无限文本对话和新的「思考」按钮(下周起生效,受滥用护栏约束)。
- 针对未成年用户做了专门训练与系统级保护:避免浪漫角色扮演、设置适龄边界、鼓励连接可信赖的人。
内容精讲
每周有 10 亿人用 ChatGPT 处理从快速问答、网页搜索到规划、研究、建议和复杂决策的各类需求。这轮更新的核心命题是:让同一个模型服务好「从一句话到一场研究」的完整光谱。GPT-5.6 Sol 做到了——更新后它给出更聚焦的回答、根据问题调整详细程度、避免不必要的格式,并在简单附和没有帮助时给出有用的纠正。对 Plus 和 Pro 用户,即时回答与深度推理现在由同一个模型驱动,跨场景体验一致。
**更聚焦的答案意味着「先答真问题」。** 博客用同一提问对比新旧两代:下班后能否从 Mission 骑车到 Ocean Beach 不被淋湿。GPT-5.5 Instant 给出覆盖降雨、风向、温度、沿海薄雾的冗长分析,重点淹没在细节里;GPT-5.6 Sol 直接回答「能,你不会淋湿」,随即点出真正的变量——西向顶风,仅保留骑手需要的细节。用户追问「假设我 5:30 出发」时,它更新建议但不重复整份预报。对快速问题给直接答案,对多步骤规划、研究、写作等复杂任务给完整回答但保持核心建议清晰。
**更可靠的事实来自更好的来源利用。** 错误大多发生在依赖日期、数字、来源、规则或假设的回答上。新版通过更好地使用检索到的来源来作答,而不是凭训练记忆硬凑。内部评估选取需要事实细节的金融、医疗、法律提示:与 GPT-5.5 Instant 相比,GPT-5.6 Luna 含至少一个事实错误的回答减少约 62%,GPT-5.6 Sol 减少约 68%——错误率砍掉约三分之二。
**更一致的体验,滑块控制思考投入。** 这轮把 Instant 和 Thinking 两种体验拉近:从即时回答切到更高推理强度时,感觉是同一个模型多花了时间,而不是换了个风格迥异的模型。Plus/Pro 用户在网页、移动端和桌面端新增一个滑块,控制 ChatGPT 在每个回答上投入多少「思考」——日常问题保持快速,规划、研究、写作、编码或重大决策时推高滑块。
**免费用户的开放是这轮的重头。** 免费和 Go 用户本周起默认模型切换为 GPT-5.6 Luna;下周起获得无限文本对话(受滥用护栏约束),并新增「思考」按钮,为难题调用更深推理。文件上传、图片和其他工具仍有配额。OpenAI 的表述值得留意:这不仅是功能开放,更是「让更多人获得智能」的方向性动作——访问决定机会。
**安全侧同样有细节。** 新版本 Sol 针对日常聊天优化,只在 ChatGPT 聊天体验中提供,驱动 Work 和 Codex 的版本不受影响。安全训练重点覆盖未成年用户:避免浪漫角色扮演、年龄受限挑战,不把模型呈现为现实关系的替代品;对性内容、饮食失调与身体形象风险、年龄受限商品、危险活动和暴力内容设置适龄边界;鼓励青少年在需要支持时联系可信赖的人,并以系统级保护强化,新增未成年用户的表现评估。
阅读价值
对普通用户,这篇直接告诉你新模型在什么场景更值得用、免费额度如何变化;对做对话产品的人,它是「如何用训练目标与产品交互调优 LLM 行为」的鲜活案例——聚焦、事实、一致性三个维度都可借鉴;对关注安全治理的读者,未成年人保护的工程化路径同样值得对照。
内容与图片版权归原作者所有 · 原文: https://openai.com/index/improving-gpt-5-6-sol-in-chatgpt