OpenAI 为其旗舰模型 GPT-5.6 Sol 及整个 GPT-5.6 系列发布了更新后的提示词指南。作为一名分析师,我立刻得出的关键结论是:该公司正从复杂、多层次的指令转向简洁与精准。这不仅仅是建议——这是与 AI 交互方式的根本性转变。

在代理编程任务上的内部测试展示了令人印象深刻的结果:简洁的提示词使质量评分提升了 10-15%,将 Token 消耗减少了 41-66%,并将任务执行成本降低了 33-67%。对于一个每个 Token 都意味着成本的行业来说,这堪称提示词经济领域的一场革命。

从 XML 模板到极简主义

此前,在 2025 年 8 月推出 GPT-5 时,OpenAI 强调使用 XML 块、用于收集上下文的模板以及分步场景。而现在,对于 GPT-5.6 Sol,建议移除重复内容、不影响行为的风格指示、低效示例以及模型已能稳定处理的步骤。取而代之的是,只保留可见结果、成功标准、停止条件以及硬性限制——例如安全要求。

需要特别强调的是:GPT-5.6 严格遵守请求条件,因此相互矛盾的规则比缺乏细节更容易让模型产生混乱。现在建议仅对不变项使用“总是”和“从不”这类词语;对于其他情况,最好制定条件规则。

新工具:verbosity 和 Programmatic Tool Calling

指南中新增了两个重要部分。text.verbosity 参数用于设置回复的基本详细程度:低、中或高。这一点至关重要,因为 GPT-5.6 默认回复比 GPT-5.5 更简短,而旧的“简短回答”指令有时会过度截断回复。第二个工具是 Programmatic Tool Calling——针对边界清晰的任务进行程序化工具调用。代码自行过滤和分组结果,向模型返回压缩后的摘要,而非原始数据。

褒贬不一的反馈:成功与事故

GPT-5.6 系列——包括 Sol、Terra 和 Luna 模型——于 6 月底以限量预览形式推出,并于 7 月 9 日全面发布。用户反馈褒贬不一。AI 投资者 Matt Schumer 报告称,由于处理系统变量 $HOME 时出错,搭载 GPT-5.6 Sol 的代理删除了他 Mac 上的几乎所有文件。OpenAI 在发布前的系统说明中描述过类似场景:模型未经许可删除了错误的虚拟机。BridgeMind 创始人 Matthew Miller 遭遇了 GPT-5.6 Sol 生成的代码取消了他 Stripe 中的所有订阅——不过,是他自己向代理授予了完全写入权限,而非使用受限的 API 密钥。

然而,也有正面的例子。OpenAI 员工 Ethan Knight 声称,GPT-5.6 Sol Ultra 证明了 Cycle Double Cover 猜想——一个半个世纪以来未能解决的图论问题。配备 64 个子代理的模型用了不到一小时。OpenAI 医疗健康负责人 Karan Singal 展示了 HealthBench Professional 测试结果:GPT-5.6 Sol 得分为 60.5,而 GPT-5.5 为 59,医生回答的评分则为 43.7。

我的专家意见: 转向简短提示词不仅仅是一种趋势,更是扩展代理系统的必要条件。文件删除和订阅取消等事故表明,模型过于字面地遵循指令,安全责任在于用户。然而,在解决半个世纪的数学难题上取得的突破证明:在正确配置下,GPT-5.6 Sol 能够做到人类无法企及的事情。市场期待在能力与控制之间取得平衡,而 OpenAI 似乎正通过提示词的极简主义来寻求这种平衡。