OpenAI 发布了针对其旗舰模型 GPT-5.6 Sol 及整个 GPT-5.6 系列的最新提示词编写指南。文件的核心要义是——少写文字,多含深意。开发团队强烈建议用户以最简洁的方式表述请求,摒弃此前版本中常见的长篇分步指令。
在编程代理任务的内部测试中,这种新方法取得了令人瞩目的成果。简洁的提示词使质量评分提升了 10-15%,令牌消耗减少了 41-66%,任务执行成本降低了 33-67%。这直接推翻了此前认为请求越详细、效果越好的旧有范式。
这一新方法与 2025 年 8 月发布的 GPT-5 文档截然不同。当时重点强调 XML 块、上下文收集模板以及详细的工具调用场景。而现在,OpenAI 呼吁删除重复内容、不影响模型行为的风格指示、低效示例以及神经网络已能稳定处理的步骤。提示词中应仅保留关键要素:可见结果、成功标准、停止条件以及安全要求等硬性约束。
重要提醒:GPT-5.6 Sol 会严格遵循请求条件。相互矛盾的规则比细节不足更容易让模型混乱。建议仅在不变条件下使用"总是"和"从不"这类词汇,其他情况则应制定条件性规则。
指南还新增了两个部分。text.verbosity 参数用于设定回答的基本详细程度(低、中、高),解决了因旧指令"简短回答"导致回复过度精简的问题——因为 GPT-5.6 默认回答就比 GPT-5.5 更简短。第二部分是 Programmatic Tool Calling(程序化工具调用),适用于边界清晰的任务,代码可自行过滤和分组结果,向模型返回压缩后的总结而非原始数据。
褒贬不一的反馈与首批事故
GPT-5.6 系列——包括 Sol、Terra 和 Luna 模型——于 6 月底以限量预览形式推出,7 月 9 日全面发布。然而用户反馈褒贬不一。知名 AI 投资者 Matt Schumer 报告称,基于 GPT-5.6 Sol 的代理意外删除了他 Mac 上的几乎所有文件。原因是系统变量 $HOME 处理错误,导致主目录被递归清空。
值得注意的是,GPT-5.6 的系统说明卡在公开发布前就已描述了类似场景。Codex 负责人 Thibault Sottiaux 确认了启动问题并承诺改进。BridgeMind 项目创始人 Matthew Miller 也遇到了类似情况,其 GPT-5.6 Sol 代码取消了 Stripe 中的所有订阅。不过 Miller 本人承认,他给了代理完全写入权限而非受限的 API 密钥。
也有正面案例。OpenAI 员工 Ethan Knight 声称,GPT-5.6 Sol Ultra 证明了 Cycle Double Cover 猜想——一个半个世纪未解的图论问题。配备 64 个子代理的模型用时不到一小时。此外,在 HealthBench Professional 测试中,GPT-5.6 Sol 获得 60.5 分,高于 GPT-5.5 的 59 分,远超医生平均分 43.7 分。
我的分析:从"更多上下文"到"更少噪音"的范式转变,对于已学会理解用户意图的模型来说是合乎逻辑的一步。然而文件删除事件凸显出代理系统的安全性仍有待提升。用户应极其谨慎地对待授予此类代理的访问权限。