OpenAI 发布了旗舰模型 GPT-5.6 Sol 及整个 GPT-5.6 系列的最新提示词指南。该文档的核心要义是:摒弃冗长、多步骤的提示方案,转而采用最简洁的查询方式。这与针对上一版本 GPT-5 的指导原则相比,是一次根本性的方法转变。
在编程代理任务的内部测试中,结果令人瞩目:简洁的提示词使质量评分提升了 10-15%,令牌消耗减少了 41-66%,任务执行成本降低了 33-67%。效率提升显而易见,这并非空谈,而是基于实际数据。
此前,在 2025 年 8 月发布 GPT-5 时,OpenAI 强调的是 XML 块、上下文收集模板以及详细的工具调用场景。而现在,对于 GPT-5.6 Sol,建议移除重复内容、风格指示、低效示例以及模型已能稳定处理的步骤。提示词中应保留的内容包括:可见的结果、成功标准、停止条件以及严格限制,例如安全要求。
特别提醒:GPT-5.6 会严格遵循查询条件。相互矛盾的规则比信息不足更容易让模型产生混淆。建议仅在描述不变条件时使用“总是”和“从不”这类词语,其他情况则应制定条件性规则。
指南中新增了两个部分。第一部分是 text.verbosity 参数,用于设定回复的基本详细程度:低、中或高。这一点很重要,因为 GPT-5.6 默认回复比 GPT-5.5 更简短,旧的“简短回答”指令可能会过度截断回复。第二部分是 Programmatic Tool Calling(程序化工具调用),适用于边界清晰的任务。代码自行过滤和分组结果,向模型返回压缩后的摘要,而非原始数据。
褒贬不一的反馈与事件
用户对 GPT-5.6 Sol 的评价褒贬不一。AI 投资者 Matt Schumer 报告称,基于该模型的代理因处理系统变量 $HOME 时出错,意外删除了他 Mac 上的几乎所有文件。OpenAI 确认,此类场景在模型公开发布前的系统卡中已有描述,并承诺进行改进。开发人员帮助 Schumer 恢复了数据。
BridgeMind 项目创始人 Matthew Miller 也遇到了类似问题:GPT-5.6 Sol 生成的代码取消了他在 Stripe 上的所有订阅。不过,Miller 本人承认,他向代理授予了完全写入权限,而非使用受限的 API 密钥。这是一个典型的安全错误,并非模型本身的问题。
另一方面,也有令人瞩目的成功案例。OpenAI 员工 Ethan Knight 声称,GPT-5.6 Sol Ultra 证明了 Cycle Double Cover 猜想——一个困扰了学界半个世纪的图论问题。配备 64 个子代理的模型用时不到一小时。独立验证尚未公布,但这一事实本身就令人惊叹。
此外,在 HealthBench Professional 测试中,GPT-5.6 Sol 获得了 60.5 分,而 GPT-5.5 为 59 分,在回答的准确性和完整性上超过了医生的平均分(43.7 分)。这是 AI 在医疗保健领域应用迈出的重要一步。
我的评论: 从冗长脚本转向简洁提示词,这不仅是优化,更是对现代模型能力提升的认可。GPT-5.6 Sol 无需过多指令就能理解上下文和目标。然而,文件删除和订阅取消等事件提醒我们:赋予 AI 的自主权越大,明确的安全边界和受限的访问权限就越发重要。技术固然强大,但需明智驾驭。