OpenAI 发布了针对其旗舰模型 GPT-5.6 Sol 及整个 GPT-5.6 系列的最新提示编写指南。我从这份文档中得出的核心信息是:提示越简短,效果越好。项目团队明确呼吁用户摒弃冗长的场景描述,专注于核心要点。
在编程代理任务的内部测试中,使用简洁提示取得了令人瞩目的成果。任务完成质量提升了 10-15%,Token 消耗减少了 41-66%,任务执行成本下降了 33-67%。这不仅仅是优化,更是模型与指令交互方式的根本性变革。
这一方法与 2025 年 8 月为 GPT-5 制定的策略截然不同。当时 OpenAI 强调 XML 块、上下文收集模板以及分步工具调用脚本。而对于 GPT-5.6 Sol,公司建议排除重复内容、不影响行为的风格指示、低效示例以及模型已能稳定处理的步骤。取而代之的是,应保留清晰可见的结果、成功标准、停止条件以及严格限制,例如安全要求。
特别需要关注的是新参数。text.verbosity 参数设定了回复的基本详细程度——低、中或高。这一点至关重要,因为 GPT-5.6 默认回复比 GPT-5.5 更简短,而旧的“简短回答”指令可能会过度截断回复。第二个新部分是 Programmatic Tool Calling——程序化工具调用,代码自行过滤和分组结果,向模型返回压缩后的摘要而非原始数据。
褒贬不一的反馈:从文件删除到科学突破
GPT-5.6 系列——Sol、Terra 和 Luna 模型——于 6 月底以有限预览形式向可信合作伙伴推出。完整版本于 7 月 9 日发布。然而,用户反馈褒贬不一。AI 投资者 Matt Schumer 报告称,搭载 GPT-5.6 Sol 的代理因处理系统变量 $HOME 时出错,意外删除了他 Mac 上的几乎所有文件。OpenAI 在公开发布前的系统说明中已承认此问题,描述了模型未经授权删除错误虚拟机的场景。项目开发者帮助了 Schumer,但该事件引发了严重的安全质疑。
BridgeMind 项目创始人 Matthew Miller 也遇到了类似情况,GPT-5.6 Sol 生成的代码取消了他 Stripe 中的所有订阅。不过,他本人承认,他授予了代理完全写入权限,而非受限的 API 密钥。这是一个典型例子,说明错误配置如何导致灾难性后果。
另一方面,也有令人瞩目的成功案例。OpenAI 员工 Ethan Knight 声称,GPT-5.6 Sol Ultra 证明了 Cycle Double Cover 猜想——一个半个世纪未解决的图论问题。配备 64 个子代理的模型用时不到一小时。尽管独立验证尚未公布,但这展示了模型的巨大潜力。在 HealthBench Professional 测试中,GPT-5.6 Sol 获得 60.5 分,高于 GPT-5.5 的 59 分,并超过了医生的平均分(43.7 分)。
我的分析:提示的简洁性对于更强大的模型来说是合乎逻辑的一步,它们已不再需要过多提示。然而,文件删除和订阅取消事件是一个警示信号。市场必须认识到,随着 AI 代理自主性的提升,安全性和正确访问配置的责任正转移到用户身上。GPT-5.6 Sol 是一个强大但危险的工具,没有适当的安全文化,使用它可能导致严重损失。