OpenAI 最近发布了一份面向 GPT-5.6 的官方 Prompt 指南。核心观点很明确:模型能力越来越强,Prompt 不一定要越写越长。

很多团队在开发 Agent 时都有类似经历:模型漏做一步,就补一条 MUST;工具调用出问题,就再加一条 NEVER;模型换了版本,旧规则却一直保留。时间久了,System Prompt 越堆越长,里面不仅有重复内容,还可能出现互相矛盾的要求。
结果是,Token 花得更多,模型反而更难发挥。
根据 OpenAI 在内部 Coding Agent 任务中的测试,更精简的 System Prompt 可将评分提升约 10%~15%,同时减少 41%~66% 的总 Token 消耗,成本也降低了约 33%~67%。
这份指南讲的并不复杂,归根结底就是四句话:删掉无效内容、明确最终目标、划清行动边界、完成之前做好验证。
Prompt的第一步:先删,不要急着加
OpenAI 建议,优化 Prompt 时不要一上来就新增规则,而是先回头看看:现有内容里,哪些已经没必要了?
许多复杂 Prompt 都是长期“修补”出来的。旧模型能力不够时加的限制、历史遗留的示例、重复出现的规则,模型升级后未必还有价值,却依然占着上下文窗口。
比较稳妥的做法是:从一套能正常工作的 Prompt 和工具配置开始,每次只删除一类内容,例如重复指令、失效示例或无关工具说明。改完后,用同一批评测任务验证效果。
这样做的好处是,团队能清楚知道:到底删掉了什么、有没有影响结果、哪些内容才是真正必要的。
该删的是那些不再改变模型行为的信息;该留下的,则是任务目标、成功标准、权限范围、证据要求,以及交付前必须完成的验证。
Prompt 做减法,不是降低要求,而是把无效噪音清出去。虚拟卡
少规定步骤,多说清结果
过去写 Prompt,很多人习惯把流程规定得非常细:先搜索什么、再读哪个文件、接着调用什么工具、最后按什么顺序输出。
但对于 GPT-5.6,OpenAI 更推荐另一种写法:明确告诉模型最终要完成什么、判断依据是什么、哪些事不能做,以及做到什么程度才算完成。至于具体怎么走,交给模型根据实际情况决定。
这并不是说 ALWAYS、NEVER、MUST 都不能写。
涉及安全边界、必填内容、禁止操作时,这类规则依然需要写得明确。但像“是否继续搜索”“什么时候调用工具”“信息不足时要不要追问”这类问题,更适合提供判断标准,而不是写死成一套流程。
例如,可以告诉模型:证据足够时就停止检索并交付;缺少关键事实时,说明缺什么,并优先用成本较低的方式补齐。
这能减少重复搜索,也能避免 Token 被浪费在无意义的循环上。虚拟卡
能做什么,必须提前讲清楚
Agent 接入工具后,Prompt 里还需要明确一件事:模型到底被授权做什么。
用户让模型分析、审查或制定计划,通常只意味着可以阅读材料、检查问题并给出结论;用户要求修改、构建或修复时,模型才可以在任务范围内进行本地改动和非破坏性验证。
至于外部写入、删除文件、购买服务,或明显扩大任务范围的操作,则应当再次确认。
模型知道下一步“可以做什么”,不等于它已经获得了“可以执行”的授权。
工具本身也不宜一股脑全塞给模型。每个工具最好说明清楚:它解决什么问题、什么时候使用、重点看哪些返回结果、失败后应该怎么办。
工具越多、描述越模糊,模型在选择工具时的负担就越大。
检索也是一样。普通问题可以先做一次较宽泛的搜索,获得核心证据后直接回答;只有发现缺少关键事实、日期、来源或引用时,再进行针对性补充。
如果没有搜到某项信息,也不能直接推断它不存在;面对相互冲突的来源,则应如实说明分歧,而不是强行给出确定结论。
长任务要报进度,也别浪费推理
对于耗时较长、需要多次调用工具的任务,指南建议只在关键阶段发生变化时更新进度。
没必要每调用一次工具就向用户汇报一次。真正值得同步的,是开始执行、发现重要问题、完成关键步骤,或者遇到需要用户决定的情况。
同样,Reasoning Effort 也不是越高越好。
OpenAI 的建议是:先以当前设置作为基线,再测试相同或更低的推理档位。只有评测证明 high 或 xhigh 确实能带来明显提升时,才值得承担更高的成本;max 更适合难度极高、质量优先的任务。
很多时候,模型表现不佳,不是因为推理不够,而是因为 Prompt 没把成功标准、依赖关系、工具条件和验证要求说清楚。指令本身不清楚,单纯提高推理强度也未必有用。
生成结果,不代表任务结束
指南反复强调:模型给出了结果,并不等于任务已经完成。
比如代码修改后,如果环境允许,仍应继续运行测试、类型检查、Lint、构建检查或最小冒烟测试。前端和视觉类任务,则应该查看实际渲染效果,确认布局、间距、裁切和内容展示是否正常。
如果因为环境限制无法验证,也应该如实说明原因,并告诉用户下一步如何检查,而不是直接宣称“已经完成”。
官方还给出了一套可参考的 Prompt 结构:
- Role:角色定位
- Personality:表达风格
- Goal:任务目标
- Success criteria:成功标准
- Constraints:限制与边界
- Tools:工具说明
- Output:输出要求
- Stop rules:停止条件
它不是让开发者把 Prompt 写得更长,而是帮助大家判断:这句话到底会不会影响模型行为?如果不会,就没必要留在 Prompt 里。
谁最值得读这份指南?
如果你正在迁移 GPT-5.6,或维护复杂的 System Prompt、工具描述、Agent 指令和 Prompt Stack,这份指南值得认真看一遍。

尤其是当你的 Prompt 里已经堆满了 Always、Never、旧模型补丁和固定流程,或者你的应用涉及搜索、工具调用、代码修改、外部操作、长任务状态管理时,里面的建议会很实用。
如果只是用 ChatGPT 做日常问答、写作或总结,其实不必逐节研究。记住几个原则就够了:先做减法、以结果为导向、明确权限边界、完成前做好验证。
Prompt 不是越长越专业。真正有效的 Prompt,是让模型少背规则,多把事情做成。虚拟卡
原创文章,作者:wp-chen,如若转载,请注明出处:https://visaspay.com/2026/07/17/openai%e5%8f%91%e5%b8%83gpt-5-6-prompt%e6%8c%87%e5%8d%97%ef%bc%9aprompt%e8%af%a5%e5%bc%80%e5%a7%8b%e5%81%9a%e5%87%8f%e6%b3%95%e4%ba%86/