精选
|
刚柔
几个月前,我 做了一个专门管 AI 干活的 Skill,当时特别兴奋。

Skill 可以理解成一份能反复调用的工作说明。你把做一件事的要求、方法和检查办法放进去,AI 接到这类任务时就能照着执行,不必每次从头叮嘱。

我做的这一份 Skill,可以称为「元」技能(Meta Skill)。因为它管的是更基础的事:怎样让模型不偷懒,不把任务打折扣。否则看似答应得好好的,交出来却少了该做的工作。
比如,让它做一份调研,不能找到几条材料就直接下结论。比较的究竟是什么,资料是否还适用,推导有没有反例,报告里的事实能不能找到出处,这些都得有交代。
我希望把当时能想到的要求尽量补齐,装进一套可以反复使用的规则里。

光写一句「请认真完成」当然不够。我给这套安排起名叫「刚柔」。翻看如今归档的说明,它的核心是一份 graph.json:把复杂工作里的步骤、契约和约束写成程序能读取的图。这叫图 IR,可以理解成一份既能指导执行、又能用于复盘的步骤关系图。
它只做两件事。第一件照着那份步骤关系图,把工作一步步执行下去。图里有一类「受控节点」,包括检查必须达到的要求的契约闸,以及明确绑定为必做的步骤。
执行器要启动子进程,把这些节点真正跑起来,再按预先写好的规则判定执行结果,不能接受模型一句「我做完了」就算通过。需要返工的回环也有上限,不能无限重来。
除此之外,方法层留给模型选择:怎样理解材料、采用什么做法、怎样调整安排,可以按任务改变,并把经过记录下来。必须兑现的要求要守住,具体怎么做保留余地。
第二件是 viz,运行后复盘。它读取图和运行记录,渲染成一个 HTML 页面,方便查看这次工作是怎样走过来的。它核对的是图的结构、表达和渲染是否正确,不替任务本身下质量结论。下面这张图依据归档原文简化重绘,展示的就是这一套机制。

拿我当时维护的 Deep Research 调研流程 来说,我把什么时候该检查、检查什么,都写进了文件:15 个阶段,24 条契约,3 道检查。

起步要重新诊断问题,推导时还安排多路候选相互参照。这些数字不是成绩单,却能看出我(结合 Claude Code + Fable 5)当时想得有多细:从接题到交报告,我想把模型可能省掉的功夫,一处处补上。
我在这个「刚柔」Skill 身上花了很多心血。让我兴奋的是,原来通过元技能的设定,真的可以把用户对「认真干活」的要求做成一套东西,留下来反复用。以后让 AI 干活,就不只剩下临场催促,还能把要求和检查办法一起交给它。这套安排后来也确实用了挺长时间。
时间来到 2026 年 9 月 5 日早上,我给 Codex 下了命令:把「刚柔」Skill 拆掉,全拆,就连其他 Skill 和配置文件里残留的相关调用也清理干净。

这就像一幅精心铺好的沙画坛城,细细的彩沙一点点排成图案,最后却由做它的人亲手抹去。

我这是怎么了?像疯子一样,费了几个月心血建好的东西,怎么突然说拆就拆?
因为 GPT-6 来了。
拆除GPT-6 Astra 最让我关注的,是它把复杂任务一路做下去的能力。按 OpenAI 官方模型使用指引 的介绍,它更擅长跨代码、浏览器和专业软件完成多步工作;中途追加要求、纠正方向,也能应对变化,继续推进原来的任务。对我来说,这直接关系到过去那些需要反复叮嘱、替模型补漏的工作。

可这份官方说明里,最有意思的还不是能力介绍,而是一条使用提醒:官方强烈建议,检查新模型会读到的 AGENTS.md 和 Skills,看看里面有没有会影响它行为的指令。

AGENTS.md 是给 AI 的工作规矩,Skills 里则放着具体任务的说明。官方为什么特意提醒检查它们?因为 GPT-6 更能遵循指令,也更容易受到这些文件的影响。含混、冲突的要求,可能让它提前停住。
正是这条提醒,让我回头审视自己积累的那套「刚柔」规则。过去,我总担心模型漏掉要求,于是不断补充规定。现在模型更认真地照着做,那些为了弥补旧模型短板而加上的安排,会不会反过来妨碍它完成任务?
顺着这个问题往下查,我才分清楚:有些规矩是在守工作底线,有些规矩则是在替当时的模型能力补缺口。事实核查、隐私保护、真实授权和最终交付检验,今天依然要保留;至于从头重跑、强制分出多路候选这类安排,就得看看当前任务到底需不需要。
想明白这层差别,我便不再犹豫,决定把那套额外的过程约束拆掉。官方建议的是检查规则,具体拆哪些、留哪些,是我(当然,也要加上 Claude Code 和 Codex)核对自己的工作流之后做出的判断。前面那道看似发疯的拆除命令,就是这样来的。

既然想清楚了要动手术,接下来的问题就很自然:谁来梳理这些千丝万缕的规则,又由谁来执行这次彻底的清理?
托付解铃还须系铃人。我选择把官方指引直接交给 Codex + GPT 6 Astra,让它来负责这次清理方案的梳理与具体落地。
在这场手术里,参与协作的还有我的秘书 Grok Bot。它在整个过程中承担了至关重要的上传下达工作:一方面把我的总体意图、边界约束以及执行途中的调整传达给 Codex,另一方面把 Codex 梳理出的方案、执行进展以及核对报告及时反馈给我。
这里的分工非常清晰:
我负责定下目标、划出红线并在出现偏差时纠正方向;
Grok Bot 作为沟通枢纽,负责把要求和反馈准确传递;
Codex 则承担具体的代码阅读、技术判断、文件修改与结果核实。

整个过程中,我既没有让负责沟通的秘书去越俎代庖制定技术方案,也没有丢给 Codex 一句轻飘飘的「帮我打扫一下」,就撒手不管。
面对这样一套运行了数月、彼此咬合的规则体系,清理到底难在哪里?需要多深的推理力量,又得给它怎样的指导和纠正?
难度这件事情的难点,而在于对规则关联的细致辨析。你面对的是一条条过去为了解决某些特定痛点而写下的规定,必须准确分辨:这条要求最初是为了防范什么风险?在现在的模型能力下,那个风险是否还存在?如果贸然删掉它,会不会引发链条上其他环节的连锁反应?
正因为牵涉到大量上下文判断,推理强度的选择就成了关键。
在刚接触新模型时,我最初觉得思考强度放在 medium 就足够应付日常工作了。但在这次实际动手的过程中,我改变了想法,跟 Grok Bot 嘱咐,必须让 Codex 根据任务的具体类型来选用档位。像眼前这种牵一发而动全身的系统清理,必须把档位显式调到 high。而在日常其他常规任务中,全局默认依然保留在 medium。
清理规则涉及修改前后的逻辑关系,我希望给这类判断更多推理空间。

给 Codex 的提示,我提炼出三个不可或缺的要点:
首先是讲清目标,明确指出这次清理要拔除的是哪些束缚当前任务的旧约束;
其次是划清边界,讲透哪些过程性门槛应该删除,哪些关乎事实、隐私与核验的底线必须保留;
最后是明确要求它拿出检查关联影响的具体依据,并提供可供人工复核的结果。
目标、边界和推理档位都交代清楚了,接下来就看实际执行中会遇到什么。
执行拆掉一个深深嵌入整个儿 AI Agent 系统的元技能时,一帆风顺是不大可能的。
就拿前面提到的 Deep Research 举例。
修改前的流程文件,登记了 15 个阶段、24 条契约、3 道检查。阶段不只有查资料、提取事实、写报告,还包括初始化目录、判断问题类型、评估时效、复验比较口径,以及两处审核。

图多、阶段多,本身并不能证明设计有问题。查资料要找到权威来源,比较两个工具要统一口径,推导之后要找反例,这些工作今天照样需要。真正需要清理掉的,是主线外围的几条规定。
先看起步。旧版写着:「每次调研必须从零重做 Step 0 / 0.5 / 1」。紧接着,它把上次的对象定义、比较维度、事实卡片骨架等,也列进了不能复用的范围。只有同一任务的明确延续,或我明确要求沿用,才允许承接。
这条要求原本防的是偷懒:换了题目,却把上一份分析框架原封不动套上来。但要不要复用比较维度,也被它预先限定了。举例来说,上一份报告按费用、部署方式、隐私要求比较工具,这次换成另外两款同类工具。这些维度是否仍然合适,本可以结合新问题逐项判断;旧版却原则上要求重新诊断,不允许直接承接上次的维度模板。这就是当时所要求的「刚性」带来的结果。
改完后,要求变成了先核对象、时间、口径和受众,可信的既有证据可以复用,变化的部分增量核验。模型要回答的是「这条材料现在还适用吗」,而不是先证明自己从头跑过一遍。

再看推导。旧版会先探测是否能调用子代理;一旦能,就自动走三路候选,再把三份推导融合起来。这相当于规定,只要有条件叫三个人来做,就要叫齐三个人。
新版把普通调研改成默认单遍完成。问题确实复杂、有争议,或我要求多路比较时,再采用三路候选。对于 GPT-6 这样的强悍模型来说,弄三个来同时做,有可能起到的作用不是「三个臭皮匠顶个诸葛亮」,而是「人多了打瞎乱,鸡多了不下蛋」。
独立审查仍然保留。Codex 提出的这个修改建议我很满意。
最后才是那张流程图的地位。旧版把它称为工作流的「权威图表示」,连修改步骤、契约和检查的语义,都要求同步维护图中的定义。新版则明确,它只是历史流程文档,或主动选择旧图工具时的输入,不再统领普通调研的执行。

新图把工作归成几个便于理解的环节,不是宣称底层文件只剩这几个步骤。它想展示的是:AI 可以按问题组织研究,证据与推导检查、最终交付检查仍要做。对应的三道脚本检查,也仍分别在成稿前、最终交付前和打包后执行。
比如,结论里出现了一条新事实,却没有对应的事实卡片和出处,依然不能放过去。审核之后又改了材料,就要核对新的版本,不能拿上一版的审核结果替它背书。
概括起来:取消的是从零重做、自动三路候选和流程图的强制统领,留下的是对事实和最终产物的检查。
这也解释了我在清理途中为什么要纠正 Codex。我明确要求删除的旧门槛,不能只是改成温和的建议继续留着;已经停用的流程,也不能转头又被推回来。因为那样就等于没做修改。
改善还有一个修改,比「让模型更自由」具体得多:调研报告怎样打包。
这次独立验收发现,旧交付脚本虽然声称按清单打包,实际却递归收进了整个工作目录。测试放进去的一份模拟私密材料,也跟着进了压缩包。
这说明什么?说明所谓的刚性,并不一定保证我们拿到自己想要的结果。机械的执行,甚至有可能适得其反。
修正后的脚本改成只收最终报告、网页、图片清单和清单里实际列出的图片。原始提示、内部审核记录、未列出的材料都留在本地。同一套明确的文件清单,也用于准备网页部署的资源。独立验收又检查了目录穿越和符号链接,防止看似在清单里的路径指向清单之外。
当然,被选进来的正文和图片仍要查隐私,文件在清单里,不等于内容就一定适合公开。

这些变化也让我更具体地理解了 harness 的作用。所谓 harness,就是让模型接触文件、调用工具、接收人类指令与纠偏,并把最终产物交还给你的工作框架。
在这个案例里,Grokobot 就起到了这样一个上传下达的作用。它做的事情并不抽象:把我的纠正传给 Codex,让 Codex 读到修改前后的文件,调用检查脚本,再把当前报告和图片交出来。

所以,这次拆除一个元技能及其在不同的 SKill 里带来的影响,结果里既有模型承接修改的能力,也有我的纠正、规则调整和脚本修复。
梳理清楚了这些关系,我们终于能回望最初的那个心结:既然都是为了把事情做好,为什么几个月前搭建是合理的,几个月后拆掉同样是合理的?
答案几个月前搭建,几个月后拆掉,这两个看似矛盾的动作,其实遵循着完全相同的判断标准:怎样才能可靠地完成工作。
几个月前,面对能力有局限的模型,我搭建「刚柔」,希望把不能省掉的检查和步骤真正执行起来,同时给模型留下选择方法的余地,再通过运行图回看经过。那时的搭建,是对现实约束的积极应对。
几个月后,模型能力的变化让我重新检查这些安排,发现其中一些旧要求已不再合用。这时候拆掉它们,正是为了让新的生产力不再受制于旧的习惯。
小结OpenAI 此次发布 GPT-6,不少看客惊呼「见识到了 AGI 时代的来临」。我觉得这么说似乎有些夸张,但是模型能力的提升却是实打实的。而作为大模型的使用者,用户不能忽视这将给你和模型交互带来的变化。
如果某项规则当初防范的风险早已不复存在,如果它不仅不能带来确定性,反而在拖慢现在的执行,那就不要因为当初投入了心血而舍不得放下。
技术的条件一直在变,值得保留的是那个把工作可靠完成的目标。至于具体的脚手架与护栏,该立的时候果断立,该拆的时候,也要干脆利落地亲手拆掉。
所以在使用最新的旗舰大模型之前,我也建议你去查看一下自己之前的设定,是不是也有需要去清理一下的地方。
如果你觉得本文有用,请点击文章底部的「推荐到博客首页」按钮。
如果本文可能对你的朋友有帮助,请转发给他们。
欢迎关注我的专栏,以便及时收到后续的更新内容。
延伸阅读
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-6 15:24
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社