搭建部门智能体,很容易先想到岗位:法务一个,采购一个,商务一个。把各自的职责、资料和处理要求放进去,看起来就有了一套完整方案。
但继续往下做,问题就会出现。同一个“法务智能体”,这次要审合同,下次要起草条款,再下一次要准备谈判。专业知识有不少相通之处,要做的事却差得很远。如果连自己希望改善的那件事都没有说清,直接讨论部门要建多少个智能体,很容易只是在复制一张组织架构图。
在尝试构建部门智能体的过程中,我越来越觉得,应该先从一个人的具体工作里找场景,同时跟着结果往下看:同事接手时是否更省事,整件事情是否更顺畅,省下来的时间又能用在哪里。
一、一个岗位,包含许多不同的工作
不妨设想一次会前准备。
一名经办人收到供应商修改后的合同,下午要参加内部讨论。他把文件交给 AI,说:“帮我审查一下。”AI 很快列出一长串风险,条款效力、责任分配、措辞歧义,都说到了。
可经办人看完,发现自己最想知道的几件事还没弄清:对方这次到底改了哪里?哪些已经谈过?哪些得在会上请同事拿主意?清单写得很专业,他还得重新翻合同。这里最想知道的事,其实不是合同本身,而是围绕合同对业务、对公司的一系列影响分析,本质上还是管理问题。
但回到这个场景,问题其实出在任务没有说到位。如果是起草,要把已经商定的安排准确写进去;如果是复核修订稿,要找出变化,再核对这些变化有没有依据;如果是准备谈判,还得弄清哪些条件可以讨论、哪些必须请有权限的人决定。同样一份合同,换一个目的,就需要另一种结果。
岗位、模块、场景和环节,可以帮助我们逐层看清这些差别。岗位说明一个人负责什么,合同管理之类的模块归拢一类工作,场景说明眼下要办哪件事,环节再展开办事的步骤。用这些词,是为了把工作说清楚,不必强求一棵整齐的分类树:一次谈判准备,就可能同时经过采购、商务和法务。
此前与 AI 讨论时,我觉得“条线 × 场景”这个说法有帮助。同一份修订稿,采购可能先看交什么、什么时候交、怎样验收,法务更关注责任怎么分,商务更关注价格和交易条件。大家看的是同一件事,想弄清的问题不完全一样;同一个人到了起草、审查或谈判时,关注点也会变。
不过,这个组合还需要继续具体化。“法务 × 合同审查”依然可能很宽:是首次全面审查,还是复核对方刚刚改过的几处条款?是依据标准文本检查偏离,还是处理一项已经获得特别批准的交易安排?这些条件会改变所需材料、判断过程和交付要求。
二、从最近做过的一件事里找场景
先挑最近做过的一件事就够了。尤其可以看看那些反复返工、明明不难却总耗时间,或者迟迟推进不下去的工作。
回到那份合同修订稿。经办人可以回看自己上一次怎样处理类似工作:文件从哪里来,怎样确认它对应哪个版本,去哪里寻找此前商定的条件,哪些地方必须请同事补充,最后又交出什么。沿着过程往回看,才容易发现时间和注意力究竟消耗在哪里。
他原本以为自己需要“更快写出审查意见”,回看后却可能发现,大量时间用于找基准版本、辨认散落在邮件里的确认记录,以及追问一项交付要求是否仍然有效。如果这些问题没有处理,AI 即使很快写出意见,人仍然要逐条检查它究竟依据了什么。
这时,先把版本标清楚、约定提交哪些材料,或者用文档比较功能找出变化,就可能解决一部分麻烦。等材料基本齐了,再让 AI 归纳变化、对照背景、列出需要确认的问题。顺着实际困难找下去,有时会发现,眼下最该做的只是把一个基础问题处理好。
美国二手车零售商 CarMax 选过一个很具体的任务。买车的人想知道其他车主怎么评价,但评论一多,很难逐条读完。微软在 2022 年发布的客户访谈案例中介绍,CarMax 先让 AI 把车主评论归纳成几句话,供购车者阅读;生成后,再由员工审核内容是否符合上下文和品牌表达要求。案例原文
这个任务容易说清:材料是已有评论,结果是简短摘要,读者是正在选车的人,编辑负责检查。它说明,寻找场景可以从一次具体的阅读、整理或判断困难开始,并不需要先给整个岗位设计一个智能体。
回到自己的工作,也要问问真正做事的人。有些人最想省掉找材料的时间,重要判断仍愿意自己做;有些人更需要一个帮忙检查遗漏的助手。斯坦福等团队的 WORKBank 研究就把工作者的意愿与专家对 AI 能力的评级放在一起考察,工具能做什么、使用者希望它帮什么忙,两边都要看。研究原文
有了想做的事,还要看看能不能开始。需要的材料拿不拿得到,有没有权限使用?结果出来后谁能检查,缺信息或出错时谁能接手?准备材料、改正结果和维护工具也要花时间,这些负担得一并算进去。重要的任务值得认真准备,不必急着承诺全交给智能体。
频率也是因素,但不能成为唯一标准。经常发生的小任务容易积累收益,低频的重要任务也可能值得得到更好的支持。还有一些工作,过去因为成本太高而没有认真开展,例如在谈判前多比较几种安排,或在事情结束后整理一份真正可复用的经验。寻找场景时,也应当给这些尚未充分开展的工作留出位置。
几件事都值得做、预计收益也差不多时,我会先挑材料拿得到、结果有人能检查、出了错有人能接手的那一件,尽早完整试一次。原来笼统的“做一个合同助手”,就可以落到“收到对方修订稿后,帮经办人核对差异、准备内部讨论的问题”。
三、一件事拆到什么程度才合适
工作可以不断拆分,但拆得越细,并不意味着越容易做好。
比如合同修订,可能包括读取文件、定位变化、核对已知条件、寻找相关条款、整理待确认事项。这些步骤之间有联系。一处交付日期的修改,可能需要结合另一处验收期限才能理解。如果每个步骤都独立处理,却没有把关联信息传过去,最后得到的几份结果也可能彼此矛盾。
拆到什么程度,可以先看能不能说清“交什么、怎么检查”。如果前一步只是列出差异,后一步却要决定是否接受供应商的新条件,两步需要的依据和权限明显不同,就应该分开说。反过来,找出修改、对照相关条款、标注依据,都在服务同一份会前清单,又需要互相参照,没必要为了拆分而把它们隔开。
以这个假设场景为例,可以先把任务约定写成一张简单的卡片:
| 需要说清的内容 | 本次任务的约定 |
|---|---|
| 触发与目标 | 收到供应商修订稿,为内部讨论做好准备 |
| 输入 | 明确指定的前后版本,以及已确认的交易条件和依据 |
| 交付 | 可定位的差异清单、与已确认条件的冲突线索、待确认事项 |
| 完成条件 | 重要变化得到覆盖,位置和依据可核对,缺失信息被明确标出 |
| 人的职责 | 补充事实、核验结果,由有权限的人决定是否接受修改 |
| 后续使用 | 采购、法务等相关人员能够据此继续处理各自负责的问题 |
这张卡片还不是完整的判断规则,但它让业务人员和技术人员有了共同讨论的对象。“重要变化”包括什么,怎样判断条件已经确认,什么情况下应当停止推断,都可以围绕具体样例继续澄清。业务人员负责确认判断标准,技术人员和 AI 协助把标准表达清楚、落实到工具中。某个人长期沿用的习惯,也需要与组织正式要求区分开。
哪一栏写不清,就从哪里往下问。缺材料,先找材料;大家对怎样才算完成有分歧,就拿样例一起看;没有人接手,就把责任说清。这张卡片能帮助发现问题,不必把填完它当成工作已经准备妥当。
假设修订稿把交付日期从月底改到下月中旬。系统可以确认两个版本的文字差异;如果输入中还包含已经确认的月底交付要求,就可以进一步指出不一致。如果缺少这项业务背景,它应当把接受新日期所需的信息列为待确认事项。仅凭合同变化,无法知道这次修改究竟是对已达成安排的准确记录,还是尚未同意的新要求。
找到日期变化,可以先把依据列出来;要不要接受新日期,得由有权限的人决定;决定以后,是否允许工具对外发送,还要另有授权。材料不足时,明确留下“这件事还需要向谁确认”,比勉强给出一个结论更能帮助后续处理。
说清任务以后,再决定工具怎么组织。起草和审查可以各有要求、分别检查,也可以共用一个入口,由系统按任务加载资料和指令。步骤明确的工作可以用固定流程;需要看中间结果再决定下一步的工作,才考虑让模型承担更多调度。Anthropic 的工程说明也区分了这两类做法。工程说明
四、先验证完整任务有没有真的变好
回到那份会前清单。几秒钟生成,看起来很快;但如果经办人还得花很久检查遗漏、删除无关提醒、重新找出处,这次准备究竟有没有省事,还不能只看生成用了多久。
先检查结果:关键变化有没有漏掉,措辞调整有没有被误判为实质变化,引用能不能找到原文,缺少的背景有没有被猜成事实。清单越长未必越有帮助,夹杂的大量无关提醒还会让重要问题更难找到。
再把时间算全。准备材料、操作工具、检查和改正结果,都算这次任务的耗时。首次整理规则的投入可以单独记录,别把前期成本藏起来,也别把一次性投入全算到一次使用上。
开始时,可以使用获得授权的样例,把原有做法和 AI 辅助后的做法放在同一套完成标准下比较。样例里既要有材料齐全的普通任务,也要有信息缺失、版本错误、重要例外的情况,并保留一部分没有参与调试的样例。否则,反复修改工具直到它能做好几个熟悉案例,还不能说明它面对新材料也能做好。
前面的交付日期例子也适合这样验证。保持合同不变,只改变一项背景:一组材料确认月底交付,另一组材料确认已同意延至下月中旬。工具都应该找到日期变化,但对是否与已确认条件冲突,应给出不同判断。再撤去确认材料,看它是否会承认信息不足。这类对照比只问“有没有给出专业意见”,更能检查工具是否理解了任务条件。
修改提示词、规则或更换模型后,还要把一组有代表性的旧样例再跑一遍,看看原来做对的地方有没有变错,留下错误记录。旧样例检查的是过去做得好的地方有没有退步;换成未参与调试的新材料能不能做好,仍要另外检查。
比较时还要留意材料难度和使用者熟练程度,必要时用同一任务多跑几次,看看关键结果是否稳定。如果工具还会修改记录或发送内容,就去检查记录有没有改对、内容有没有按要求发出。它回复“已经完成”,不等于事情真的办好了。智能体评估中也需要分别检查执行过程与最终状态。评估方法说明
2024 年,一项在阿里巴巴客服业务中开展的现场实验,让 AI 在服务开场提供问题诊断和处理建议,客服可以采用、修改,也可以不用。参与者都是任职不足一年的客服,研究看到处理速度和客户评分平均改善,却没有发现按“三日内是否再次求助”衡量的问题解决效果有显著改善;原本绩效较高的一组,部分质量指标还下降了。研究原文
这个结果把“快”与“好”拆开了:一次咨询结束得更快,客户当下也满意,问题却未必解决得更彻底。
放回合同场景,也应当说得出究竟哪里改善了:重要变化有没有找全,哪些情况容易出错,经办人还需要检查什么,发现问题后怎么办。“有人复核”这四个字本身,还不足以构成保障。
五、跟着交付走到下一个人
假设经办人已经试过几次,确认工具能帮自己更快地做好准备。清单交出去以后,事情又会怎样?
采购同事看到“交付日期变化”,还得知道月底交付是已经谈妥的要求,还是经办人自己的预期;法务同事要看前后条款和确认依据;如果新日期超出了原先的安排,还得找到有权限的人决定。清单少了这些信息,下一位同事就要重新问、重新找。经办人省下的时间,可能变成了别人补材料的时间。
组织不等于个体的求和,在这里并不抽象。每个人都及时交出了自己的材料,事情仍可能停着。
如果真正耽搁的是交付条件迟迟没有确认,让清单早几分钟生成并不能解决等待。工具能否更早找出这个缺口,把问题送到能回答的人那里,反而更值得看。因此,既要记经办人花了多久,也要看整件事从收到修订稿到完成讨论、形成决定花了多久。
这需要把接手的人请进来,一起看看他们究竟缺什么。哪些事实确认一次就可以沿用,哪些判断必须分别做,意见不同时由谁协调?必要的复核和制衡应当保留。要减少的是大家一遍遍寻找、解释同一份信息,却没有增加新的判断。
采购确认了交付安排,就把依据、确认人和适用版本一起留下。法务提出的条款建议,在有关人员确认前仍是建议。把文件放进一个共享文件夹还不够:接手的人得分得清哪个版本有效、哪些内容已经同意,修改后由谁更新;读取权限也要按工作需要安排。
AI 也可能帮人在交出结果前,多考虑一点别人的需要。宝洁在 2024 年组织的一天式产品创新实验中,使用 AI 的参与者提出的方案更能兼顾研发与商业视角,个人加 AI 的平均方案质量可以与没有 AI 的双人团队相比。研究原文
放到合同工作中,可以试着让工具提前提醒:这处修改还缺业务依据,那项建议还没有人确认。如果这些提醒准确,缺项也及时补齐,采购和法务就能少花些时间追问背景,把讨论用在真正的分歧上。这个设想是否有效,要请接手的人一起验证。
从个人开始,是为了找一件看得清、试得动的工作。如果试着试着,发现问题出在共用材料或交接规则上,就让有关的人一起参与,不用等每个人分别优化完再考虑合作。
六、释放出的时间与能力,准备去哪里
任务做得更好了,同事也能顺利接手,最后还有一个问题:在质量得到保证以后,真正释放的时间与能力,是否获得了有价值的去向。
原来必须做的工作,现在更快做好,当然是收益。过去嫌成本高而没做的工作,现在可以做了,也可能创造价值。但还有一种情况:材料越来越多,人却没能作出更好的判断。
例如,AI 一次生成十份谈判方案,原来人工只会认真准备两份,不能把人工写十份需要的时间全算成节省。多出来的八份有没有帮助找到值得考虑的安排,还是只增加了阅读负担,要另外判断。METR 关于任务替换与价值增益的理论分析也作了类似区分:原有工作提速与新增工作的价值,不能混成一笔省时账。分析原文
机器运行十分钟,也不等于人就空出了十分钟。期间要是不断被叫回来确认、补材料、检查结果,很难安心做另一件事。伯克利 Haas 研究者对一家科技企业的八个月观察,就记录了工作进入原有间隙、并行任务增加等现象。这是一家企业的定性研究,但它提醒我们看看自己的工作日:任务快了,注意力有没有更零碎?研究者访谈
回到那位经办人。如果核对材料确实省了事,他可以早点把关键事实问清,留出时间与同事沟通分歧,也可以把这次处理得好的地方整理下来,下次继续用。少加一会儿班、学点东西、恢复精力,同样值得,不必用新增任务把省出的每一分钟填满。
如果一个人把方法分享出来,换来的只是更多同类任务,却没有时间维护工具和学习,他未必愿意继续投入。组织怎样安排工作、认可贡献,让好方法留得下来,值得在下一篇继续讨论。
眼下可以先选最近的一件真实工作,和接收结果的同事一起说清完成要求,做一次小范围比较:自己做得怎么样,交出去以后对方还要补多少工作,最后省下来的时间能用在哪里。