关于ZAKER Skills 合作
钛媒体 1小时前

把 500 元退款交给 Agent 之后

文 | 防涂冷的腊

今年 5 月,龚先生在一家二手车交易平台询问一辆车的费用。平台官方 AI 客服 " 小瓜 " 给出的答复很明确:2.87 万元报价已经包含过户和上牌费用。得到这个答案后,龚先生支付了 2000 元定金。等到线下办理手续,销售人员却又要求他支付 1000 元过户费。

AI 说费用已经包含,销售说还要另付。对消费者来说,麻烦不只在于多出 1000 元,而在于他已经根据平台给出的答案付了定金。

这类纠纷正在改变 AI 客服问题的性质。过去的主要问题是听不懂、答非所问、不肯转人工。现在,AI 开始进入价格、退款、赔偿和处理资格等真实业务。它不只需要给出一个听起来合理的回答,还要把回答变成企业能够执行的处理结果。

矛盾也从这里出现。AI 认为用户符合退款条件,后台系统却无法退款;AI 给出明确报价,销售人员却执行另一套规则;AI 已经把会话推进到下一步,人工接手后又要从头确认。模型能够完成的工作越来越多,企业原来的数据、规则、权限和人工流程却没有同步改变。

如果 AI 只负责给客服提供建议,这些问题还可以留给员工处理。当 AI 开始自己判断、调用系统和推进任务,原来围绕人设计的流程就会不断出现摩擦。

淘宝客服的两次现场实验,正好展示了这条分界线:同样是 AI 进入客服,一个主要提高员工效率,另一个已经开始改变整条服务流程。

01 两次AI进入客服的实验

第一次实验中,AI 坐在客服旁边。

2024 年 1 月至 2 月,研究者把 5940 名入职不满一年的淘宝客服随机分组,观察约 256 万次会话。实验组的工作台上多了一名生成式 AI 助手:它识别用户的问题,查找相关资料,再给出一个解决方案。客服可以直接采用,也可以修改或忽略。

结果很快反映在工作效率上。客服识别问题的时间平均下降 8.2%,会话时长下降 1.1%,用户 " 不满意 " 比例下降 3.4%。低绩效客服改善更明显,AI 把资深员工掌握的知识更快送到了经验不足者面前。

在这个实验里,AI 几乎没有改变企业原来的权力关系。它可以建议 " 这类订单适用哪条规则 ",却不能替客服决定是否退款;它可以生成回复,发送按钮仍由人来点。SOP、审批权限和责任归属都没有变化,企业只是在原来的工作台里增加了一个更好用的工具。

这一阶段,AI提高的是人的生产率。

几个月后,第二次实验里的 AI 换了位置。它不再坐在客服旁边,而是自己开始接待用户。

2024 年 8 月,647 名客服参与了一项为期 17 天的 Agentic AI 实验,共覆盖约 68 万次会话。系统先识别适合标准化处理的问题,再由 AI 继续推进会话;每次会话仍匹配一名人工监督者,但人工退到了后台,只有系统触发或客服主动介入时才接手。

实验最终只有约 5.8% 的会话进入 AI 可处理范围。在这些会话中,处理时间下降约 16.8%,用户评分却下降约 0.412 分。速度和评分走向不同,说明 AI 把会话更快推向结束,并不等于用户的问题已经被更好地解决。

这两项实验中,第一项实验里,AI 提出建议,人判断、执行并负责;第二项实验里,AI 开始理解、判断和推进,人工负责监督与异常接管。

AI助手改变的是一个岗位,Agent开始改变一条流程。

为什么从岗位走向流程以后,难度会突然上升?这并不是客服行业才有的偶然摩擦。企业采用通用目的技术时,类似的时间差已经发生过一次。

02 一百年前,工厂先换了电机,后来才改变生产

蒸汽时代的工厂里,通常有一台大型动力机放在厂房中央。动力沿着传动轴送到不同楼层,再通过皮带带动每一台机器。机器不能随意摆放,离轴太远就难以获得动力;厂房的楼层、设备的位置和工人的分工,都围绕这套中央动力系统设计。

电动机出现后,第一批工厂主没有立即推倒厂房。更省事的做法,是把蒸汽机换成电动机,其他部分继续使用。动力来源变成了电,传动轴还在,皮带还在,机器的位置没有动,生产组织也没有动。新技术进入了工厂,工厂却仍按蒸汽时代的方式运行。

经济学家 Paul A. David 研究电气化历史时,强调的正是这段容易被忽略的过程。早期采用电力,并没有马上带来后来人们熟悉的生产率跃升。等到单机驱动逐渐普及,每台机器可以独立获得动力,企业才有条件拆掉中央传动体系,重新安排设备、物料流动、厂房结构和岗位。更大的效率改善,来自围绕电力重新设计生产,而不只是换掉动力机。

几十年后,Erik Brynjolfsson 等人把这类滞后概括为 " 生产率 J 曲线 "。一项通用目的技术投入企业以后,成本往往先发生:企业要建设新软件,清理数据,培训员工,调整流程和组织方式。这些配套资产需要时间形成,收益却要等新流程稳定运行后才释放。生产率可能先下沉,再向上抬升,曲线因此像一个字母 J。

生成式 AI 已经出现类似迹象。微软参与的一项随机实验覆盖 66 家企业、7137 名知识工作者。使用 Copilot 12 周后,员工每周处理邮件的时间平均减少 1.4 小时,降幅约 12%;但会议时间、写作时间,以及邮件线程、会议和文档数量没有显著变化。个人能够独立改变的活动先变快了,多人协作和企业整体工作方式却没有同步改变。

这也解释了两次淘宝实验之间最关键的差别。AI 助手只改动一个员工完成某个节点的方式,原流程基本可以继续运行。Agent 要把任务往下推进,就会遇到后台数据、业务规则、系统接口、人工接管和责任划分。模型越快,旧流程里的等待和摩擦反而暴露得越早。

把新技术装进旧流程,和按照新技术重新设计流程,是两件不同的事。

那么,Agent 究竟要求企业重新设计什么?不妨回到开头那笔退款,看看 AI 要把一句 " 可以退款 " 变成 500 元到账,中间到底隔着多少工作。

03 从一句 " 可以退款 ",到真的退回 500 元

客服软件过去也会自动处理问题,只是它获得的判断空间很小。菜单客服让用户自己选择选项,系统执行固定动作;规则引擎按照预先写好的条件运行;生成式 AI 助手可以理解自然语言、查资料和推荐方案,最后仍由员工决定。到了 Agent,软件开始读取真实业务数据、选择规则并调用系统,才真正靠近企业的业务权限。

图 1|客服技术演进的实质,是判断权和执行权逐步向软件移动。

现在假设一名用户说:" 我要退款 500 元。"AI 要完成这件事,至少要识别用户在投诉什么,找到对应订单,确认付款和履约状态,查询当时有效的退款规则,判断用户是否符合条件,选择原路退回还是其他方式,执行退款,告诉用户结果,最后把处理过程写进工单。

这不是一个任务,而是一串前后相连的任务。前一步给出的结果,会成为后一步的输入。订单找错了,后面的规则判断全部失去意义;退款已经发起却没有写入工单,下一名客服还可能再次操作。

很多企业现在的 AI 流程看起来已经覆盖了不少环节,真实工作却仍是另一番样子:AI 识别问题,人确认类别;AI 找到规则,人决定方案;AI 生成回复,主管审批;最后再由系统退款。完整流程依然是 "AI —人— AI —人—系统 "。

假设 AI 只用几秒钟就找到了规则,但 500 元退款需要主管批准,而主管正在开会。前面节省的时间会全部停在审批节点。等主管上线,他还要重新阅读对话、核对订单和理解 AI 的建议。一次交接增加一次等待,也增加一次上下文丢失和口径偏差。

这就是任务链的问题。2026 年 NBER 论文《Chaining Tasks, Redefining Work》把生产过程拆成有先后关系的步骤。研究的核心启发是:AI 能够连续执行相邻步骤时,自动化收益更容易释放;如果它会做的环节零散分布,边界和交接会压低实际执行率。这项研究不是适用于所有行业的因果定律,但它抓住了 Agent 部署中一个长期被忽略的变量。

图 2|Agent 的目标不是取消人工,而是减少常规步骤之间的人机交接。

淘宝 Agent 实验中,只有 5.8% 的会话进入 AI 可处理范围,也可以放到这条链上理解。在当时的模型、规则和风险边界下,企业能够放心交给 AI 连续处理的会话仍然很少。想扩大这一范围,模型需要回答得更准,企业也要把查询、判断、执行和记录这些相邻任务真正接起来。

企业 AI的生产率,不取决于有多少环节用了 AI,而取决于 AI能连续干多长。

一个自然的反问是:既然交接会损失效率,让 AI 把整笔退款自己做完不就行了吗?

问题是,它首先得拿到公司的权限。

AI 要核对退款,第一步是看到真的订单:用户是否已经付款,订单处于什么状态,有没有发起过退款。如果客服系统显示 " 已退款 ",支付系统仍显示 " 处理中 ",模型再强,也只能在互相冲突的事实中猜测。企业还要决定它能读取哪些字段,用户等级、历史投诉和支付信息是否需要脱敏。数据首先决定,AI 和企业是不是在面对同一个事实。

订单确认以后,AI 要知道公司真正执行的规则。很多规则并不整齐地放在一本 SOP 里,而是散落在培训资料、系统提示、临时通知和主管经验中。员工看到 " 特殊情况酌情处理 ",可以结合过往案例理解;Agent 要稳定执行,必须知道什么算 " 特殊 ",谁有资格酌情处理,新旧通知冲突时哪一版有效。企业需要把隐性经验整理成可检索、可判定、可更新的规则。

接下来才是最关键的一步:AI 必须真的有权退这 500 元。

它告诉用户 " 按照规则,你符合退款条件 ",风险还停留在信息层面;它告诉用户 "500 元已经原路退回 ",就已经调动了企业资金。企业需要明确,100 元能否自动处理,500 元是否需要二次验证,5000 元是不是必须由人工审批;涉及金融、安全或法律责任的业务,是否直接禁止 AI 自主执行。权限还要落到具体动作,不能只是给模型一个可以进入后台的账号。

Agent开始进入企业内控。

权限也不是越大越好。成熟的 Agent 还要知道什么时候停止。订单信息不一致、模型置信度不足、用户情绪恶化、金额过高、疑似欺诈或已经超出规则边界,都应触发不同级别的人工接管。淘宝实验已经说明,后台留着一名人工,不等于人机协作已经成立。介入发生得太晚,客服接手后还要重新询问,用户只是从和 AI 争执变成再向人解释一遍。

500 元退回以后,流程仍没有结束。企业还要能够回答:AI 为什么批准退款,读取过哪些数据,依据哪一版规则,谁给了它这项权限,资金是否真的到账,错误能不能撤回。2024 年加拿大一宗机票差价纠纷中,Air Canada 试图把错误信息归因于网站聊天机器人,加拿大民事裁决法庭没有接受这一解释。机器人属于企业网站的一部分,企业仍要为它提供的信息负责。这个案例没有替所有 Agent 纠纷给出统一法律答案,却把责任边界说得很清楚:企业不能把软件当作独立于自己的发言者。

让 AI 真的做事,企业就要告诉它能看什么、依据什么、能决定什么、什么时候停,以及出了问题如何追查。这些内容共同组成授权链。

到这里,两条链可以放在一起看。任务链决定 AI 能连续完成多长的业务;授权链决定企业敢让它连续完成多长。Agent 每往前多走一步,通常都要获得更多数据和执行权限;权限越接近真实资金与资源,企业对规则、异常处理、审计和责任的要求就越高。

任务链决定 AI能走多远,授权链决定企业敢让它走多远。

这套矛盾会不会只是客服行业的特殊问题?换一个部门,答案很快就会出现。

04 客服之外,采购会遇到同一条边界

客服最早暴露 Agent 的问题,有很现实的原因:业务高频,流程相对标准,历史数据多,人工成本和结果都容易衡量,而且直接面对用户。AI 只要答错一句话,结果很快就会变成退款、投诉或重复咨询。

这也提醒企业调整评价方式。传统呼叫中心习惯看平均处理时长、接待量和人工成本。淘宝实验中,AI 自主处理的会话确实更快;如果用户随后再次咨询或投诉,局部效率只是把成本挪到了流程后面。Agent 承担的任务越长,指标越要接近完整结果,例如问题是否一次解决、人工接管是否有效、错误能否回滚,以及每个已解决问题的总成本。

如果把场景换成采购,问题没有本质区别。AI 帮助采购员总结供应商资料、整理报价和生成询价邮件,不需要改动原来的审批关系,它仍然是助手。采购 Agent 真正开始工作,则要发现库存变化,判断是否补货,联系供应商,比较报价,选择方案并提交采购单。

流程一旦往后推进,客服里的问题会依次重现。它可以看到哪些库存和成本数据?最多能花多少钱?新供应商由谁审核?报价突然偏离历史区间时,是继续下单还是交给人?采购员过去依靠经验完成的判断,需要变成 Agent 可以调用的规则;企业原来交给岗位的采购权限,也要拆成金额、品类、供应商和风险等级。

如果每一步都重新交给人审批,风险看起来降低了,Agent 也会退回助手的位置,连续流程的效率无法兑现。更可行的做法,是先选择一段规则稳定、数据可用、结果可回滚的任务,让 AI 连续处理,人负责设定边界和接管异常。等错误率、交接质量和审计记录稳定后,再逐步增加任务长度和授权范围。

客服只是先行实验,其他业务也会遇到类似边界,区别只在风险和授权强度。

05 没有旧流程的公司,就一定更快吗?

看到这里,一个很有力的反问是:既然成熟企业改造旧流程如此麻烦,AI 原生公司是不是天然占优?

AI 原生公司可以从第一天按 "AI 处理标准任务、人工处理异常 " 设计软件和岗位,少了旧系统与旧审批链的阻力。任务链更容易连起来,权限也可以在建设初期拆清楚。

但 Agent 稳定工作还需要另一类资产:长期业务数据、成熟规则、风险经验和足够多的异常案例。新公司没有复杂的历史包袱,也缺少这些沉淀。Agent 最容易在少见、模糊、代价高的边界上出错,恰好需要真实业务反复积累。

成熟企业的问题相反。旧软件、部门边界和审批结构会拖慢改造,背后却保存着长期客户记录、真实业务数据、行业规则和大量失败案例。只是这些经验不会自动成为 AI 能力。规则继续留在主管脑中,数据仍分散在不同系统,异常处理只靠老员工口口相传,再丰富的历史也无法被 Agent 调用。

竞争因此不只取决于谁的历史包袱更少,而在于谁能更快完成转化:AI 原生公司要把业务经验补起来,成熟企业要把已有经验从人、SOP 和旧系统中拆出来,变成 AI 能读取的规则、能安全使用的权限,以及人与 AI 能够共同执行的流程。

历史积累只有被转化成规则、权限和流程,才会从包袱变成资产。

06 企业要重新设计的,不只是一套客服系统

从一句 " 可以退款 " 到 500 元真正到账,中间隔着订单、规则、权限、异常处理和审计。模型能够生成这句话,只说明它会回答;企业能够把这句话稳定地转化为一项可以执行、可以追溯的业务动作,才说明适合 Agent 工作的流程已经建立起来。

过去几十年的企业软件,大体建立在一个前提上:人理解情况并作出判断,软件负责记录和执行。ERP、CRM、OA 和财务系统里的表单、按钮与审批流,都围绕人来设计。AI 助手没有改动这个前提,它只是让人更快获得信息和完成表达。

Agent 开始改变这套分工。越来越多标准业务可能变成:人设定目标、规则和边界,AI 完成判断与执行,人处理异常。企业要重新梳理数据和业务规则,拆分权限,设计连续任务,确定人工介入节点,并建立能够追溯和回滚的责任体系。模型只是进入企业的入口,真正困难的改造发生在后台系统和组织内部。

真正决定这一轮 AI 生产率的,可能不是谁最早部署最强的模型,而是谁最早把自己的企业重新设计成适合 AI 工作的样子。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容