2026 开年观察:Agent 终于开始替你干活了

嘴强王者的一年

事情是这样的。去年我有个习惯,每次看到新的 Agent 发布,都会兴冲冲地点进去让它帮我干点活,订个票啊,整理个表格啊,批量改一下文件名啊。结果十次里有九次,它在前三步表现得像个天才,到第四步突然脑子抽风,要么把日期搞错,要么重复调用同一个工具八遍,要么信誓旦旦地告诉我已经搞定了然后我一看啥也没干。

那种感觉,怎么说呢,就像你招了个实习生,面试的时候对答如流,干活第一天就把咖啡泼在服务器上。

2025 年一整年,Agent 这个词被念叨了无数次。各家发布会一个接一个,demo 一个比一个炸裂,视频里 Agent 行云流水地订机票、填报销、回邮件、做数据分析,看得人热血沸腾。但你真下载下来用,就是另一回事了。

我自己踩过最大的一个坑,是让它帮我把一批会议纪要整理成表格。它很认真地干了一个小时,最后给我生成了一张表,格式漂亮,字段齐全,内容全是它编的。对的,它编的。会议里根本没说过的话,它一本正经地填进去了,还填得特别像那么回事。

那一刻我有点后背发凉。不是因为它笨,是因为它笨得太自信了。

这其实就是 2025 年 Agent 的缩影。能聊,能演,能 demo,但一旦你把真活儿交给它,它就在某个你意想不到的角落塌掉。你不敢撒手,它也接不住。

拐点这个东西,你是慢慢感觉到的

说真的,拐点这东西很难用一个具体的日子去标记。它不是某天早上醒来突然发现 Agent 变聪明了,而是你在日常使用里,慢慢觉得,嗯,好像不太一样了。

2026 年开年这段时间,我自己的体感是有几个东西在变。

第一个是长任务的稳定性。以前让 Agent 跑一个需要十几步的任务,它中间大概率会跑偏,不是忘了自己要干嘛,就是卡在某一步反复横跳。现在好多了。我前阵子让它帮我把一个项目里所有的课程文章图片相对路径重新改写,几十篇文章,它一篇一篇过,找路径、改链接、检查层级,全程没抽。要放去年我根本不敢想,去年它改三篇就开始把 A 文章的图塞到 B 文章里。

第二个是工具调用变靠谱了。工具调用这事儿听着很技术,其实你想想就是 Agent 去操作别的软件。查个航班、读个文件、调个接口。去年这个环节是最脆的,动不动参数填错、接口调崩、或者干脆假装调了其实没调。今年我用 Claude Code 处理一些代码任务,工具调用的成功率明显上来了,它知道什么时候该用什么工具,参数也填得规整,不会像以前那样一通乱试。

第三个,也是最让我兴奋的,是 computer use 真的能用了。

所谓 computer use,就是 Agent 直接操作你的电脑屏幕,像人一样点鼠标、敲键盘、看界面。去年各家都在喊这个,视频一个比一个酷炫,实际一用,点错按钮、找不到元素、卡在验证码上是常态。今年我试了几次让它帮我处理表格,它真的能打开软件、定位单元格、复制粘贴、保存文件,虽然慢,但它在干人事了。

那种感觉很奇妙。你坐在旁边看它一下一下点,像个笨手笨脚但很努力的新人,你心里会涌起一种奇怪的感情。

我真让它干了活,也真踩了一身泥

光说体感不够,我讲几个具体的。

前阵子出差,我想试试让它帮我订机票。我把时间、出发地、目的地都告诉它,让它去查航班、比价格。它查得挺认真,列了一堆方案,价格、时长、航司都标得清清楚楚。我正准备说就这个吧,鬼使神差地多看了一眼,它选的那个航班,日期是对的,但起飞时间是它编的。实际的航班根本没有它说的那个点。

就差那么一步。前面全都对,就最后那个关键信息是幻觉。

我当时就愣住了。因为它前面表现得太靠谱了,你几乎要信它了,然后它在终点线前给你来这一下。这种坑比它全程乱来还可怕,因为你放松了警惕。

报销那件事倒是意外地顺利。我把一堆发票照片丢给它,让它按日期、金额、类别整理成表格。这个任务它干得相当漂亮,照片识别准、分类合理、金额没算错。我后来逐张核对了一遍,基本没问题。我寻思了一下,这种任务为什么能成,大概是因为它边界清晰,输入输出都明确,中间没有需要它「编」的地方。

批量处理表格就属于另一回事了。我让它帮我把几份不同格式的销售数据表合并成一张总表。前半段它做得挺好,识别列名、统一格式、拼接数据。到后半段出事了,有两份表的日期格式不一致,一份是月日年,一份是年月日,它没识别出来,直接拼了。结果那张总表前半部分日期是 2026 年的,后半部分突然跳到 2003 年。

太离谱了。

我后来手动修了半天。但坦率的讲,就算这样,它还是帮我省了大量重复劳动,那些纯体力活它干得又快又好。坑集中在它理解不了的地方,而这些地方恰恰是人一眼能看出来的。

这就引出一个特别现实的问题。

还不敢撒手

我现在用 Agent 的状态,很像我教我爸开车那阵子。

他坐在驾驶位,我坐在副驾,手随时准备伸过去抢方向盘。他开得好的时候我放松一下,他一有状况我立马紧张。你不敢闭眼,因为你知道他随时可能在某个路口走神。

信任这东西是分层的。最低一层是「它说的我不信,我得查一遍」。中间一层是「常规操作我信,关键节点我盯一下」。最高一层是「完全撒手,它干完我直接用」。

我现在大概在中间那层晃。常规任务我敢交了,但任何涉及钱、涉及最终交付、涉及对外发送的东西,我一定自己过一遍。

这不是我保守,是出错的代价不对等。它订错一张机票,我损失几百块加一通折腾。它把报销金额搞错,我可能要解释半天。它要是把一份不该发的邮件发出去了,那后果根本没法收。

Agent 现在的问题不是它不够聪明,是它不知道自己什么时候不聪明。它出错的时刻和它正确的时刻,姿态是一样的,都那么自信,那么笃定。你没法从它的语气里判断这步它到底是真会还是硬撑。

这才是最让人不敢撒手的地方。一个知道自己几斤几两的笨蛋是安全的,一个不知道自己几斤几两的天才才是危险的。

我自己的做法是,把任务拆开,把它能干的那部分交给它,把需要判断、需要兜底的部分留给自己。听起来很朴素,但真用起来你得对这件事有足够的了解,知道哪儿是坑,才能把坑留给自己、把平路让给它。

从试玩到分工

聊到这儿,我想说说一个心态上的变化。

去年大家对待 Agent,基本是试玩心态。下载下来,玩两下,觉得牛逼或者觉得拉胯,发个朋友圈,然后吃灰。这没什么丢人的,去年它确实也就配这个待遇,demo 玩具嘛。

但今年我觉得该换一种心态了,叫分工心态。

分工心态的意思是,你不再问「它能不能替代我」,你开始问「这件事里哪部分该我来,哪部分可以交给它」。你把它当一个有特定能力边界的新同事,不是一个全能的神,也不是一个废物。

你想想看,我们跟人协作也是这样。你不会把整个项目丢给一个新来的实习生然后转身走人,你会把适合他干的部分分出去,把核心的、需要经验的、出错代价大的部分攥在手里。对 Agent 也一样。

区别在于,人知道自己的边界,会主动说这个我不会,Agent 不会。所以跟 Agent 分工,你需要比跟人分工更主动地去划定那条线。这条线划在哪,取决于你对这件事的理解,也取决于你对这个 Agent 的了解。这是个需要时间积累的活儿,没有捷径。

我对 2026 年的看法是这样的。Agent 不会突然在某一天变得无所不能,但它会一点一点地,从一个你能聊的玩具,变成一个能替你扛一部分活儿的搭档。这个过程不会轰轰烈烈,更像你某天回头发现,咦,我好像已经习惯把某些事丢给它了,而它好像也确实没给我添乱。

那个瞬间,才是拐点真正到来的标志。

不是某个发布会上的炸裂 demo,是你生活里某个安静的下午,你把一件事交给它,然后你去做别的事了,没有回头看。

我还到不了那一步。但我觉得,比去年近了。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。

/ 作者,词元Max

评论区

暂无评论,快来抢沙发吧