开源追上闭源了吗:2026 年中我看到的真实差距
事情是这样的。
前几天我同时开着 Claude Code 和一个本地跑的开源模型,给同一个小项目改接口。闭源那侧三分钟出结果,基本能用,跑了一下过了。开源那侧也跑出来了,逻辑没错,但它脑补了一个不存在的库,import 半天报错。
这事儿不大,但我愣了一下。
因为一年前我也这么试过,那时候开源连任务都没理解对,跑出来的东西驴唇不对马嘴。一年过去,它能理解任务了,能写主体逻辑了,就是细节还会翻车。这个进步幅度比我想的快。
所以我想认真聊聊,开源到底追上闭源了吗。坦率的讲,这没有统一答案,取决于你盯哪个维度。我把最近半年的真实感受拆成三块,编程、长文本、Agent 任务。
一年前的判断,现在还站得住吗
去年我写过,开源离闭源至少还有一年半代差,Agent 场景会被放大,因为每步错一点后面全崩。
现在回头看,对了一半。Agent 场景闭源确实还领先。但「一年半代差」这个说法不对了。这一年代差不是线性缩小的,编程能力开源追得特别猛,几乎压到「能用但有脾气」。长文本基本追平,某些场景反超。真正拉开的是 Agent 这种多步规划和工具调用的复合任务。
我的感受是,代差不是一条线,是一把梳子,有的齿长有的齿短。笼统说追上了或没追上,都是偷懒。
编程能力,差距到底在哪
编程是大多数人最关心的。
我把同一个中等重构任务丢给闭源的 Claude 和开源的 DeepSeek、Qwen 这类模型。闭源第一次输出基本能跑,改两三处就能合并。开源的输出逻辑结构对,命名合理,但有个毛病,特别爱「自信地编」。
它给我引了一个看起来很合理的函数,名字、参数、返回值都对得上,问题是这个函数在依赖库里根本不存在。它是从训练数据里几个相似库的 API 推出来的,然后当真的用了。
这种错误最恶心,因为它看起来太正确了。你要是不查,真以为是环境的问题。
我有时候觉得,开源在编程上的差距,已经不是「会不会写」,而是「知不知道自己不知道什么」。闭源也会幻觉,但不确定时更倾向于说「我不确定这个 API 是否存在,建议你查一下」,而不是直接编一个给你。这个差异,在真实工程里就是你能不能信任它的输出。
我的结论是,日常小改动、写脚本、补测试,开源完全够用,我经常用。但涉及不熟悉的库、需要跨多文件推理的重构,我还是更信闭源。不是开源不行,是它的错误成本更高,得花更多时间验证。赶进度的活儿,验证成本算下来不如直接闭源。
长文本,开源已经追平了
长文本是开源追得最透的维度。
去年我还觉得闭源在长上下文上稳赢,几十万 token 下去还不丢信息。今年体感变了,几个主流开源模型在 128k 甚至更长的上下文里,召回率已经和闭源拉不开明显差距。
我做过一个很土的测试,把一份很长的技术文档丢进去,后面问它第三章某个细节。闭源答对了,开源也答对了。再问一个埋在脚注里的版本号,闭源答对了,开源记串了。
看出来了吧,差距还在,但已经从「能不能记住」变成「记多准」。这是质的区别。
说真的,对于绝大多数人的实际需求,读合同、啃长论文、整理会议纪要,开源长文本能力已经溢出了。你真要「一百万 token 里找一个逗号」那种极端场景,那确实还得闭源,但这种场景普通人遇得到吗。
这一块我给开源的评价是,追平了。甚至在一些中文长文本理解上,我觉得某些开源模型比闭源更懂语境,因为它们在中文语料上吃得更细。这是本土化训练的红利,没什么好争的。
Agent 任务,闭源还在领跑
Agent 是我觉得差距最大的地方,一年前判断「代差会被放大」的地方,现在依然成立。
Agent 难在哪,它不是单轮问答,是连续决策。理解任务,拆步骤,调工具,看结果,发现错了回头改,每一步都依赖上一步。任何一步偏一点,后面像滚雪球越偏越大。
我搭过一个小 Agent 流程,让它自动查几个数据源、交叉验证、生成报告。闭源跑这个,十次里七八次能跑通,中间会自己纠错,比如接口返回空了会换关键词重试。开源跑同样流程,十次能跑通三四次就不错,而且它崩的方式特别典型,一旦中间出错不会回头,顺着错误继续往下编,最后给你一个看起来完整、底层逻辑已经歪了的报告。
这个差异太致命了。因为 Agent 的输出往往是「最终交付物」,你看到的是报告、是结果,不会看它中间走了哪几步。它中间歪了你没发现,你拿着错的结论去决策,这才可怕。
我跟你说,这块差距不是靠堆参数能解决的。Agent 能力强不强,很大程度上取决于后训练里有多少高质量的「多步推理加工具调用」轨迹数据,还有推理阶段的对齐策略。这些东西闭源厂商捂得很紧,是他们现在最核心的护城河之一。
所以你要做 Agent 产品的,我的建议很直接,核心链路用闭源,别省这个钱。开源拿来做边路的、容错率高的辅助任务,别让它扛主流程。
开源真正的杀手锏,不是跑分
聊了这么多闭源领先的地方,我得把话拉回来。开源有一个闭源永远给不了的东西,就是「这东西在你自己手里」。
这个感受,用闭源 API 用久了才会慢慢冒出来。你用着用着,突然有一天供应商改了定价,某个地区访问受限了,安全策略更新导致调用被拦了,你就明白那种「命脉在别人手里」的无力感了。
开源真正的优势不是跑分,是这三件事。
第一,能私有部署。你的数据不出去,对做金融、医疗、政务的团队,这不是加分项,是一票否决项。我接触过几个做医疗 AI 的团队,从第一天就没考虑过闭源,因为患者数据绝对不能过外网。这种场景下,开源哪怕能力差一截,也是唯一选择。
第二,能改。你可以做微调,注入领域知识,改输出格式去适配你那个奇葩的内部系统。闭源给你的是黑盒,你只能用 prompt 哄它。开源是你可以打开的,你可以把自己积累的几千条业务 case 灌进去做 LoRA,出来的东西在你垂直场景里可能比闭源还好使。这个我是真见过,不是想象。
第三,长期成本可控。闭源 API 按量计费,用得越多越贵,定价权在对方手里,人家涨你就得跟着付。开源一次性摊掉显卡成本后,后面跑多少次都是边际成本。对于调用量大的场景,比如每天处理几十万次请求的客服系统,开源的成本优势是碾压级的。
所以你看,开源和闭源根本不是同一个赛道的东西。闭源卖的是「能力」,开源给的是「主权」。拿跑分去比,是把两个不同维度的事硬按到一个尺度上量。
闭源那几堵墙,短期还拆不掉
说完开源的好处,我也得诚实地说,闭源有几个地方短期内开源追不上。
最前沿的能力,这点最明显。每次能力天花板的突破,几乎都是闭源先打出来的。从长链推理到深度多模态理解,新范式都是闭源先趟出来,开源跟在后面半年到一年才追上。你如果就是要用最猛的那个,现阶段没得选。
易用性是第二堵墙。闭源开箱即用,注册就能调,文档清楚,SDK 完善,出问题有客服。开源你得自己部署、调参、处理各种环境地狱,光搞定一个分布式推理框架就能耗掉一个工程师一两周。小团队的隐性成本很高,你得养得起懂这块的人。
第三是稳定性。闭源 API 有 SLA,偶尔抽风但整体可靠。开源自部署的稳定性,完全取决于你的运维水平,显卡过热、显存爆了、推理框架有 bug,全是你的事。我见过好几个团队图省钱上开源,运维成本比省下的 API 费用还高,最后灰溜溜换回闭源。
这几堵墙不是不可逾越,但短期内还拆不掉。承认这个不丢人,这才叫客观。
给普通人和小团队的选型建议
聊到最后,给点落地的。
如果你是个人开发者,写写代码、搞搞副业、折腾着玩,别纠结,两个都用。日常用闭源图省事,数据敏感或想深度定制就上开源。现在很多工具支持多模型切换,别把自己绑死在一条船上。
做小公司的,先算一笔账。核心场景对隐私多敏感,调用量多大,有没有懂模型部署的人。这三个问题答完选型就清楚了。隐私要求高、调用量大、有技术人,上开源。反过来闭源更省心。
最关键的一点,别只看榜单。我现在看那些跑分排行榜越来越不信。榜单测的是「单轮峰值能力」,但你实际用的时候,决定体验的是「稳定性和错误率」。一个榜单上低两分的模型,如果输出更稳、幻觉更少,实际用起来反而更顺手。这个只有你自己跑了才知道。
我自己的做法是,拿真实的业务 case 做小规模盲测。别告诉团队哪个是开源哪个是闭源,让他们用体感打分。你会发现,结果经常和榜单对不上。那个对不上的地方,就是你的真实答案。
说真的,开源追没追上闭源,这个问题本身可能就问错了。它假设这是一场赛跑,有终点有排名。但实际是,它们在长成两种不同的东西。闭源往「最强通用大脑」卷,开源往「最灵活的私有基建」长。一个是租来的超级跑车,一个是自己手里的改装车,你没法说谁比谁好,只能说你的场景需要哪一辆。
一年前我判断开源还差一年半,现在我修正一下,在它擅长的领域,它已经到了。在它还不擅长的地方,可能还要再等。但趋势很明确,开源在变强,而且速度比闭源愿意承认的要快。
这个判断我觉得挺重要的。因为对很多人来说,选型的窗口期,可能就在这两年。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。
/ 作者,词元Max
评论区
暂无评论,快来抢沙发吧