上周三晚上十一点半,我在工位上干了一件挺离谱的事。
我打开电脑,给一个叫Manus的Agent发了句话,我说,帮我把我今年发过的所有公众号文章扒一遍,分析一下哪些选题阅读量最高,哪些标题套路最有效,再写一份分析报告,最后挑出三个我适合在十二月写的选题方向,给我排个优先级。
然后我就去洗澡了。
洗完澡回来,桌面上躺着一份十七页的PDF,标题、配图、数据图表、推荐理由全都齐了。文末甚至还有一句它自己加的评论,说根据近三个月趋势,AI硬件类选题的阅读完成率比模型评测类高出百分之二十三,建议优先选这个方向。
我盯着那份报告看了半天,心情很复杂。一方面是爽,一个我自己干至少要花六个小时的活儿,它二十分钟搞定了。另一方面是有点慌,慌的是这个东西一年前根本不存在,半年前还是个玩具,现在已经开始替我做判断了。
这就是我想跟你聊的事。2026年到底是不是Agent元年,这个问题我看了一圈讨论,发现大多数人都没说到点子上。
先把概念掰开揉碎。所谓Agent,翻译过来叫智能体,跟你过去用的Chat-GPT、跟Kimi、跟豆包,最大的区别是一个字,做。
过去的AI是问答机。你问它什么,它回答什么。它再聪明,也只是个会说话的百科全书。你让它帮你订机票,它会告诉你怎么订,但它不会真的去订。你让它帮你写代码,它写完一段代码丢给你,剩下的调试、运行、报错、修复,全是你自己的事。
Agent不一样。Agent是有手有脚的。你说一句话,它会自己拆解任务,自己调用工具,自己执行,自己检查结果,错了自己再来一遍。整个过程你不用管,它给你的不是答案,是结果。
这个差别看起来不大,但实际上是一道天堑。
举个最直白的例子。你让ChatGPT帮你做一份竞品分析,它会问你要什么数据,要不要图表,要什么风格的语言。你一一回答之后,它给你一段文字。然后你把这段文字粘贴到Word里,自己排版,自己配图,自己改格式。
你让一个真正的Agent干同样的事,它会自己去爬竞品官网,自己抓取应用商店数据,自己调用搜索引擎查最近的新闻,自己写代码生成图表,自己整理成PDF,最后还会顺手给你发到邮箱里。
中间这个过程,全是它自己琢磨的,你只说了一句话。
这种东西在2024年还是个PPT概念。OpenAI的Sam Altman那会儿到处吹Agent,结果GPTs做出来之后大家发现,所谓的Agent就是个加了API的高级Prompt,离能用还差得远。微软的Copilot也好,谷歌的Project Astra也罢,演示视频拍得行云流水,真到用户手里全是bug。
2025年是分水岭。年初Anthropic放出来Claude的Computer Use,第一次让大家看到AI是真的能控制电脑屏幕的,光标点哪里它说了算。三月份Manus那个项目火了一把,虽然后来争议不少,但确实证明了一件事,多Agent协作干一个长任务,这条路是通的。年中OpenAI的Operator、谷歌的Mariner、字节的扣子空间、阿里的通义灵码,一个接一个往外冒。到下半年,Cursor、Cline这些编程Agent已经成了硅谷工程师人手一个的标配。
到了现在11月底,你随便打开X看一看,硅谷那群天天蹲在键盘前的人,已经在讨论怎么让Agent七乘二十四小时不停地给自己干活了。有人晒自己的GitHub仓库,里面90%的代码都是Cursor写的。有人晒自己每个月给Anthropic交两千多美金的账单,因为他同时跑了三十个Claude Code实例在干不同的活。
这种事情放在两年前,是科幻。
所以回到那个问题,2026是不是Agent元年。
我的判断是,元年这个词太轻了。
我觉得2026是Agent从极客玩具变成大众工具的临界点。就像2010年的智能手机,那年之前iPhone已经存在三年了,但真正让你妈也开始用智能手机的,是2010年之后那一波安卓机的普及。Agent现在的状态,差不多就是2009年的智能手机。技术已经成立了,产品形态已经清晰了,差的是把它做成一个不需要说明书、打开就能用的东西。
这件事现在卡在哪儿,我也想跟你说清楚。
第一个卡点是可靠性。
你让Agent帮你订机票,它99%的情况下能订对,但有1%的概率会把你的目的地从上海订成上饶。这种事情在Demo里看不出来,到真实场景里就是灾难。所以现在大部分Agent产品都还在打辅助,不敢真正放手让它独立干活。最典型的就是编程Agent,写完代码必须人类review一遍才能合并,没人敢让它直接推到生产环境。
第二个卡点是上下文。
人干活的时候,背景信息是默认共享的。你跟同事说,把上次那份方案改一下,加上王总昨天提的意见,同事秒懂。但你跟Agent这么说,它一脸懵。它不知道哪份方案,不知道王总是谁,不知道昨天发生了什么。
所以现在的Agent要么需要你把所有背景从头交代一遍,要么需要事先做大量的配置和接入,才能勉强理解你的工作环境。这个问题不解决,Agent永远只能干那些跟你工作流没什么关系的孤岛任务。
第三个卡点是钱。
跑一个高质量的Agent是真的烧钱。Claude Sonnet 4.5现在的价格,一个稍微复杂点的任务跑下来,几美金就没了。你要是让它独立完成一个项目,几十上百美金的账单分分钟出现。这个成本对个人用户来说,根本不可持续。
但有意思的地方也在这里。
OpenAI的GPT-5、Anthropic的Claude 5、谷歌的Gemini 3,这一波模型一上来,单位token的成本都在断崖式下跌。同样的能力,今年的价格大概是去年的十分之一。按这个速度推下去,明年这时候,Agent的使用成本会便宜到你完全感受不到。
这就是为什么我说,2026是临界点。可靠性在涨,上下文在解决,成本在掉,三条曲线一交汇,事情就成了。
讲完国际的,再讲点国内的。
中国这边Agent的发展,我观察下来,跟海外是两条不太一样的路。
海外那边,OpenAI、Anthropic、Google这些公司,是先把基础模型做到极致,然后在模型之上长出Agent。所以你看Claude的Agent能力特别强,因为它的模型本身就特别擅长长程推理和工具调用。
国内这边,模型层不太够看的时候,大家就开始往Agent这边卷了。字节的扣子、百度的文心智能体、阿里的百炼,包括智谱清言、月之暗面、Minimax,每家都在做Agent平台。还有像Manus这种纯Agent创业公司,更是直接All in。
这种打法的好处是,工程层创新做得快,产品体验追得猛。坏处是,底子不够厚的时候,做出来的Agent能力有上限。一个最直接的对比,国内的编程Agent现在还很难独立完成一个中等复杂度的项目,但Cursor配合Claude,已经能干这件事了。
不过事情正在变化。
DeepSeek这一年的崛起,国产模型在推理能力上已经追到了第一梯队的尾巴。通义千问的Qwen系列在开源圈也很能打。最近Kimi K2的发布,长上下文能力已经超过了大部分海外模型。这些底层的进步会很快传导到Agent层。
我个人比较看好的,是国内在垂类Agent上的爆发力。
为什么这么说,因为通用Agent是个特别难的活,要做得好需要顶级模型加顶级工程加大量数据。但垂类Agent不一样,比如说一个专门做电商客服的Agent,一个专门做财务对账的Agent,一个专门做小红书爆款笔记的Agent,这种东西对模型能力的要求没那么高,但对场景理解和工作流打磨的要求极高。
中国人最擅长的就是这个。把一件具体的事,做到极致便宜、极致好用、极致贴合本地需求。这一波Agent浪潮里,我估计真正赚到钱的国内公司,大部分会是做垂类的。
OK,前面铺垫了这么多,最后聊聊跟你最有关系的事。
如果你是个普通上班族,Agent对你意味着什么。
第一件事,你必须开始用。不是用Chat-GPT,是用真正的Agent。比如Cursor,比如Claude Code,比如Manus,比如扣子空间。哪怕你不是程序员,你也得知道这些东西能干什么,不能干什么,边界在哪里。
我说这话不是站着说话不腰疼。是因为我看到的趋势是,未来三年内,那些会用Agent的人和不会用的人,工作产出会拉开十倍以上的差距。这不夸张,我自己今年的内容产量比去年翻了一倍多,靠的就是各种Agent帮我处理掉了大量重复劳动。
第二件事,开始思考你工作的哪些部分是Agent干不了的。
能被Agent替代的工作,本质上就是那些有明确流程、有标准输出、有可衡量结果的活。这些活越来越不值钱,这是必然。
值钱的会是什么呢,是判断力,是审美,是跟人打交道的能力,是把一件模糊的事变成具体方案的能力。这些东西Agent短期内是干不了的,因为它没有真正的目标感,它只能完成你给它的任务,不能告诉你应该做什么任务。
所以你要把自己往这个方向调。少干执行,多干决策。少干生产,多干设计。少干一个人能搞定的事,多干需要多人协作、需要复杂判断的事。
第三件事,别恐慌。
我知道这种话听起来像鸡汤,但我是真的觉得。Agent不是来取代人的,它是来取代任务的。任务被取代之后,人会去做更高一层的事。
就像Excel发明之后,财务并没有消失,他们只是从算账的人变成了分析数据的人。Photoshop发明之后,设计师并没有消失,他们只是从画图的人变成了做创意的人。
Agent来了之后,会发生什么我不知道。但我知道一件事,那些最早学会用工具、并且把工具用出花来的人,永远是吃到红利的那一批。
2026年还有一个月就到了。
如果你问我,这一年最值得投入精力做的一件事是什么,我会告诉你,找一个Agent,把它当成你的实习生,认真带它一年。
到2026年底,你会感谢现在的自己。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,下次再见。
BossAgents