ICLR 2026 Efficient Agent 阅读笔记 -
- -
跟你说个事儿,特别有意思。
你知道古代打仗,最怕什么吗?不是敌人太强,是每次开战都得重新练兵。
将领带兵,打完一场,部队解散。下一场,新兵蛋子从头教。粮草、排兵、经验,全浪费了。
这叫“每战从零开始”。
现在,AI智能体也掉进同一个坑里了。
我们一直以为,让AI变聪明,就是让它学得更多、算得更快。但ICLR 2025一篇论文,戳破了一个反直觉的真相:智能体的问题,不是“不够聪明”,而是“太会忘”。
你看,一个模型接到新任务,得重新理解上下文、重新规划步骤。思维链动辄几千上万个token。数学题、代码题,确实答对了,但消耗的算力,够你翻几本书了。RAG系统也是,检索粗了质量差,细了延迟崩。
这就好比一个厨师,每次做菜都要翻菜谱、问菜名、查火候。累不累啊?
这篇论文给出的解法,特别像部队里的“特种兵制度”——Stateful Persistent Specialist,有状态、永久存储的专家。
你猜怎么着?它不再让模型每次从零搭建解决方案,而是提前训练一批深度专业化的“专家模块”。这些专家是“有状态”的,干完一次活,经验不丢;“永久”的,下次还能直接用。
比如编程任务,系统不用从头思考,直接唤醒一个内置了完整代码模式的编程专家。它不会贪婪地瞎调用工具,也不会无效探索。
换句话说:让专业的人干专业的事,别让天才每次都当学徒。
这个框架的精髓,是两条腿走路:
离线阶段——分析海量任务,找出哪些能力值得变成“常设专家”。像知识蒸馏,把通用能力拆成可复用模块。
在线阶段——新任务来了,一个轻量级路由策略,像项目经理一样,快速匹配最优专家组合,微调团队协作方式。
它不是孤岛。和A²FM路由、GraphPlanner这些方法联手,还能进一步减少冗余。学术界正在形成一个共识:智能体的未来,不是造一个全能超人,而是建一个模块化专业团队。
更妙的是,它从多个维度掀了效率革命:
- **训练层面**:局部专业化训练,比端到端全能模型更可控、更高效。E-GRPO、WebWeaver这些工作,也都在同一方向发力。
- **推理层面**:你还记得那种“过度思考”吗?模型生成长篇大论的验证和回溯。现在有了预训练专家,核心推理路径大幅压缩,不必每步都重新证明自己是正确的。
- **评估层面**:传统的AstaBench、Gaia2只看效果,不看花费。论文说,必须改了——**以后不能只看“答对了没有”,还要看“花了多少资源”。**
当然,追问也不少。
专家怎么发现?自动聚类还是人工定义?遇到全新领域,是快速适应还是重训?Stateful专家怎么防止遗忘旧知识?
落地更难。离线培养专家需要大规模算力,在线路由需要低延迟调度。C端产品、高并发场景,扛不扛得住?
但至少,一条清晰的路已经出来了。
**
读者评论 4