ICLR'24 大语言模型智能体最新研究进展
来来来,坐下,我给你讲个故事。
去年,ICLR 2024的论文列表一出来——98篇智能体相关的论文!你知道吗,光是标题带“Agent”的,就占了将近四分之一。
我第一反应是什么?兴奋啊,骨头都轻了二两。
因为——我从去年就开始搞LLM智能体了。踩过的坑,比走过的路还多。我以为,这群聪明人终于要来对付那些真问题了。
结果呢?
一篇篇读完,再亲手把几个代码跑了一遍之后,心态直接炸了。
你猜怎么着?绝大多数论文,就是把大模型当乐高搭。搭出来的东西,远看像个变形金刚,近看……一用力,塌了。
1. 智能体能力:花架子堆上天,地基还在原地转圈
40篇智能体能力的论文里,最火的无疑是“推理”。
有的论文让Agent自己给自己下指令(Agent Instructs LLMs),有的搞目标分解(OKR-Agent),有的弄多智能体开会(AutoGen),还有的搬出专家链来解运算题(Chain-of-Experts)。
每篇都说,自己在某个benchmark上涨了几个点。涨了吗?好像涨了。
但你知道吗,我拿AutoGen来试——开源框架,版本0.2.x,按官方文档搭了两个智能体。一个负责写代码,另一个跑代码。
我脑袋里想的画面是:两个AI专家,你一言我一语,默契配合,搞定任务。
现实呢?
俩Agent跑了30轮,还在互相道歉。
一个说:“不好意思,我改一下。”
另一个说:“没事没事,你改,我等你。”
死!循!环!
我手动把进程杀了。改了参数,加了终止条件,总算让它把一些简单SQL查询跑通了。结果呢,我一说“分析这个Excel异常数据并写个报告”——嚯,又进去开始绕圈。
你说这叫智能?
说到OKR-Agent,分层协作的逻辑听着确实合理:高层定目标,低层动手干。但我用GPT-4跑了人家的开源代码,发现了致命问题。
目标分解那一步,全在赌LLM对任务的理解。
只要任务边界稍微模糊一点——比如“帮我研究一下量子计算的近期突破”——分出来的子目标,不是重叠就是遗漏。完全没有自我修复机制。
说白了,上层LLM一动脑子就犯错,底下执行层再完美,那也是“将错就错,越跑越偏”。
还有Chain-of-Experts,专门解决运筹学问题。思路挺酷:多个专家模型协作。
但仔细一看,这堆专家模型需要你先预训练一堆小模型,然后让LLM去调度。我问你,这和传统专家系统的区别在哪?
无非是把那个“调度中心”从代码换成了大模型。
更扎心的是,我去翻他们的数据集,全是运筹标准题。一旦换了实际问题,比如物流调度加上实时路况……崩了。
我想说的就是:这些论文,在纸面上画了漂亮的框架图。但核心依赖的,依然是底层LLM那点推理质量。
LLM自己逻辑都站不稳,往上叠Agent,那不是叠Buff,那是叠错误。
2. 智能体应用:你光顾着修路,路太窄啊
聊到应用方向的25篇论文,几乎全扎堆在数学推理、定理证明、博弈这几个赛道。
先说ToRA——Tool-Integrated Reasoning Agent。这名字一出来,让我挺期待。
它的思路是:在数学题上无缝结合自然语言推理和工具调用。先写推理,再调计算器或代码执行,最后整合结果。
我拿了五道考研数学题去试它。
三道在工具调用环节出了幺蛾子。
有一道题,让GPT-4算定积分。它调用了Symbolic Python库,结果——输入格式写错了。
库:报错。
GPT-4:好的,我重新推导一遍。
算出来:还是错的。
工具集成是集成了。但模型的解析能力和异常处理,弱得让人心疼。
你想想,连打个架都要靠别人指路的拳手,你怎么指望他灵活应变?
再来说COPRA,做形式化定理证明。
这活儿太难了。要把自然语言翻译成形式语言,比如Lean。论文说是“表现优异”,我仔细一看——哪是什么定理证明?本质上就是翻译工作:把人类写的定理描述,转成形式化版本。
大模型做文本翻译都经常出错、漏翻、乱翻。你让它翻译数学逻辑?
我去看了它的输出样例。简单定理,没问题。复杂一点——漏步骤,直接跳结论。
Suspicion-Agent用GPT-4玩不完全信息博弈,比如德州扑克。
论文说,GPT-4能通过“心智理论”推断对手策略。
我信。但它用的是GPT-4啊,成本高得能上天。而且,实验室环境下的对手,行为模式简单得跟初学者一样。真牌桌上呢?一堆人又是诈唬,又是随机策略,GPT-4那点推理能力,根本不够看。
说到这儿,我倒是想起北大张航课题组用大语言模型做心理侧写的一个工作。人家发现,模型能从数据中重估人类心理特质网络,甚至能过滤噪音。那篇发在近期的会议上,和ICLR 2024的节奏完全不同。
我就在想:为什么ICLR 2024的应用论文,都是“用Agent解决X问题”这种功能导向?“Agent到底有没有理解X”这种更本质的问题,就没人问?
3. 有人说这是AGI的雏形,我不同意
我知道,肯定有人要反驳了。
“你懂什么!这些研究代表了Agent从规划到执行再到反思的完整闭环,是通往AGI的必经之路!”
方向我认。但具体到ICLR 2024的这些论文,离AGI?还差着十万八千里。
很多系统,就是把RAG、工具调用、多轮对话这些现成模块重新打包,然后贴上“Agent”的标签。听起来很多,拆开一看,还是那几样东西。
核心瓶颈,一个都没解决。
记忆持久性、规划鲁棒性、行为一致性,这些核心问题一个都没解决。
打几个问号你试试?
你让Agent执行一个持续一周的任务:“每天帮我监控服务器日志,发现异常发邮件通知我。”
现在的Agent——做不到。
会话上下文一结束,它压根不记得自己昨天干了什么。论文里说的“记忆”,无非是向量数据库检索。但检索出来的东西有时候自己都对不上,更别提做时序推理了。
还有评估。
各家用各家的benchmark。有的拿QA数据集测,有的拿游戏环境测,有的自建场景。怎么说呢?论文里涨了5%,但换个场景直接打回原形。
说白了,这还是一个“比谁prompt写得好”的阶段。
4. 所以,我的建议是:别卷框架了,先回到底层
这98篇论文,我最大的感受是什么?
大家太热衷设计Agent的外壳,却忽略了大模型这个引擎本身。
所以,想搞Agent研究的朋友,我建议你多关注几个基础问题——模型的自省能力、长依赖推理、统一的评估环境。
先说自省能力:Agent犯错了,能不能真正识别错误原因?不是靠随机重试去蒙。
长依赖推理也一样:Transformer架构在长上下文上的推理都还没搞扎实,Agent却偏要跑多步推理——那不是火上浇油吗?
评估环境就更别提了:社区需要一个像gym那样的标准化Agent评测环境,而不是各立山头的花架子。
我自己现在的做法是什么?
少用那些花里胡哨的Agent框架。老老实实先把单一任务的推理链打磨稳。
比如我做一个数据清洗Agent,做法很笨:让LLM先生成详细的步骤规划,每一步都输出中间结果。然后用外部检查器验证,出错就中断。不加多智能体。不加协作。
效果呢?反而更可控。
至于ICLR 2024的智能体论文,我会把它们当成什么?
一份“思路清单”。不是现成的解决方案。
别急着往产品里搬。先让子弹飞一会儿。等底层模型更强了,这些框架才有用武之地。
最后给想入门Agent的朋友一句掏心窝子的话:
从头实现一遍ReAct——虽然它是前几年的工作,但你把它的交互逻辑跑通一遍,学到的东西,比看十篇框架论文都要多。
老老实实,先把Reasoning和Acting的交互逻辑吃透。再去看分层、多智能体那些有的没的。
毕竟,地基都没打牢就想着盖三楼——那是给自己添堵。
记住了吗?别用浮华的框架,掩盖核心的短板。
读者评论 4