← 返回资讯
苏晴
资深编辑
已审核

ICLR'24 大语言模型智能体最新研究进展

去年,ICLR 2024的论文列表一出来——98篇智能体相关的论文!你知道吗,光是标题带“Agent”的,就占了将近四分之一。

ICLR'24 大语言模型智能体最新研究进展

ICLR'24 大语言模型智能体最新研究进展


来来来,坐下,我给你讲个故事。

去年,ICLR 2024的论文列表一出来——98篇智能体相关的论文!你知道吗,光是标题带“Agent”的,就占了将近四分之一。

我第一反应是什么?兴奋啊,骨头都轻了二两。

因为——我从去年就开始搞LLM智能体了。踩过的坑,比走过的路还多。我以为,这群聪明人终于要来对付那些真问题了。

结果呢?

一篇篇读完,再亲手把几个代码跑了一遍之后,心态直接炸了。

你猜怎么着?绝大多数论文,就是把大模型当乐高搭。搭出来的东西,远看像个变形金刚,近看……一用力,塌了。


1. 智能体能力:花架子堆上天,地基还在原地转圈

40篇智能体能力的论文里,最火的无疑是“推理”。

有的论文让Agent自己给自己下指令(Agent Instructs LLMs),有的搞目标分解(OKR-Agent),有的弄多智能体开会(AutoGen),还有的搬出专家链来解运算题(Chain-of-Experts)。

每篇都说,自己在某个benchmark上涨了几个点。涨了吗?好像涨了。

但你知道吗,我拿AutoGen来试——开源框架,版本0.2.x,按官方文档搭了两个智能体。一个负责写代码,另一个跑代码。

我脑袋里想的画面是:两个AI专家,你一言我一语,默契配合,搞定任务。

现实呢?

俩Agent跑了30轮,还在互相道歉。

一个说:“不好意思,我改一下。”

另一个说:“没事没事,你改,我等你。”

死!循!环!

我手动把进程杀了。改了参数,加了终止条件,总算让它把一些简单SQL查询跑通了。结果呢,我一说“分析这个Excel异常数据并写个报告”——嚯,又进去开始绕圈。

你说这叫智能?

说到OKR-Agent,分层协作的逻辑听着确实合理:高层定目标,低层动手干。但我用GPT-4跑了人家的开源代码,发现了致命问题。

目标分解那一步,全在赌LLM对任务的理解。

只要任务边界稍微模糊一点——比如“帮我研究一下量子计算的近期突破”——分出来的子目标,不是重叠就是遗漏。完全没有自我修复机制。

说白了,上层LLM一动脑子就犯错,底下执行层再完美,那也是“将错就错,越跑越偏”。

还有Chain-of-Experts,专门解决运筹学问题。思路挺酷:多个专家模型协作。

但仔细一看,这堆专家模型需要你先预训练一堆小模型,然后让LLM去调度。我问你,这和传统专家系统的区别在哪?

无非是把那个“调度中心”从代码换成了大模型。

更扎心的是,我去翻他们的数据集,全是运筹标准题。一旦换了实际问题,比如物流调度加上实时路况……崩了。

我想说的就是:这些论文,在纸面上画了漂亮的框架图。但核心依赖的,依然是底层LLM那点推理质量。

LLM自己逻辑都站不稳,往上叠Agent,那不是叠Buff,那是叠错误。


2. 智能体应用:你光顾着修路,路太窄啊

聊到应用方向的25篇论文,几乎全扎堆在数学推理、定理证明、博弈这几个赛道。

先说ToRA——Tool-Integrated Reasoning Agent。这名字一出来,让我挺期待。

它的思路是:在数学题上无缝结合自然语言推理和工具调用。先写推理,再调计算器或代码执行,最后整合结果。

我拿了五道考研数学题去试它。

三道在工具调用环节出了幺蛾子。

有一道题,让GPT-4算定积分。它调用了Symbolic Python库,结果——输入格式写错了。

库:报错。

GPT-4:好的,我重新推导一遍。

算出来:还是错的。

工具集成是集成了。但模型的解析能力和异常处理,弱得让人心疼。

你想想,连打个架都要靠别人指路的拳手,你怎么指望他灵活应变?

再来说COPRA,做形式化定理证明。

这活儿太难了。要把自然语言翻译成形式语言,比如Lean。论文说是“表现优异”,我仔细一看——哪是什么定理证明?本质上就是翻译工作:把人类写的定理描述,转成形式化版本。

大模型做文本翻译都经常出错、漏翻、乱翻。你让它翻译数学逻辑?

我去看了它的输出样例。简单定理,没问题。复杂一点——漏步骤,直接跳结论。

Suspicion-Agent用GPT-4玩不完全信息博弈,比如德州扑克。

论文说,GPT-4能通过“心智理论”推断对手策略。

我信。但它用的是GPT-4啊,成本高得能上天。而且,实验室环境下的对手,行为模式简单得跟初学者一样。真牌桌上呢?一堆人又是诈唬,又是随机策略,GPT-4那点推理能力,根本不够看。

说到这儿,我倒是想起北大张航课题组用大语言模型做心理侧写的一个工作。人家发现,模型能从数据中重估人类心理特质网络,甚至能过滤噪音。那篇发在近期的会议上,和ICLR 2024的节奏完全不同。

我就在想:为什么ICLR 2024的应用论文,都是“用Agent解决X问题”这种功能导向?“Agent到底有没有理解X”这种更本质的问题,就没人问?


3. 有人说这是AGI的雏形,我不同意

我知道,肯定有人要反驳了。

“你懂什么!这些研究代表了Agent从规划到执行再到反思的完整闭环,是通往AGI的必经之路!”

方向我认。但具体到ICLR 2024的这些论文,离AGI?还差着十万八千里。

很多系统,就是把RAG、工具调用、多轮对话这些现成模块重新打包,然后贴上“Agent”的标签。听起来很多,拆开一看,还是那几样东西。

核心瓶颈,一个都没解决。

记忆持久性、规划鲁棒性、行为一致性,这些核心问题一个都没解决。

打几个问号你试试?

你让Agent执行一个持续一周的任务:“每天帮我监控服务器日志,发现异常发邮件通知我。”

现在的Agent——做不到。

会话上下文一结束,它压根不记得自己昨天干了什么。论文里说的“记忆”,无非是向量数据库检索。但检索出来的东西有时候自己都对不上,更别提做时序推理了。

还有评估。

各家用各家的benchmark。有的拿QA数据集测,有的拿游戏环境测,有的自建场景。怎么说呢?论文里涨了5%,但换个场景直接打回原形。

说白了,这还是一个“比谁prompt写得好”的阶段。


4. 所以,我的建议是:别卷框架了,先回到底层

这98篇论文,我最大的感受是什么?

大家太热衷设计Agent的外壳,却忽略了大模型这个引擎本身。

所以,想搞Agent研究的朋友,我建议你多关注几个基础问题——模型的自省能力、长依赖推理、统一的评估环境。

先说自省能力:Agent犯错了,能不能真正识别错误原因?不是靠随机重试去蒙。

长依赖推理也一样:Transformer架构在长上下文上的推理都还没搞扎实,Agent却偏要跑多步推理——那不是火上浇油吗?

评估环境就更别提了:社区需要一个像gym那样的标准化Agent评测环境,而不是各立山头的花架子。

我自己现在的做法是什么?

少用那些花里胡哨的Agent框架。老老实实先把单一任务的推理链打磨稳。

比如我做一个数据清洗Agent,做法很笨:让LLM先生成详细的步骤规划,每一步都输出中间结果。然后用外部检查器验证,出错就中断。不加多智能体。不加协作。

效果呢?反而更可控。

至于ICLR 2024的智能体论文,我会把它们当成什么?

一份“思路清单”。不是现成的解决方案。

别急着往产品里搬。先让子弹飞一会儿。等底层模型更强了,这些框架才有用武之地。

最后给想入门Agent的朋友一句掏心窝子的话:

从头实现一遍ReAct——虽然它是前几年的工作,但你把它的交互逻辑跑通一遍,学到的东西,比看十篇框架论文都要多。

老老实实,先把Reasoning和Acting的交互逻辑吃透。再去看分层、多智能体那些有的没的。

毕竟,地基都没打牢就想着盖三楼——那是给自己添堵。

记住了吗?别用浮华的框架,掩盖核心的短板。

58
1462 阅读
4 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月23日 12:07

苏晴

资深编辑

科技媒体从业 8 年,曾就职于多家科技媒体。关注 AI 创业和投资赛道,采访过 50+ 位行业从业者。

读者评论 4

老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 2周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)
数据分析师 3天前
数据引用很扎实,建议补充一下近三个月的最新数据。
回复 点赞 (9)
产品经理阿杰 6天前
从产品角度看,这个方向确实有机会,但商业化路径还需要验证。
回复 点赞 (15)