← 返回资讯
赵一鸣
产品评测编辑
已审核

每秒处理22万条日志,准确率0.98,这套系统把正则匹配干掉了

我见过。2022年冬天,凌晨3点12分,手机屏幕亮起来的那一刻,心脏直接漏跳一拍。线上事故,日志疯狂报错,人还是懵的就得开始翻正则表达式。那会儿我们团队自建了一套日志解析系统,纯手工写规则,上线第一周准确率——70%出头。

每秒处理22万条日志,准确率0.98,这套系统把正则匹配干掉了

每秒处理22万条日志,准确率0.98,这套系统把正则匹配干掉了


你见过凌晨三点的告警电话吗?

我见过。2022年冬天,凌晨3点12分,手机屏幕亮起来的那一刻,心脏直接漏跳一拍。线上事故,日志疯狂报错,人还是懵的就得开始翻正则表达式。那会儿我们团队自建了一套日志解析系统,纯手工写规则,上线第一周准确率——70%出头。

改规则改到崩溃。

所以刷到ByteBrain那条消息的时候,我盯着屏幕数了三遍零。10个亿。字节跳动ByteBrain团队,三年省出来的真金白银。2025年前四个月,11篇顶会论文——SIGMOD 3篇、VLDB 4篇、EuroSys、FSE、WWW、ICLR各一篇。做AI for Infra这个方向,能在数据库和系统顶会这么密集地发论文,本身就很说明问题。

但论文只是副产品。

我认识几个在字节做基础架构的朋友,他们跟我说过一个细节。火山引擎的oncall系统接入ByteBrain之后,重要告警处理效率提升了26%。你想想,凌晨三点被叫起来处理线上事故,AI帮你把根因分析出来、给出修复建议——这26%的提升背后,是多少人的睡眠时间。

讲真,我酸了。

后来看到ByteBrain-LogParser的论文,更酸。每秒处理22万条日志,准确率0.98。

绝了。

这个差距不是多写几条正则能追上的。他们的做法分两阶段——离线训练用层次聚类建模板树,在线匹配用哈希编码加速。核心创新包括位置相似度距离、饱和度评分机制这些东西。说白了,就是把日志解析从规则工程问题,变成了聚类加匹配的算法问题。

我试着重现他们的方案——不对,应该叫策略——在自己公司的日志系统上跑了一下。预处理阶段分词、替换变量、去重、哈希编码,初始分组基于长度和前缀,然后层次聚类迭代分裂。在线匹配只存模板文本,不做复杂计算。

处理速度确实快了一个数量级。

但最让我意外的不是速度,是泛化能力。他们在LogHub和LogHub-2.0两个数据集上分别拿了0.98和0.90的准确率,接近SOTA水平。而速度比最快的基线方法快840%。

840%。这数字我反复确认了三遍。

真的假的?!

另一个让我觉得挺有意思的,是他们的VMR²L系统,做虚拟机重调度的。传统做法要么用启发式算法——速度快但效果差——要么用MIP求解器,效果好但慢得要死。他们的思路是在推理阶段采样多条轨迹,只执行奖励值最高的那条。训练时探索多样策略,推理时选优执行。

这个思路其实不复杂。但实验效果很扎实。常见规模集群下,碎片率接近MIP的最优解,推理延迟控制在秒级。而且泛化能力很强——即使模型只在低负载场景训练,在高负载场景下依然能保持较低的碎片率。混合负载训练效果最好,这个符合直觉。

但真正让我感慨的是另一件事。

字节在AI基础设施上的投入规模。2025年资本开支预算1500亿,2026年据说是1600亿。超过一半用来采购英伟达芯片和推进自研芯片SeedChip。豆包大模型的日均Token调用量已经到50万亿了。

50万亿。

这个量级的算力消耗,如果不做系统层面的优化,烧钱速度能把任何公司拖垮。ByteBrain这三年省下的10个亿,放在1500亿的盘子里——大概是千分之六左右——好像也不算多。

但账不能这么算。

系统优化是乘法效应。你省下来的每一分算力成本,都会在所有业务线上被放大。火山引擎对外卖云服务,成本低一点,定价就能更激进一点。豆包视觉理解模型千tokens输入价压到3厘,1块钱能处理284张720P图片,创了行业新低。这背后如果没有Infra层面的极致优化,光靠烧钱补贴是撑不住的。

你品,你细品。

我前阵子还看到字节内部有个限期,6月30日前要用TRAE替换Cursor等第三方工具。6月12日公布月活破百万,85%的新代码出自AI。7月开源TRAE-Agent核心,多模型任意接。7月21日2.0版本"SOLO"升级,需求一句话直接变可跑应用。国际版首月3美元,之后10美元每月。

比Cursor便宜一半。这打法我太熟了。

先用内部场景把产品打磨到能打,再开源核心能力建立生态,最后用价格优势抢市场。和ByteBrain做的事情逻辑一样:内部降本增效是第一步,论文和开源是第二步,对外商业化是第三步。整条链路清清楚楚。

有个细节我印象很深。ByteBrain团队跟ABase——字节自研的NoSQL数据库——合作做扩缩容时,算法工程师没有只提供API就完事,而是从0到1把整套链路都搭起来了。数据采集、算法预测、扩缩容建议、消息预警、大盘展示。

这超出了一个算法工程师的职责范围。踩过坑的人都懂,搭链路比写算法痛苦十倍。

但上线后紧急扩容工单降低了60%,缩容节省了3亿成本。论文也被SIGMOD 25收录了。

把论文写在大地上。这话说起来容易,真做起来需要沉得住气。

他们还有个工作挺有开创性——用预训练语言模型做NDV估计,不需要采样数据就能预测不同值的数量。这是领域内第一个基于语言模型做NDV估计的工作,发表在SIGMOD 25,正在集成到生产环境。ChatTS也很有意思,跟清华合作的时序多模态大语言模型。即使给Agent配"完美工具",在多变量任务和推理任务上还是不如ChatTS。

这说明什么?

说明模型本身在理解时序数据的语义上,已经超过了"调用工具拼凑答案"的模式。这个结论如果成立,对AIOps的影响会很大。毕竟现在大部分异常检测和根因分析方案,本质上还是在用Agent调用各种工具链。整活儿整了半天,可能方向就偏了。

扯远了,说回正题。

字节在AI for Infra这个方向上的投入,从论文产出看已经形成了体系化的能力。AIOps、AI4DB、运筹优化、LLM4Infra四个方向,覆盖了容量规划、资源调度、系统调参、异常检测、根因分析、慢SQL优化、Text2SQL、LLM-Agent这些模块。2025年Seed团队在ICLR、ICML、CVPR三大会议合计发了约60篇论文。AI Lab全部并入Seed后,正式员工超过300人。原Google DeepMind副总裁吴永辉加入接管Seed部门,打破了模型部门间的藩篱。

字节的野心已经不只是做应用层的AI产品了。

他们要的是从自研芯片SeedChip、到大模型Seed体系、到云服务火山引擎、到C端产品豆包的全栈能力。2026年计划量产10到35万片自研推理芯片,已跟三星洽谈代工。1600亿的资本开支,超过一半砸在芯片上。

这事儿让我想起张一鸣2023年说的那句话——当下这个时代的操作系统级机会就是AI加计算。三年过去了,字节的布局已经从软件层渗透到了硬件层。

而ByteBrain这10个亿的降本,只是这张大棋盘上的一个小角落。

真正的战场在更底层。

省下来的每一分钱,最后都会变成子弹打回去。

612
12251 阅读
5 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月27日 12:44

赵一鸣

产品评测编辑

前产品经理,现专注 AI 工具评测。实测过 30+ 款 AI 产品,擅长横向对比和用户体验分析。

读者评论 5

Dev小王 2周前
终于有人把这个说清楚了,收藏了。
回复 点赞 (8)
A
AI研究员 3天前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 6天前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)
老李 1周前
有个小问题想请教,文中提到的那个方案在大规模场景下性能怎么样?
回复 点赞 (5)
运营小陈 1周前
转发到团队群了,大家都觉得有参考价值。
回复 点赞 (4)