← 返回资讯
陈默
AI 行业分析师
已审核

大语言模型推理加速:硬件视角的解析

从BERT刚出来那会儿,大家抢V100跟抢春运火车票似的,到如今遍地H100,所有人像疯了一样囤GPU。你随便刷个科技群,十个有八个在问:“H100哪儿能买到?多少钱?”

大语言模型推理加速:硬件视角的解析

大语言模型推理加速:硬件视角的解析


我跟你讲个真事儿。

我写AI硬件专栏,整整十年了。

从BERT刚出来那会儿,大家抢V100跟抢春运火车票似的,到如今遍地H100,所有人像疯了一样囤GPU。你随便刷个科技群,十个有八个在问:“H100哪儿能买到?多少钱?”

可是,买到了又怎样呢?

我说句大实话吧——你花几十万弄回来的H100,大部分时间就是个演员。它在那儿呼呼转,显存通道一大半都在空转,真正干活的工位,不到一半!

这事儿搁谁身上不心疼?

来,今天就跟你好好唠唠。从我这十年踩坑、炸机、熬夜调参的血泪史出发,到底什么硬件最值得你关注。


核心观点,我先甩在这儿,你接好了——

大模型推理加速,你要是死盯着GPU不放,那就是在往死胡同里钻。

真正聪明的做法是什么?是吃透每一块芯片的脾气秉性,把活儿分得明明白白。

你想想,一个7B模型,半精度就要14GB显存。你要是跑个70B,还带长上下文——单卡?塞不下!这时候你疯狂堆GPU,一点儿用都没有。为啥?因为瓶颈早就从“算力”悄悄溜到了“内存带宽和容量”头上去了。

我去年拿8卡H100跑70B模型(单卡确实塞不下),batch size从4提到8,你猜怎么着?decode token/s直接给砍了一半!

为啥?

KVCache把HBM带宽吃得干干净净。FlashAttention这些优化?能缓解,但解决不了根本问题。

速度,就是这么被活生生拖死的。


说到这儿,有意思的事来了。

很多人不知道,FPGA这几年已经偷偷摸摸摸上来了。

素材里那个TeLLMe团队,在AMD KV260边缘平台上跑三值LLM,功耗才7W——你猜结果多少?9 token/s!

我当时看到这个数据,真的打了个激灵。

我虽然没亲手烧过FPGA,但专门把他们的论文找出来读了。他们把1.58bit权重和8bit活性值的预填充、自回归解码,直接在硬件上铺开了。

没有指令解码的开销,也不会造成cache污染。延迟是确定性的,算一秒就是一秒。

TerEffic更猛。在Alveo U280上跑Llama-7B,干到290 token/s,功耗才46W。

你知道同性能的GPU要干到多少瓦吗?

少说300W。

这对于边缘设备、物联网场景——就是降维打击啊。


当然,肯定有人要撇嘴了。

“你一个写专栏的,别忽悠人。FPGA开发难到飞起,我干嘛不老老实实用GPU?”

我承认,你说得对。早期我踩过HLS的坑,搞个矩阵乘法优化了两个月,性能还不如一个CPU——那种挫败感,真的,想摔键盘。

但那都是过去式了。

现在的AWQ量化加轻量级工具链,已经成熟了。板载Qwen2.5上FPGA跑量化模型就是个活生生的例子:0.5B模型在KV260上,5.1 token/s。不快,但在6.5W功耗下,这已经香得不行了。

关键是——FPGA可重构啊。模型换了,不用换硬件,重新配置一下就行。

灵活性和效率,两头都占了。


但要说FPGA万能,也不对。

另一个被人严重低估的选手,是CPU。

我去年写《CPU-GPU协同加速大模型推理》的时候,拿Intel第四代至强SPR的AMX做了测试。原来想法很简单:CPU嘛,慢吞吞的,就是个内存仓库。

结果AMX这些矩阵加速单元,是真的认真。

我参考的那篇IEEE论文,把OPT-30B不同层按计算强度和内存需求分成两类:高内存但低计算强度的层,甩给CPU。

结果呢?PCIe数据传输量大幅减少,单次推理延迟降低了12.1倍,吞吐增加了5.4倍。

你说气不气人?

当时我自己也赶紧复现了一把。

刚开始图省事,把活全offload到CPU——结果慢成PPT,我差点以为自己写了个木马程序。

后来一分析,发现attention部分放CPU最划算,因为它需要大量访存、计算简单。而MLP的矩阵乘,还是得留在GPU乖乖干。配合DeepSpeed-Inference的混合并行,一台8卡A10的机器,硬生生跑出了接近4卡H100的吞吐。

成本省了一大截。

我群里朋友都问我是不是搞了什么魔法——

不是魔法,是懂硬件。


再给你说一个我今年年初才玩儿明白的:投机采样(speculative decoding)。

之前踩的坑太典型了。随便拉个500M的小模型,给7B的大模型当draft——结果接受率才30%,还不如硬跑。我当时就懵了,这玩意儿到底靠不靠谱?

后来换了跟目标模型同家族、同tokenizer的小模型,比如1.5B draft 13B,配合k=4的采样窗口——性能直接翻倍。

这事儿说明了什么?

加速不是堆参数,是要搞清楚整个计算图的瓶颈到底在哪。是内存带宽?是延迟?是利用率?

不同场景,解法完全不同。别幻想一个方案通吃所有。


有人可能要怼我了:你说了这么多,FPGA也没见广泛用啊,CPU当然比GPU慢,你这不是纸上谈兵吗?

我承认,通用性确实是FPGA的短板。H100随便一个量化工具,半小时就让你跑通了。FPGA你得写RTL或HLS,还要面对不同的开发板,光环境配置就能搞一天。

但反过来想想——

现在大模型推理,早就不存在一个方案打天下的情况了。

云端高吞吐,就靠GPU配合FlashDecoding++这类优化;边缘追求低功耗,可以用FPGA或NPU跑量化模型;移动端还有“LLM in a flash”的思路,靠闪存按时加载。不同场景各有各的解法。

NVIDIA自己都在推Grace-Hopper,把CPU与GPU高速互联。

你看,这就是趋势。


我写了十年,最大的感受就一句话——

别想着买一块卡,解决所有问题。

花点时间,搞懂你的业务场景。到底要低延迟还是高吞吐?峰值请求有多少?功耗墙在哪?预算多少?

然后老老实实算算每token的能耗比和成本。

大多数人的真实场景,真的不需要H100。

两年前我带一个团队做对话机器人,老板非要上H100,说不能落后。我硬顶下来,用了4卡T4加CPU offload,通过改进连续批处理和KV Cache优化,最后支撑了日活十万用户。

单卡功耗才75W。电费省了一大笔。

我到现在还记得运维小哥看电费账单时那个表情——

不是兴奋,是那种“终于可以睡个好觉了”的踏实感。

别光迷信硬件,别盲从厂商的宣传。理解原理,踏踏实实踩过坑,才知道什么最适合自己。

我是说真的。

真正的厉害,不是买最贵的卡,而是用最合适的卡,把每一分钱都烧在刀刃上。

370
9260 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月20日 20:09

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

张工 1周前
写得很实在,特别是实测对比那部分,跟我自己的使用感受一致。
回复 点赞 (12)
前端工程师 2周前
代码示例很清晰,直接用到项目里了。
回复 点赞 (6)