创新日报

不切晶圆的芯片怪兽:一块果盘大小的硅片,凭什么拆掉英伟达绕不过的墙

一块21.5厘米见方的硅片,不切割,直接当芯片用。上面塞了4万亿个晶体管和90万个核心。这不是实验室里的概念验证品,是成立于2015年的AI芯片公司Cerebras Systems已经量产出货的WSE晶圆级引擎。全行业都在把晶圆切成邮票大小的裸片再拼装,唯独它反着来。

希鸥网观察到,英伟达B200的HBM带宽跑到8TB/s,已经摸到物理极限。而Cerebras把44GB SRAM直接铺在计算单元旁边,片上带宽达到21PB/s,读取延迟不到1纳秒。它没在英伟达的战场硬碰硬,而是绕到侧翼,把推理场景里的“内存墙”直接从架构上拆了。

要理解这道墙有多厚,算一笔账就够了。Llama 70B模型跑FP8精度,权重从HBM搬运一次耗时8.8毫秒,GPU实际计算只花0.028毫秒。99.5%的时间,计算单元在等数据从走廊那头挤过来。这不是设计缺陷,是冯·诺依曼架构在AI推理场景下的结构性天花板。

英伟达的解法是“拼团”。反正搬运一次权重的时间已经花了,顺手把上百个用户的请求一起算了。但每个用户的对话记忆KV Cache是私有的,B300装完模型只剩217GB显存,一张卡最多同时服务167个8K上下文用户。拼团到167就撞墙,首字延迟和字间延迟在抢资源中进一步恶化。

于是英伟达在VR200中玩起解耦推理:Prefill交给Rubin CPX,Attention继续用通用GPU,FFN权重塞进Groq的LPU片上SRAM。思路是把不同计算特征的环节拆到不同硬件上。但KV Cache仍在HBM,22TB/s的带宽天花板纹丝不动。这套组合更适合长上下文加高交互的大MoE场景,短对话场景下反而浪费。

希鸥网认为,Cerebras真正的护城河不在台积电的制程,在三个环节的独家能力:单核0.05平方毫米的微架构设计、84个die跨划片槽缝合的容错逻辑、以及把整片晶圆当一颗芯片封装的工艺。它用极端的技术路线锁定了极端细分的客户——愿意为低延迟付溢价的场景。英伟达卖的是通用算力,Cerebras卖的是速度特权。

这给硬件创业者一个清醒的提醒:公平与慷慨是两回事。你不能把对部分客户的高成本服务当成所有客户应得的标配。Cerebras从第一天就清楚,晶圆级方案的成本结构不支持它覆盖全部推理场景。放弃短上下文低交互的通用市场,聚焦长上下文高交互的窄门,这不是能力不足,是战略克制。

还有一个容易被忽略的细节:Cerebras跨die走线的掩膜版设计规则,是台积电专门提供的,不在标准PDK里。这意味着双方建立了一种超越普通代工关系的深度协作。当公司规模不大时,这种基于共同目标的伙伴关系反而比大厂的标准化采购更有效率。组织膨胀会稀释这种关系,硬件创业尤其如此。

与台积电深度绑定并非没有代价。设计迭代节奏必须对齐台积电的工艺节点,跨划片槽走线的良率风险由自己扛。但有些底线不能妥协,比如对缺陷核心的绕行机制,必须在设计阶段就预埋冗余,而不是等流片后补救。芯片创业和所有硬件创业一样,在供应链的讨价还价中,有些事可以让,有些事必须自己扛到底。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:sheisceo

阅读量:1373
阅读时间:3分钟