新紫光前沿技术研究院发布的“紫弦”架构,将三维近存计算(PNM)的物理实现路径直接锚定在3.5D异质集成方案上。该架构摒弃传统2.5D封装依赖的硅中介层长距离布线,以3D DRAM垂直堆叠为核心,将逻辑计算单元与存储阵列在硅片层级进行异构键合。垂直维度的直连重构了芯片内部数据通路,物理走线距离的大幅压缩使存储带宽突破30TB/s。 横向对比当前行业主流的HBM4方案,30TB/s的峰值带宽在同等封装体积下实现了容量与吞吐的双重冗余。大模型训练与推理阶段的算力闲置,本质是数据供给速率滞后于计算单元消耗速率。“紫弦”通过近存计算模式,将部分权重加载、激活运算与矩阵预处理下沉至DRAM底层逻辑层。配合3.5D垂直互连的高密度TSV通道,数据跨层级搬运次数呈指数级削减。架构级优化将访存延迟上限压至传统方案的1/18,从物理链路层面切断了“算力等数据”的循环瓶颈。 技术路径的拆解同步兼容了国产供应链的量产条件。该3.5D集成方案未绑定海外CoWoS类先进封装产能,而是基于国内已验证的混合键合与硅通孔工艺节点进行底层适配。在维持30TB/s高吞吐指标的同时,架构具备绕开外部产能限制的规模化交付能力,为国产AI算力集群提供了一条参数对标、路径可控的底层替代方案。 新紫光“紫弦”三维化近存计算架构示意图,展示3.5D异质集成与高带宽数据通路设计 物理链路的优化最终需转化为可量化的算力输出指标。在PNM近存计算模式下,数据搬运路径的缩短不仅体现在30TB/s的峰值带宽上,更直接映射为访存延迟的实质性压缩。新紫光公布的仿真数据显示,该架构将访存延迟上限压降至传统存算分离方案的1/18。延迟的断崖式下降,有效消除了大模型推理过程中计算单元频繁空转等待的瓶颈,使数据供给速率与算力消耗速率实现动态匹配。 针对大语言模型生成场景的横向模拟测试中,团队在同等算力预算下将“紫弦”架构与英伟达B200系列进行对标。B200仍依赖HBM与GPU核心间的2.5D互连,片外缓存访问与长距离信号传输不可避免地引入微秒级延迟波动。而“紫弦”通过3.5D垂直堆叠将权重预取与注意力机制的部分计算逻辑下沉至DRAM底层,关键数据访问路径从片外跳转至近存逻辑层,大幅降低访存指令队列的堆积率与总线仲裁开销。 模拟结果表明,在相同功耗与算力约束下,“紫弦”架构的词元(Token)吞吐率较B200高出1.5倍以上。这一性能增益并非依赖单一制程微缩,而是通过近存调度策略将原本消耗在数据搬运上的时钟周期转化为有效计算时间。对于千亿参数模型的实时推理与长上下文处理而言,吞吐率的跃升直接意味着单卡可支撑的并发会话数成倍增加,显著压降了AI服务端的单位算力成本。该数据验证了近存架构在突破内存墙方面的工程有效性,也为国产AI芯片在高端推理市场提供了明确的性能对标基准。 架构的性能优势需依托可控的供应链与配套工具链方能转化为商业交付能力。针对先进封装产能受限的行业痛点,“紫弦”架构的3.5D异质集成方案在设计初期即完成与国内主流晶圆厂及封测产线的工艺对齐。该路径未绑定海外CoWoS类产能,而是基于本土已验证的混合键合与高密度硅通孔技术栈进行底层适配。通过优化微凸块间距与热应力分布模型,3D DRAM垂直堆叠在现有国产产线上已具备稳定的良率爬坡条件。硬件制造通路的本土化,使架构在维持高吞吐指标的同时,绕开了外部产能制约,具备规模化集群交付的物理基础。 量产路径的打通由全栈研发工具的迭代进一步加速。新紫光旗下AT公司发布的芯片设计智能体“紫灵”,已深度适配近存计算架构的底层数据流特征。工程实测表明,该智能体可将RTL代码的自动生成与逻辑优化效率提升120倍,大幅削减人工验证迭代周期,使单芯片研发总投入直接降低50%。在系统组网层面,LT与GT公司联合推出的南北向全栈算力互联方案,补齐了从单卡到机群的通信协议栈,实现国产节点的高效互联。产线工艺适配与AI辅助设计工具的协同作用,将“紫弦”架构从流片到商用部署的周期显著压缩,为国内大模型算力集群提供了一条参数对标、成本可控且供应链安全的落地路径。