
1. 从科研痛点切入为什么 AI4S 会卡在推理这一环这两年 AI4SAI for Science成了科研圈的高频词从蛋白质结构预测到材料筛选、从流体仿真到基因调控AI 模型正在把传统“实验试错”的科研范式改成“先算后验”。但真做过 AI4S 项目的人心里都清楚训练出一个好模型只是万里长征第一步真正让人头疼的是推理阶段——模型训练完了要反复跑推理、做参数扫描、做不确定性分析、在不同数据子集上做验证每一步都在烧算力。而且科学计算场景对推理的要求跟互联网场景完全不同不是简单返回一个结果就完事而是要追精度、追吞吐、追长时间稳定运行。我在实际项目里碰到过这种情况一个分子动力学模型训练只花了三天但后续做全参数空间的推理扫描跑了整整两周还看不到头。训练时可以靠大规模并行堆卡推理阶段却经常面临单卡算力不足、显存带宽受限、框架适配不到位这些尴尬问题。更麻烦的是很多科学计算代码依赖特定的数值库和通信库商用加速卡虽然性能强但在某些国产科研软件栈上反而适配成本高。这也解释了为什么“国产推理算力”会成为 AI4S 领域的焦点。训练阶段大家拼的是集群规模而推理阶段拼的是单卡效率、框架生态、算子覆盖和长时间稳定性。浙江大学与曦望的合作本质上就是冲着这个痛点去的——把国产推理算力真正塞进科学计算的工作流里而不是停留在跑通 Demo 的阶段。这个定位我觉得是整件事最值得关注的地方。2. 联合攻关拆解国产推理算力在 AI4S 场景里到底解决了什么2.1 科学计算推理与互联网推理的本质差异做技术的人有个共识互联网场景的推理追求“低延迟、高并发”比如推荐系统、语音识别一次请求几毫秒返回但 AI4S 场景的推理是另一套逻辑它更像“高吞吐、长时程、高精度”的批处理任务。一个科研人员可能提交一个包含几十万帧分子构象的推理任务程序要连续跑几十个小时中途不能崩、精度不能漂移、数值不能出现 NaN。这种差异直接决定了对推理算力的选型标准。拿蛋白质结构预测来说模型输出的坐标数据必须通过一系列数值验证任何低精度优化导致的微小偏差都可能被后续的能量计算放大。所以国产推理算力要在 AI4S 站住脚不是跑通几个公开模型就行而是要在混合精度、数值稳定、算子精度这几个维度上做到“科学级可靠”。2.2 浙大与曦望联合攻关中涉及的三个核心技术层面从公开信息可以梳理出这次联合攻关的三个核心层面也是我觉得对行业最有参考价值的部分。第一个层面是算子库与科学计算内核的适配。学术界的模型迭代速度非常快新提出的注意力变体、新的激活函数、新的归一化方式往往在主流框架里还没有深度优化。国产推理卡要真正好用算子覆盖度就是生死线。这次合作中双方投入了不少精力在自定义算子的开发和 kernel 调优上尤其是针对科学计算里常见的三维卷积、稀疏矩阵运算和 FFT 类操作做了专门优化这些都是科学模型里出现频率极高的计算模式。第二个层面是大规模推理任务的调度与容错。科研推理经常要占用整个计算节点跑数天一旦中途出错前面的计算全部浪费。联合攻关里做了 checkpoint 定期存档、推理任务断点续跑、异常自动隔离这些工程化能力这在国内高校的自建集群里其实挺稀缺的——很多实验室的推理脚本还停留在“出一条命令等结果”的阶段一旦断掉就全盘重来。第三个层面是模型压缩与推理加速的平衡。科学模型跟商业模型不一样很多参数有物理意义压缩不当会破坏一致性。比如气象模型中某些通道代表特定的物理变量剪枝后这些变量之间的耦合关系可能失真。这次联合攻关里没有简单套用通用的 INT8 量化方案而是针对不同模型结构做了逐层敏感性分析在保持科学精度的前提下实现推理加速。2.3 为什么“联合攻关”而不是“采购交付”我特别想聊一下“联合攻关”这个模式。现在的校企合作很多还停留在“企业卖卡、学校买卡、出了问题找售后”的阶段但算力这种东西跟普通硬件完全不同它是要在用户的真实负载里打磨出来的。厂商不清楚科研模型的计算特征学校不清楚芯片的底层架构两边不坐到一张桌子上性能就上不去。联合攻关的本质是把芯片厂商的底层能力和科研用户的前沿需求放在同一个锅里煮。国产算力要真正服务 AI4S必须跟科研一线无缝对焦——哪些算子调用最频繁、显存访问模式是什么样的、通信瓶颈在哪这些细节不跑真实负载根本发现不了。浙大在计算物理、生命科学、地质科学等多个方向有很强的科研团队这些真实场景就是最好的“算力试金石”。这种模式也让我想到一个类比就像定制西装和买成衣的区别。成衣合身与否全看运气定制则是一寸一寸量出来的。科学计算对算力的要求比穿西装苛刻得多差一寸都穿不出去。3. 从“能用”到“好用”国产推理算力生态共建的关键路径3.1 生态共建不等于堆硬件工具链才是核心很多人在聊国产算力时第一反应是看芯片的峰值性能是多少 TFLOPS这个思路对科研选型来说其实是个误区。单卡算力只是下限工具链的成熟度才决定上限。什么叫工具链成熟度就是你在 PyTorch 里写好的模型能不能不改代码或者改很少的代码就在国产推理卡上高效跑起来。这次浙大与曦望的合作里明确提到了从底层算子库到上层应用框架的全栈适配。这意味着不仅仅是硬件层面的打通更重要的是在 PyTorch、MindSpore 这类主流框架里做好后端支持让科研人员不需要关心底层硬件差异。我见过不少科研团队因为换了一套加速卡光改代码就花了两个星期这种隐性成本其实比硬件本身贵多了。工具链层面的生态共建还包含推理引擎的优化。国产推理卡对应的推理引擎需要支持动态 shape、支持科学计算里常见的控制流还要跟 HuggingFace 上的模型库做好对接。这些工作很琐碎但每一件都直接决定科研人员愿不愿意真的用起来。3.2 标准与评测让 AI4S 推理性能可以“对齐”生态共建里还有一个容易忽略但特别关键的环节就是评测基准。拿跑分来说互联网模型有公开的 benchmark 可以横向对比但科学计算模型因为种类太杂、数据格式太特殊很长时间都没有一个大家都认可的评测标准。这次合作成立联合实验室之后一个值得关注的产出方向就是构建面向 AI4S 场景的推理性能评测体系。这个体系至少要覆盖几类典型负载分子动力学、气象预测、材料计算、生物信息学。每一类负载给出明确的性能指标吞吐、延迟、精度保持率、长时间运行稳定性让高校和企业在选型时有据可依而不是看宣传册上的理论峰值。我自己的经验是评测基准这件事比想象中重要得多。没有标准的时候厂商说“性能提升 30%”科研人员根本没办法验证因为没有统一的测试方法和参考基线。有了区域性的评测中心大家就可以在同样的负载、同样的数据集、同样的精度要求下做横向对比这是建立信任最快的方式。3.3 LAFAI 实验室的战略定位从项目到平台的跨越这次合作中成立的 LAFAI 联合实验室在我看来是整件事从“一次性攻关”走向“持续性生态”的关键一步。实验室不只是一个挂牌机构它有明确的研究方向、开放课题和算力服务中心这就把“项目制”的合作升维成了“平台制”的共建。平台制的好处是可持续。科研需求不会消失只会不断演进。今天做的是蛋白质结构预测明天可能是材料逆设计后天可能是大语言模型驱动的科研助手。如果每次有新需求都要重新磨合一遍底层适配成本太高了。联合实验室的模式让双方可以在同一套基础设施上持续迭代新的科研方向只要在已有的工具链上做增量适配就行。对高校来说这种合作还有一层更实际的意义给学生提供了接触真实产业问题的机会。实验室的开放课题可以让研究生在国产算力上做前沿研究积累的经验就是未来就业时最有竞争力的资本。4. 实操视角AI4S 推理算力选型和落地的几个关键建议4.1 选型时不能只看峰值性能要看有效性能聊了这么多宏观层面的东西回到实际操作层面很多团队在选型推理算力时会踩一个坑光看芯片的理论算力。但实际跑模型时理论算力能发挥多少取决于算子实现效率、显存带宽、数据搬运开销这些因素。我建议选型时直接拿自己的代表性模型做实测测三类指标——单卡吞吐、多卡扩展效率、长时程稳定性的残差变化用数据说话别被宣传材料带偏。4.2 框架适配是最大隐性成本提前做好评估换推理算力最大的隐性成本不是硬件采购而是框架适配。科学计算代码往往高度依赖特定库函数换一个硬件平台可能涉及整个链路的重写。我的建议是采购之前先画出完整的代码依赖图标注哪些部分跟硬件绑定、哪些部分是纯 Python 逻辑、哪些库函数在目标平台上有替代实现。这个评估做完适配工作量基本也就心中有数了。4.3 推理性能调优的三板斧算子替换、显存优化、异步流水在国产推理算力上做 AI4S 项目的性能调优我自己的经验是三件事最管用第一是算子替换。科学计算模型里有些计算可以用融合算子替代比如把 LayerNorm 和线性层融合减少显存读写次数。这需要对照算子清单逐一排查找到热点算子后手动替换成融合版本。第二是显存优化。科学模型的中间特征图往往很大可以通过梯度检查点、显存复用、混合精度在可接受范围内等方式把显存占用降下来从而支持更大的 batch size提升吞吐。第三是异步流水。推理流程里数据加载、预处理、计算、后处理是串行的话GPU 会有大量空闲等待。改成 producer-consumer 流水线模式让数据加载和计算重叠通常能把整体吞吐提升 30% 以上。这三个手段不需要改模型结构纯工程优化但对性能的提升非常显著。4.4 长时程推理任务的稳定性治理AI4S 推理任务动不动跑几十个小时稳定性问题比性能问题更容易让人崩溃。我踩过的坑包括内存泄漏导致性能随时间递减、显存碎片化导致后期 OOM、温度过高导致计算节点自动降频。治理思路大概是三层进程级监控盯内存和显存趋势、定期存档每隔固定步长保存中间状态、异常自愈检测到异常后自动拉起新任务并从最近存档恢复。这些能力如果算力平台原生支持能替科研人员省下大量精力。5. 常见问题与踩坑记录AI4S 推理算力落地的真实困境5.1 模型迁移到国产推理卡后精度漂移怎么办我在实际项目里遇到过精度漂移问题现象是同一套权重文件在原来平台上跑结果正常迁移到国产推理卡后某些输出的数值出现微小偏差。排查下来发现原因出在算子实现差异上——某些激活函数的实现用了近似计算在特定输入区间内有微小误差。这个问题没有捷径只能逐层对比中间输出定位差异算子然后联系厂商修复实现。所以在选择合作厂商时算子级的技术支持响应速度很关键。5.2 多卡推理时扩展效率上不去是什么原因有时候多卡推理的加速比远远低于理论值可能的原因包括通信量过大张量并行时每步都要同步、负载不均衡部分卡的输入长度差异大、数据加载成为瓶颈。针对这些问题一个比较实用的办法是在模型并行策略上做混合——张量并行和数据并行结合同时用动态填充让每张卡的输入尽量均匀。另外检查一下 PCIe 通道数和 NVLink 替代方案的带宽通信带宽常常是最容易被忽略的瓶颈。5.3 国产推理卡对大模型的适配进展如何这个问题的现实情况是大模型尤其是 LLM在国产推理卡上的适配进展已经非常快了但科学计算领域的长序列模型比如基因序列、长时序气象数据还有不少优化空间。主要原因是科学计算里的长序列和 NLP 里的长文本在数据分布上差异很大已有的 KV Cache 优化不一定完全适用。建议关注厂商是否支持 PagedAttention 的自定义扩展能力这个能力对科学计算长序列推理非常重要。5.4 小团队没有专职优化人员怎么用好国产推理算力如果团队里没有专门的性能优化工程师我的建议是“以平台换人力”——优先选择那些提供完善推理服务平台的算力厂商而不是买裸卡自己折腾。好的推理服务平台应该内置算子优化、自动调优、故障自愈、性能监控等功能让科研人员把精力集中在自己的科学问题上不要在不该花时间的地方浪费青春。6. 高校视角的区域算力生态从实验室到产业的最后一公里这次浙大与曦望的合作还有一个值得关注的点就是联合实验室的“区域辐射”属性。高校的算力平台天然具备开放属性可以同时服务校内多个学科、周边科研院所、甚至区域内的高新技术企业。这种区域性的算力生态一旦建立起来受益的不只是合作的双方而是整个区域的创新体系。我在实践中观察到一种现象很多中小企业想做 AI4S 相关的产品但自建算力成本太高只用公有云又怕数据安全处于一种两难的境地。如果高校联合实验室能够以相对低门槛的方式开放算力资源和服务能力这些企业就可以在早期阶段跑通技术验证后续再考虑规模化采购。这种“高校作为技术验证场、企业作为落地承接方”的模式对国产算力生态的成熟是非常有效的推动力。回到这次合作本身“从联合攻关到生态共建”这个过程本质上是一个从“解决问题”到“建立机制”的跃迁。第一步解决的是眼前的适配问题第二步解决的是长远的可持续发展问题。我在实际接触类似合作项目时最深的一点体会是算力的价值不在于芯片本身而在于它能不能让科研人员忘记芯片的存在。当科学家不再需要关心底层硬件怎么适配、算子怎么优化的时候国产推理算力才算真正完成了从“能用”到“好用”的跨越。浙大与曦望这条路走得比较扎实从算子适配到工具链打磨从联合实验室到开放课题每一个环节都在朝着这个目标推进。最后再分享一个我在推理算力落地过程中的小技巧不管用谁家的硬件第一件事不要急着调性能先跑一个完整的、带有数值验证的小规模任务确认整条数据链路是通的、结果是可靠的然后在这个基础上逐步放大规模和优化性能。这个顺序一旦反了后面排查问题会非常痛苦。物理世界的规则跟计算世界很像基础不牢地动山摇。