会员动态 > 正文
构筑大模型推理Infra能力,推动AI深入产业场景
2026-08-04   大华股份      关键字:构筑 大模型 推理 Infra能力      浏览量:
针对大模型推理算力与内存需求增长,尤其是端侧部署资源受限问题,公司通过模型蒸馏、混合精度量化、结构化剪枝与稀疏化压缩模型,并针对国产芯片进行算子融合与并行策略优化,叠加前缀缓存等多级加速技术,显著提升推理性能与资源利用率,支撑大模型在安防等产业场景的规模化落地。
  针对大模型推理算力与内存需求持续增长,尤其是端侧部署资源受限问题,大华股份系统性构建大模型推理Infra能力,通过模型压缩、芯片适配与多级加速技术,显著提升推理性能与资源利用率,支撑大模型在安防等产业场景的规模化落地。
  在推理方面,大模型能力提升的同时,对算力与内存的需求相应增长。尤其在端侧芯片上部署大模型以提升效果、拓展功能时,资源受限问题愈发突出。为解决这一问题,大华股份通过模型蒸馏降低模型参数量,结合混合精度量化降低算力开销,并在精度可控的情况下使用结构化剪枝与稀疏化进一步压缩资源占用,从而实现大模型对2T以上算力前端设备的覆盖,持续推进智能向更低算力设备下沉。
  高端芯片产能受限,行业推理芯片的演进速度难以完全追赶大模型发展步伐,原生大模型部署后常面临芯片算力利用率偏低的问题。为提升算力利用率,大华股份结合产品化芯片特性,挑选亲和算子、定制ViT结构,有效解决模型结构与芯片不匹配的问题。自研模型部署后,在保持同等算法效果的前提下,芯片算力利用率提升30%,进一步增强产品竞争力。
  为向客户提供高性价比的国产推理方案,大华股份针对国产芯片能力进行算子融合与等价算子研发,整合多种并行策略,叠加前缀缓存、多级缓存等加速技术,完成对行业国产化大算力芯片的深度适配。经过部署优化后,大模型推理性能较原生能力提高约10%,新模型高性能适配周期较原厂缩短50%,为大模型产品化落地赢得先机。
  上述Infra能力建设,有效缓解了端侧与边缘侧资源约束,提升了推理效率与国产化适配水平,支撑大模型在安防、公共安全、交通、城市治理等产业场景的规模化应用与落地,推动AI从技术能力向实际产业价值转化。






微信扫描二维码,关注公众号。