近日,三星电子正式对外公布全新LPDDR5X-PIM内存运算架构及全套详细性能参数。该技术专为智能手机、AI PC、边缘终端等端侧AI设备量身打造,打破了传统内存“仅存储、无算力”的固有局限,通过在内存芯片内部集成运算单元,实现存储与轻度算力的深度融合,从底层解决端侧AI运行的数据传输瓶颈,为本地大模型推理、智能终端AI算力升级提供全新解决方案。
PIM(Processing In Memory,内存计算)是当前半导体领域突破算力瓶颈的核心创新技术之一,核心逻辑是将计算能力下沉至内存端,彻底改变沿用数十年的传统存算分离工作模式。
在传统终端设备架构中,内存仅承担数据存储功能,所有AI运算、数据处理任务均需依赖CPU、GPU完成。三星LPDDR5X-PIM架构,通过在每一个DRAM内存颗粒的存储阵列旁集成专属运算单元,支持整数、浮点等多精度运算,可直接在内存内部完成AI推理中的矩阵运算、数据预处理、归一化等高频基础计算任务。无需将海量数据反复传输至中央处理器,大幅减少芯片间的数据交互频次,既释放了CPU、GPU的核心算力资源,又从根源上降低数据传输带来的延迟与功耗损耗,实现“存算一体、就近运算”的高效工作模式。
本次三星公布的LPDDR5X-PIM核心硬件参数实现跨越式升级,专为端侧AI海量数据处理场景优化。该架构单条内存容量可达16GB,完全满足当下智能手机、轻薄AI PC的大内存配置需求,同时适配主流端侧大模型的本地部署容量要求。
在核心带宽指标上,LPDDR5X-PIM的专属PIM运算带宽高达614GB/s。作为对比,传统无PIM加持的LPDDR5X DRAM内存,原生运算带宽仅为76.8GB/s。通过PIM技术架构革新,新款内存的有效算力带宽实现8倍跃升,彻底解决了传统内存带宽不足、无法支撑高频AI推理运算的短板。
为精准验证LPDDR5X-PIM的实际AI算力表现,三星采用Meta开源的80亿参数轻量化大模型Llama 3.1进行标准化端侧推理测试,全程对比传统LPDDR5X内存方案,实测提升效果十分显著。
在推理耗时方面,传统LPDDR5X内存完成单次完整模型推理需要12.3秒,而搭载全新LPDDR5X-PIM架构后,单次推理耗时大幅缩短至5.4秒,整体推理速度提升约2.3倍,大幅降低了端侧AI交互的响应延迟,彻底改善本地大模型运行卡顿、响应迟缓的问题。
在核心算力吞吐指标每秒Token处理量(TPS)上,性能提升更为突出。传统方案每秒仅能处理27个文本Token,而LPDDR5X-PIM方案可达到81.3个Token/秒,吞吐效率达到传统产品的3倍,意味着终端设备运行AI对话、文本生成、图像解析等任务时,处理效率、流畅度实现质的飞跃。
相较于主打高性能、高功耗、数据中心场景的HBM内存,LPDDR系列内存天生具备低功耗、小体积、适配消费终端的优势。三星此次将PIM核心技术移植到LPDDR5X低功耗内存架构中,打造出LPDDR5X-PIM端侧专属存算方案,完美兼顾高算力带宽与超低功耗两大核心优势,精准适配端侧AI“低功耗、高实时、本地化”的核心需求。该技术不仅可应用于高端智能手机、AI PC,还可赋能中小型边缘服务器、智能车载终端、工业边缘设备等场景,让各类终端无需依赖云端算力,即可独立完成高性能AI运算,实现真正的设备端离线AI智能交互。
