传统计算机采用冯·诺依曼架构,计算与存储分离,处理器每次运算都要先把数据从内存搬进缓存,算完再搬回去。随着AI大模型参数规模爆炸式增长,数据搬运消耗的能量和时间占比越来越高,业界称之为「存储墙」和「功耗墙」。据统计,在部分神经网络推理任务中,数据搬运消耗的能耗甚至超过实际计算的数倍,这严重拖慢了AI芯片的性能提升速度。
存算一体(Compute-in-Memory)的解决思路十分直接:把计算单元直接嵌入存储单元内部,让数据在「原地」完成运算,从而大幅减少搬运。按实现路径可分为近存计算与存内计算两大类。近存计算把计算逻辑放到存储芯片附近,缩短数据传输距离;存内计算则更进一步,直接利用存储器件的物理特性完成乘加等基本运算,例如用电阻式存储器RRAM的阻值变化来模拟矩阵乘法,天然契合神经网络的运算模式。
目前存算一体芯片已在低功耗端侧AI、语音唤醒、可穿戴设备等场景实现商用,头部厂商与科研机构也在积极布局云端大算力版本。不过,存算一体仍面临模拟计算精度不足、器件一致性差、工艺成熟度低等挑战,短期内还难以完全替代传统GPU。可以预见,未来几年存算一体将与现有架构形成互补,先在边缘侧放量,再逐步向数据中心渗透,成为突破AI算力瓶颈的重要拼图。