改变AI数学运算方式可减轻硬件负担
研究人员展示,通过改变人工智能背后的数学运算方式,可以显著降低对硬件的依赖。这一发现有望减少AI训练和推理所需的计算资源,从而降低硬件成本和能耗,推动AI技术更广泛地普及。
背景速读
- 当前大语言模型(如GPT、Llama)依赖“Transformer”架构,其核心运算之一是“注意力机制”。该机制依赖浮点矩阵乘法(FP32/FP16),计算量极大,需要昂贵的AI加速芯片(如英伟达H100/B200)。
- 研究人员提出用“多项式近似”替代浮点乘法——即把注意力计算中的打分步骤(Q·K矩阵乘)用更简单的数学运算(如加法或查表)来近似,而不显著降低模型质量。
- 这项研究的背景是AI硬件供需极度紧张、训练成本飙升。若能降低计算的“算术精度”,就能在同等硬件上运行更大模型,或降低对专用硬件的依赖。
- 关键前提:这不是改进模型本身,而是改进模型底层执行的数学运算的效率。类似思路还有“量化”(用8位甚至4位数值代替32位)和“稀疏化”(跳过不必要的计算)。
- 本文发表于《The Register》,是一家面向技术的英国媒体,报道偏向务实、冷静,并不鼓吹AI狂热。