专栏名称: 新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  新智元

英伟达nGPT重塑Transformer,AI训练速度暴增20倍!文本越长,加速越快

新智元  · 公众号  · AI  · 2024-10-20 12:27
    

主要观点总结

英伟达团队提出了全新的神经网络架构——归一化Transformer(nGPT),基于超球面进行表示学习。相较于传统Transformer架构,nGPT将LLM训练速度提升高达20倍,并且保持了原有精度。文章详细描述了nGPT架构的改进和实验验证,包括上下文长度对训练速度的影响以及相较于传统GPT的优势。

关键观点总结

关键观点1: nGPT架构的主要特点

nGPT在超球面上进行优化,将所有向量归一化为单位范数。输入token在超球面表面上移动,每一层都通过「位移」来贡献最终的输出预测。实验证明,nGPT达到相同精度所需的训练步骤减少了4-20倍,具体取决于序列长度。

关键观点2: nGPT相较于传统Transformer的优势

nGPT在训练稳定性、推理成本、上下文长度、鲁棒性等方面进行了改进。主要改进包括嵌入层归一化、层/块归一化、自注意力块和MLP块的改进,以及引入了一些可学习的缩放参数。

关键观点3: 实验验证

研究人员在OpenWebText数据集上训练了基础Transformer和nGPT,并在一系列标准下游任务上进行了评估。实验表明,在迭代次数和使用token数量方面,nGPT实现了显著的加速。在上下文长度和参数规模方面,nGPT也表现出明显的优势。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照