专栏名称: 智东西
智东西-聚焦智能变革,服务产业升级!作为智能行业新锐媒体,智东西专注五大领域:VR/AR;AI/机器人/无人机;智能汽车/智能出行;智能家居/物联网;智能穿戴/智能医疗,通过内容、活动、报告以及社群等方式助力“智能+”时代的创业和产业升级。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  智东西

阿里深夜干了件大事,成本暴降90%!

智东西  · 公众号  · 科技媒体  · 2025-09-12 10:05
    

主要观点总结

阿里通义实验室发布下一代基础模型架构Qwen3-Next,并开源了Qwen3-Next-80B-A3B的指令模型和思维模型。新模型支持原生262144个token上下文长度,可扩展至1010000个token。指令模型性能与参数规模更大的Qwen3-235B-A22B-Instruct相当,思维模型优于谷歌闭源模型Gemini-2.5-Flash-Thinking。新模型在架构升级方面进行了混合注意力机制、MoE结构、训练优化和推理效率的多Token预测等核心改进。

关键观点总结

关键观点1: 新模型发布

阿里通义实验室发布了新一代模型架构Qwen3-Next,并训练了基于该架构的Qwen3-Next-80B-A3B-Base模型。

关键观点2: 模型性能

新模型在指令模型和思维模型方面的性能表现优异,接近或优于其他大规模模型,如Qwen3-235B-A22B-Instruct和Gemini-2.5-Flash-Thinking。

关键观点3: 技术特点与创新

新模型采用了混合注意力机制、高稀疏度MoE结构、一系列训练稳定友好的优化,以及提升推理效率的多Token预测(MTP)机制等技术特点和创新。这些技术使得模型在上下文长度、总参数、推理吞吐量等方面有显著提升。

关键观点4: 开源与社区影响

阿里通义实验室将新模型在魔搭社区和Hugging Face开源,受到开发者好评。同时,其在开源社区的技术影响力正逐步增强。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照