专栏名称: 互联网AI早读课
专注互联网产品、用研、交互、设计、运营领域精选内容。信息爆炸的社会,每天用心的去读一篇文章,也许胜过你的走马观花。每早八点,我们等你。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  互联网AI早读课

AI早知道|美团开源混合专家模型;腾讯ARC团队发布音频生成模型

互联网AI早读课  · 公众号  · 科技媒体  · 2025-09-02 08:03
    

主要观点总结

本文主要介绍了美团、阶跃星辰、腾讯ARC团队、微软、OpenAI和小红书在AI领域的最新开源项目。这些项目涉及混合专家模型、语音大模型、音频生成模型等,并在智能体任务、语音理解、音频推理与生成等方面有突出表现。文章还提供了早读课解读和行动建议,帮助读者更好地理解和应用这些技术。

关键观点总结

关键观点1: 美团发布混合专家模型LongCat-Flash-Chat

美团发布并开源了采用混合专家模型架构的AI模型LongCat-Flash-Chat,总参数量达560B,平均激活参数27B。该模型在智能体任务中表现突出,推理速度更快,适合复杂智能体应用。

关键观点2: 阶跃星辰发布端到端语音大模型Step-Audio 2 mini

阶跃星辰发布了开源端到端语音大模型Step-Audio 2 mini,该模型将语音理解、音频推理与生成统一建模,在音频理解、语音识别、情感与副语言解析等方面有出色表现,并支持语音原生的Tool Calling能力。

关键观点3: 腾讯ARC团队发布音频生成模型AudioStory

腾讯ARC团队发布了开源音频模型AudioStory,该模型结合大语言模型(LLMs)与音频生成技术,通过统一理解-生成框架,实现视频配音、音频延续等复杂任务,具备时间连贯性保持与情感基调统一能力。

关键观点4: 微软推出自研AI模型MAI-Voice-1与MAI-1-preview

微软推出了两款自研AI模型MAI-Voice-1和MAI-1-preview。前者仅需单块GPU,可快速生成音频;后者使用大量GPU,具备遵循指令的能力。

关键观点5: OpenAI发布多模态语音模型GPT-realtime

OpenAI发布了专用于语音AI Agent的多模态语音模型GPT-realtime,该模型可生成自然流畅语音,并完美模仿人类语调、情感和语速,支持图像理解并与语音或文本对话结合。

关键观点6: 小红书开源自动化工具xiaohongshu-mcp

小红书发布了AI自动化工具xiaohongshu-mcp,支持小红书账号自动登录、图文批量发布及数据抓取。该工具通过HTTP JSON-RPC本地端口运行,兼容主流AI客户端,可实现命令行/对话式操作。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照