专栏名称: AI前线
InfoQ十年沉淀,为千万技术人打造的专属AI公众号。追踪技术新趋势,跟踪头部科技企业发展和传统产业技术升级落地案例。囊括网站和近万人的机器学习知识交流社群。
今天看啥Skill
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  AI前线

Qwen“半成品”推理模型刷下AIME满分,俘获大批国外开发者!实测碾压GPT-5 Thinking...

AI前线  · 公众号  · AI  · 2025-11-04 13:45
    

主要观点总结

本文介绍了阿里发布的最新推理模型Qwen3-Max-Thinking的早期预览版,该模型在AI社区引起了广泛关注。文章详细描述了Qwen3-Max-Thinking的功能和表现,包括其在AIME 2025等国际知名数学推理竞赛中的正确率、用户试用体验、模型参数规模、预训练数据量、上下文窗口大小等方面的信息。此外,文章还介绍了模型的分级定价方案和一些使用反馈。最后,文章提及了AICon 2025会议和一些其他相关的AI行业动态。

关键观点总结

关键观点1: Qwen3-Max-Thinking模型的特点和表现

Qwen3-Max-Thinking是Qwen3-Max-Preview的推理增强版本,目前是一个仍在训练中的中间检查点模型。该模型在AIME 2025等国际知名数学推理竞赛中实现了100%的正确率,并在AI社区引起了广泛关注。用户可以在Qwen Chat及阿里云API中试用当前版本。该模型支持上下文缓存功能,可在长时间会话中优化性能表现。

关键观点2: Qwen3-Max-Preview模型的优势和劣势

Qwen3-Max-Preview是阿里迄今为止规模最大、能力最强的语言模型。该模型在多项测试中均领先其他模型,如SuperGPQA、AIME25等。它不仅规避了大语言模型常见的缺陷,而且响应速度极快。有用户反馈,该模型在某些测试中表现优于多款SOTA模型,不仅能解决基础算术题,还能解决更难的挑战。

关键观点3: Qwen3-Max-Preview模型的分级定价方案和使用反馈

阿里云为Qwen3-Max-Preview推出了分级定价方案,费率根据输入token的规模不同而变化。已有不少开发者和AI爱好者对该模型进行了实测体验,并给出了使用感受。有的开发者称其表现优于复杂提示词场景,但也有开发者表示该模型在某些任务上还需要进一步的训练和优化。

关键观点4: AICon 2025会议和AI行业动态

文章最后提及了AICon 2025年度收官站会议,介绍了会议的相关议题和与头部企业和创新团队的专家深度交流的机会。此外,还提及了一些其他的AI行业动态,如黄仁勋儿子的为父打工经历、AI芯片龙头的IPO估值、Ilya接受质询曝出的内幕等。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照