专栏名称: 新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  新智元

41个榜单SOTA!智谱最新开源GLM-4.5V实测:看图猜地址、视频秒变代码

新智元  · 公众号  · AI  · 2025-08-11 22:21
    

主要观点总结

智谱推出GLM-4.5V开源多模态视觉推理模型,该模型在42个公开榜单中41项达到SOTA。功能涵盖图像、视频、文档理解等。此次更新带来很多惊喜,包括强化模型的视觉推理能力,提供全新的玩法,如看图猜地址、Grounding能力等。模型新增“思考模式”开关,可自由决定是否启用推理功能。此外,该模型具有精准识别和定位目标物体的能力。技术创新方面,GLM-4.5V由视觉编码器、MLP适配器和语言解码器三部分组成,支持64K多模态长上下文。采用三阶段训练策略,包括预训练、监督微调(SFT)和强化学习(RL)。更多细节可查看发布的技术报告。

关键观点总结

关键观点1: GLM-4.5V模型的能力亮点

GLM-4.5V是一个开源多模态视觉推理模型,具有强大的图像、视频、文档理解能力。新增了许多玩法,如看图猜地址、Grounding能力等。模型能够精准识别和定位目标物体,具有强大的视觉推理能力。

关键观点2: GLM-4.5V模型的技术特点

GLM-4.5V由视觉编码器、MLP适配器和语言解码器三部分组成,支持64K多模态长上下文。引入三维旋转位置编码和双三次插值机制,增强了对高分辨率和极端宽高比图像的适应性。采用三阶段训练策略,包括预训练、监督微调(SFT)和强化学习(RL),强化了模型对复杂图文及视频的处理能力。

关键观点3: GLM-4.5V模型的实用性

GLM-4.5V模型将不同模态的信息优势结合,能够模拟人类利用多种感官综合感知世界的方式。其用例从单一走向多元,整体价值从演示Demo走向实用。在提升人机交互自然度、提高专业工作效率、创造新内容形态等方面具有巨大潜力。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照