专栏名称: 智东西
智东西-聚焦智能变革,服务产业升级!作为智能行业新锐媒体,智东西专注五大领域:VR/AR;AI/机器人/无人机;智能汽车/智能出行;智能家居/物联网;智能穿戴/智能医疗,通过内容、活动、报告以及社群等方式助力“智能+”时代的创业和产业升级。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  智东西

刚刚,智谱开源千亿参数视觉大模型,能区分麦当劳肯德基炸鸡,看图猜地点击败99%人类

智东西  · 公众号  · 科技媒体  · 2025-08-11 23:48
    

主要观点总结

智谱开源了最新一代视觉理解模型GLM-4.5V,该模型基于文本基座模型GLM-4.5-Air训练,拥有1060亿参数和视觉推理能力。GLM-4.5V可以识别图像中的不同内容,如食物、地点等,并进行分析。该模型在多种基准测试中表现出色,并提供了API接口供开发者使用。此外,智谱还开源了一款桌面助手应用,可依托GLM-4.5V处理多种视觉推理任务。模型具备较大的自由度,可应用于安全与质量检查、高空遥感监测分析等领域。

关键观点总结

关键观点1: GLM-4.5V模型的开源及主要特点

智谱开源了最新一代视觉理解模型GLM-4.5V,该模型拥有强大的视觉能力,能够识别图像中的不同内容并进行分析。GLM-4.5V还新增了思考模式的开关功能,用户可自主控制模型是否进行思考。

关键观点2: GLM-4.5V模型的应用场景

GLM-4.5V模型在图像、视频理解方面表现出色,可以应用于多种场景,如网页截图分析、购物网站折扣信息计算、前端代码复现等。此外,该模型还可应用于安全与质量检查、高空遥感监测分析等领域。

关键观点3: GLM-4.5V模型的技术创新

GLM-4.5V模型采用了双三次插值机制和三维旋转位置编码等技术,支持64K多模态长上下文,有效增强了模型对高分辨率及极端宽高比图像的处理能力与稳健性。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照