专栏名称: 智东西
智东西-聚焦智能变革,服务产业升级!作为智能行业新锐媒体,智东西专注五大领域:VR/AR;AI/机器人/无人机;智能汽车/智能出行;智能家居/物联网;智能穿戴/智能医疗,通过内容、活动、报告以及社群等方式助力“智能+”时代的创业和产业升级。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  智东西

DeepSeek最新王炸模型:VLM架构重磅突破,AI像人一样读图

智东西  · 公众号  · 科技媒体  · 2026-01-27 14:47
    

主要观点总结

DeepSeek公司开源了其面向OCR场景的专用模型DeepSeek-OCR 2,该模型采用新型解码器,能更好地理解复杂布局、公式和表格。在OmniDocBench v1.5基准测试中得分91.09%,较之前模型有所提升。DeepSeek-OCR 2兼具研究型探索和实用工具价值。其关键在于改进了编码器,采用LLM风格的编码器,实现了视觉token的高效压缩和重排序。此外,DeepSeek-OCR 2在文档解析方面的编辑距离低于Gemini-3 Pro,证明了其优越性能。不过,该模型在文本密度超高的报纸上的识别效果有待提高。

关键观点总结

关键观点1: DeepSeek-OCR 2模型的特点

采用新型解码器,理解结构并按结构读;在OmniDocBench v1.5上得分91.09%;兼具研究型探索和实用工具价值;关注编码器改进,采用LLM风格的编码器;实现了视觉token的高效压缩和重排序。

关键观点2: DeepSeek-OCR 2的性能表现

较DeepSeek-OCR提升了3.73%;与其他端到端的OCR模型相比,表现优异,但略逊于百度的PaddleOCR-VL;在文档解析方面的编辑距离低于Gemini-3 Pro。

关键观点3: DeepSeek-OCR 2的应用价值

可作为新型VLM架构进行探索性研究,也能作为生成高质量预训练数据的实用工具,服务于大语言模型的训练过程。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照