专栏名称: 量子位
վ'ᴗ' ի 追踪AI行业和技术动态,这里更快一步!关注我们,回复“今天”,更多大新闻等你来发现
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  量子位

智谱运气是差一点点,视觉Token研究又和DeepSeek撞车了

量子位  · 公众号  · AI  · 2025-10-22 23:27
    

主要观点总结

本文介绍了智谱和DeepSeek推出的视觉Token方案—— Glyph,它是一种新的长上下文建模框架,通过将长文本转化为图像,让VLM(视觉语言模型)来处理,实现高效的上下文扩展。Glyph在多项长上下文基准测试中实现了3-4倍的Token压缩率,同时保持与主流模型的相当准确度。文章还介绍了论文作者以及像素可能成为最终Token的趋势。

关键观点总结

关键观点1: Glyph通过将长文本转化为图像,实现高效的上下文扩展。

Glyph是一种新的长上下文建模框架,研究团队提出了一种新范式,把长文本“画”成图,再让VLM去看图读文,做到一目十行,从而能实现高效的上下文扩展。这种方法的核心思路是通过图像来承载信息,因为图像的信息密度远高于纯文本,仅需一个视觉Token就能容纳原先需要好几个文本Token的内容。

关键观点2: Glyph在多项长上下文基准测试中表现出色。

实验结果显示,Glyph在多项长上下文基准测试中实现了3–4倍的Token压缩率,同时保持与主流模型的相当准确度。此外,它还能带来约4倍的prefill与解码速度提升,以及约2倍的SFT训练加速。

关键观点3: 论文作者介绍了Glyph的核心团队和通讯作者。

论文的一作是Jiale Cheng,他是清华大学的博士生,主要研究方向包括自然语言生成、对话系统和相关的人工智能交互技术。通讯作者是黄民烈教授,他是清华大学计算机科学与技术系长聘教授,研究方向主要集中在人工智能、深度学习、强化学习等。

关键观点4: 视觉Token的潜力被看好,像素可能成为最终Token。

视觉Token在信息压缩、效率提升方面表现出巨大潜力。未来像素可能取代文本,成为下一代AI的基本信息单元。这是因为像素的信息压缩更高,信息流更广泛,不仅能表示文字,还能包含粗体、颜色、任意图像。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照