专栏名称: Datawhale
一个专注于AI领域的开源组织,汇聚了众多顶尖院校和知名企业的优秀学习者,聚集了一群有开源精神和探索精神的团队成员。愿景-for the learner,和学习者一起成长。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  Datawhale

一文详尽之Embedding(向量表示)!

Datawhale  · 公众号  · AI媒体  · 2025-01-18 22:46
    

主要观点总结

本文带你详细了解文本向量的历史、现状以及在大模型时代的重要性。包括文本表示模型简介、词向量、句向量、基于Bert的文本向量、有监督学习优化和无监督学习优化等方面的内容。

关键观点总结

关键观点1: 文本表示模型简介

文本是一种非常重要的非结构化数据,如何表示文本数据一直是机器学习领域的一个重点研究方向。文本向量就是深度学习时代产生的一种文本表示的方法。

关键观点2: 词向量

词向量(词嵌入)是将每个词都映射到低维空间上的一个稠密向量。学习到的词向量可以捕捉到词的上下文信息。

关键观点3: 句向量

句向量是将整个句子转换为固定长度的向量表示。简单的获取句向量的方法是基于平均词向量的方法,但存在没有考虑句子中不同词之间的重要性差异的缺点。因此,出现了SIF加权算法、Doc2vec模型等更先进的句向量表示方法。

关键观点4: 基于Bert的文本向量

Bert模型在文本向量表示方面表现出色,但其向量空间存在各向异性问题,即高频词和低频词在向量空间中的分布不均匀。为了优化这一问题,出现了有监督学习优化(如SBERT模型)和无监督学习优化(如Bert-flow和Bert-whitening)等方法。

关键观点5: 有监督学习优化

通过标注语料构建双塔Bert或单塔Bert来进行模型微调,使靠近下游任务的Bert层向量更加靠近句子相似embedding的表达。代表方法包括SBERT模型,使用孪生网络和三级网络结构进行训练。

关键观点6:


关键观点7:




免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照