Embedding(嵌入)是一种将离散对象(如文本、图像、用户行为等)映射为低维连续向量空间中稠密向量的表示学习技术。其核心特征是语义相似的对象在向量空间中距离相近,从而使计算机能够捕捉对象间的语义关系。Embedding广泛应用于自然语言处理、推荐系统、信息检索等领域,是深度学习模型处理非数值型数据的基础方法。
嵌入模型通常只有几百MB大小,将文本转化为768维(或其他维度)的向量
OpenAI 的 text-embedding-3-small 模型会将文本转换为 1536 维的浮点数数组
OpenAI的text-embedding-3-small/large系列是目前商用场景中最常用的嵌入模型
OpenAI的text-embedding-ada-002和开源的sentence-transformers系列是常用的嵌入模型
向量数据库存储的是文本经过Embedding模型转换后的高维向量,通常为768或1536维
OpenAI的text-embedding-ada-002和开源的BGE系列是常用的Embedding模型
现代Embedding模型(如OpenAI的text-embedding-ada-002、阿里的千问Embedding系列)能够将整个句子或段落编码为固定维度的稠密向量,通常为768维或1024维
Embedding模型通常将文本映射到768或1536维的高维向量空间
中文场景下BGE、M3E等国产Embedding模型往往优于通用的OpenAI Embedding
BGE和text-embedding-3是当前可选的向量嵌入(Embedding)模型
还有 18 条时间轴事件