embedding·general

Embedding

别名
首次出现
2026-05-22
最近出现
2026-07-31
累计提及
78
§ 01综述

Embedding 是机器学习中将离散对象(如单词、图像、时间序列)映射到连续向量空间的技术,使语义相似的对象在向量空间中距离更近。它是现代 AI 系统(如大模型、检索增强生成)的基础组件。

Embedding 近期进展

2026 年 7 月,美团开源万亿参数大模型 LongCat-2.0,同步开放国产卡推理代码。该模型优化了 embedding 表示,支持高效推理。 美团万亿参数大模型 LongCat-2.0 开源,同步开放国产卡推理代码

2026 年 7 月发布的 RAG-Anything 教程展示了如何在 Colab 中构建多模态检索管线,结合文本、表格、方程和图像的 embedding,提升检索准确性。 RAG-Anything教程:在Colab构建文本/表格/方程/图像多模态检索管线

2026 年 6 月,Liquid AI 发布 LFM2.5-Embedding-350M 和 ColBERT-350M 多语言搜索模型,支持 11 种语言,兼顾稠密向量与后期交互检索。 Liquid AI发布LFM2.5-Embedding-350M和ColBERT-350M多语言搜索模型

Milvus 实现了在 embedding list 上直接构建 HNSW 索引,质量近无损,显著提升向量检索效率。 Milvus 直接在 embedding list 上构建 HNSW,质量近无损

当前焦点与观察点

Embedding 技术正加速向多模态、大规模、高效率方向演进。从 LongCat-2.0 的万亿参数到 ColQwen 在多向量检索上领先稠密模型近 18 个点,说明 embedding 的表示能力与检索性能持续提升。同时,轻量级模型(如 LFM2.5-Embedding-350M)和推理优化方案(如 Milvus 的 HNSW 直接构建)降低了部署门槛。但如何平衡 embedding 的维度、精度与计算成本仍是关键挑战,自监督学习框架(如 ER-JEPA、LeNEPA)的提出为解决数据标注瓶颈提供了新思路。

§ 02相关报道10 条在档
  1. 01
    KSSE:稀疏图上的Kohn–Sham谱嵌入图像分类
    arXiv cs.LG
  2. 02
    Qwen3模型家族实体匹配研究:架构、变体与规模的影响
    arXiv cs.LG
  3. 03
    2026年Embedding模型选择指南:从榜单到数据形态
    Milvus
  4. 04
    每天学一个AI关键词:embedding 词向量
    向阳乔木
  5. 05
    美团万亿参数大模型 LongCat-2.0 开源,同步开放国产卡推理代码
    IT之家
  6. 06
    RAG-Anything教程:在Colab构建文本/表格/方程/图像多模态检索管线
    marktechpost
  7. 07
    ER-JEPA:面向心电图多变量时间序列的轻量级自监督学习框架
    arXiv cs.LG
  8. 08
    LeNEPA:无需数据增强的下一潜在预测时间序列表示学习
    arXiv cs.LG
  9. 09
    FLUX3D:扩散对齐稀疏表示实现高保真3D高斯生成
    arXiv cs.AI
  10. 10
    Milvus 直接在 embedding list 上构建 HNSW,质量近无损
    Milvus
§ 03邻近话题

本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

/topic/Embedding