00:31官方账号arXiv cs.LG@Corey D. C. Heath研究人员提出了一种自监督框架,将文本、音频、图像和视频四种模态投影到共享的256维嵌入空间中。该框架通过迭代聚类发现AI形成的美学结构,并分析了AI生成的聚类分配与人类情感标签之间的差异。这项研究有助于理解AI如何构建跨模态相似性,为检索增强生成(RAG)系统组织异构媒体集合提供支持。论文多模态嵌入空间美学推荐理由:这篇论文揭示了AI如何在没有明确标签的情况下对艺术作品进行美学分类,与人类审美有何不同。原文稍后读已读值得跟进有用关注 多模态