7月16日
09:41
09:41官方账号arXiv cs.AI@Xinhao Cai, Yixuan Sun, Minghang Zheng, Qingchao Chen, Xin Jin, Song-chun Zhu, Yang Liu
该研究提出结构感知框架,将舞蹈建模为原子动作序列。通过分割大规模舞蹈数据并聚类得到原子动作词汇,利用大语言模型进行语义重标和聚类优化。框架包含两阶段:先规划原子动作的类型、时长与时机,再生成平滑连贯的运动。实验在结构连贯性、节奏对齐和感知自然度上显著优于现有基线。
推荐理由:这篇论文用原子动作来编舞,比直接生成连续动作更可控,效果也更自然,做AI舞蹈生成可以看看。
6月24日
12:11
12:11官方账号arXiv cs.AI@Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Yuan, Qi Li, Zhenan Sun
统一多模态大语言模型在文本到图像生成中仍难以精确遵循结构提示(如物体计数、空间关系、属性绑定、粗略布局)。IV-CoT提出的隐式视觉思维链框架将视觉条件分解为结构查询和语义查询的级联,结构查询先形成隐式视觉计划,语义查询再基于该计划渲染外观。训练时引入草图监督信号,无需推理时草图提取或中间解码,在单个前向传播中完成隐式CoT推理。该方法在GenEval和T2I-CompBench基准上取得更优结果,可视化分析验证了结构和语义查询的互补作用。
推荐理由:这篇论文解决了文生图模型在物体数量、空间位置等结构细节上经常翻车的问题,用隐式思维链单次前向传播搞定,在GenEval和T2I-CompBench上效果更好。