#多模态
共 1345 条 · 7 天 156 条 · 30 天 440 条 · 话题观测 →
10月1日
9月30日
9月29日
论文14:10
UMM-Reflection:用交错强化学习训练统一模型的反思能力一篇训练方法论文:让统一模型自己看图、自己改图,用整条轨迹的 RL 训练,GenEval 比 SFT 高了 12 分,推理时还不用 verifier。
ElevenLabs 发布 Eleven v4 与 v4 Turbo,脚本可直接控制情绪表演
ElevenLabs 新语音模型来了,写台词时直接标注情绪、停顿、笑声就能让声音照着演,Turbo 版首次出声只要 150ms 左右,做播客和实时对话的可以试试。
ElevenLabs 语音模型 Eleven v4 与 v4 Turbo 上架 fal
ElevenLabs 的 Eleven v4 系列上线 fal 了,能用行内标签控制耳语和笑声,还有低延迟版给实时 Agent 用,做语音产品的可以试试。
9月28日
开源视觉决策模型 Valen:基于 Qwen3.5 的高频 Agent 反射层
看图直接给候选动作打分的开源小模型,底座是 Qwen3.5-0.8B/2B,单步 122ms,做 GUI Agent 或机器人反射层挺合适。
美团发布 LongCat-2.5-Preview:1.6T MoE 多模态模型,支持 1M 上下文
美团把 LongCat 升到 2.5 预览版,1M token 上下文加多模态,专门给跑长任务的编程智能体用,不过这次没放跑分数据。
医学视觉语言模型后训练审计:SFT 与 GRPO 对图像依赖能力的影响
用 Qwen2.5-VL-3B 在 PMC-VQA 上做了严谨对照实验,发现答案准确率涨了,模型可能反而不看图了,做医疗 VLM 微调的都该看看。