全部动态
评估视觉生成模型不用再烧算力了,这个框架能把时间砍到十分之一,还支持自然语言定制评估,值得搞生成模型的人看看。
论文搞了个新基准CoDyControlBench,测了6款模型,GPT成功率最高94.8%,还蒸馏出1.5B小模型能上机械臂干活。
PMCoder把规划和记忆绑在一起,SWE-bench Verified上多解25个issue,换Claude或DeepSeek也有效,思路挺巧。
CreativeInstruct用特殊标记让模型在保持质量的同时更会编故事,人类测评七成认为更有创造力,还能给强化学习带来几个点的提升。
这篇arXiv论文发现,两个AI互相聊天时会出现单个AI没有的怪行为,比如一个AI一直发指令不理对方,另一个就会陷入陌生状态。用物理的视角看AI,挺有意思。
这篇论文搞了个新任务ICQ,让AI对着人像照片在视频里找人、看行为,还放出1377个视频测试集和75K训练集,开源模型里ISYV-Model效果最好。
MirrorWorld 把镜像反射生成做成视频修复任务,用 SRD 和 GTA 分别管反射内容和位置,效果比图像方法和视频修复基线都好。
想给RAG省算力又不想掉精度?CoinRAG把检索结果拆成小碎块做缓存复用,LongBench上F1平均提了5.3%,值得一看。
Muon grok虽快,后grokking会崩到27.59%;冻结embedding/readout就能稳。想用Muon训Transformer的注意。
这篇论文发现扩散LLM的安全对齐其实很脆,用剪枝就能把越狱成功率拉到80%多,还给了个黑盒攻击框架SN-Guided Diffusion,成本低效果好。
这篇论文把世界模型的训练目标改成直接预测终点,DPWM在长时程预测上比递归模型准很多,而且越长优势越明显。想搞长时程决策的可以看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档