7月13日
10:51
10:51官方账号arXiv cs.AI@Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen
这篇论文挑战语言模型必须依赖纯文本预训练的假设,系统性地比较了无监督视觉预训练与纯文本预训练在5个骨干网络和多项基准上的表现。实验表明,基于包含图形、公式和版式的视觉文档进行预训练,在相同语料下持续优于纯文本预训练,提升幅度在1.2%-4.7%之间。该方法不依赖文本提取,直接利用视觉特征学习语言智能,为大规模预训练提供了更高效的路径。
事件专题

推荐理由:这篇论文发现,把文档当图片直接预训练,比先转成纯文本再训练效果更好,感兴趣的可以看看实验细节。
10:50
10:50官方账号arXiv cs.AI@Shravan Murlidaran, Miguel P. Eckstein
论文引入Complex Social Behavior (CSB)数据集,包含100张复杂社交场景图片。研究评估了2017-2025年间4个pre-MLLM和5个MLLM模型在CSB和MS-COCO上的表现,并与20个人类描述对比。分析了物体检测、识别、幻觉、场景理解和空间依赖五种错误类型。MLLM在CSB上的场景描述准确率与人类顶级描述相当,几乎消除了所有错误类型,但偶尔仍存在空间依赖误差。
推荐理由:这篇论文用新数据集CSB系统地测了十年间视觉语言模型的进化,发现最新模型在复杂社交场景上已经跟人类顶级描述差不多准了,只有空间依赖错误还没完全解决。
09:56
09:56官方账号arXiv cs.AI@Chongyu Qu, Can Cui, Zhengyi Lu, Junchao Zhu, Tianyuan Yao, Junlin Guo, Juming Xiong, Yanfan Zhu, Yuechen Yang, Bennett A. Landman, Yuankai Huo
SAGEAgent是一种基于LLM的临床智能体,能自主决定为每位癌症患者获取哪些诊断模态,平衡预测准确性与临床侵入性。它通过临床工具、情景记忆和语义记忆推理患者的诊断状态。在包含TCGA-LGG、TCGA-GBM和BraTS的胶质瘤队列中,使用四种诊断模态,SAGEAgent在保持竞争性生存预测准确率的同时,将平均获取负担降低了55%。
推荐理由:这篇论文提出了SAGEAgent,它能像医生一样判断该给病人做哪些检查,在几乎不掉准确率的前提下把检查负担砍掉一半多,挺实用的。
09:16
09:16官方账号arXiv cs.LG@Tamás Matuszka, András Tamásy, Balázs Szolár
这篇论文提出一个多模态框架,结合视觉和轨迹表示(Exo-Trajectory和ScenarioFormer)进行自动驾驶场景检索。实验显示,轨迹表示在运动中心事件(如cut-ins、转弯、交通排队)上表现优秀,而视觉嵌入在外观信息重要时更有效。两者结合始终提升检索质量,取得最佳整体性能。研究基于大规模自动驾驶数据集,对比了视觉基线。
推荐理由:这篇论文对比了视觉和轨迹两种方法,告诉你什么时候该用哪个,还发现组合起来效果最好。搞自动驾驶数据挖掘或场景验证的可以看看。
7月12日
04:52
7月11日
05:16
05:16Paul Couvert@itsPaulAi
过去72小时内,OpenAI发布了GPT-5.6,SpaceXAI推出了Grok 4.5,Muse发布了Spark 1.1,Meta推出了Muse图像/视频模型,OpenAI还发布了GPT-Live,Mistral推出了Robostral Navigate。这6款新模型/产品覆盖语言、图像、导航等多个方向。
事件专题

推荐理由:这两天AI圈太热闹了,OpenAI、SpaceXAI、Meta一口气发了6个新模型,包括GPT-5.6和Grok 4.5,值得一看。
7月10日
07:16
7月9日
11:31
11:31官方账号Pika Labs@pika_labs
73°
Pika 发布了 Director Suite,一个包含专用应用的创作套件。用户可与 AI 代理协作,生成图像、视频和音乐。该套件内置时间线编辑器,允许在同一个界面中直接编辑生成的内容。Jerrod Lew 发布了完整的教程视频。
推荐理由:Pika 把视频、图片、音乐生成和剪辑全放到一个 App 里,还能跟 AI 代理一起改时间线,省去来回切换的麻烦。
7月8日
19:27
19:27Geek@geekbb
精选
Google 发布了 Gemma 4 技术报告,介绍其最新开放权重多模态模型 Gemma 4(E2B–31B)。报告详细说明了架构设计、效率优化和负责任的 AI 方法。此外还涉及无编码器的 12B 变体、量化感知训练以及多 token 预测(MTP)起草器。
推荐理由:Google 刚公开 Gemma 4 的技术细节,包括 31B 多模态模型和 12B 无编码器版本,还有量化训练和 MTP 新招,搞开源模型的可以看看。
12:02
12:02官方账号arXiv cs.LG@Tianjiao Yu, Xinzhuo Li, Yifan Shen, Onkar Susladkar, Yuanzhe Liu, Xiaona Zhou, Ismini Lourentzou
ELSA3D是一种统一3D模型,通过弹性语义锚定将文本和几何推理在匹配的抽象尺度上联合结构化。它使用尺度感知的八叉树分词器表示几何,并引入锚点令牌(Anchor Tokens)实现稀疏但精确的跨模态交互。在图像到3D生成、文本到3D生成和3D描述三项任务上,ELSA3D均取得最先进性能,同时相比其非弹性版本将FLOPs和推理延迟降低约一半。
推荐理由:ELSA3D用一个弹性锚定机制把3D理解和生成统一了,三个任务都刷了SOTA,还省了一半算力,想做3D的可以看看这篇
10:46
10:46官方一手Pandaily@contact@pandaily.com (Pandaily)
腾讯混元(Tencent HY)从OpenAI挖来研究员田永龙(Tian Yonglong),任命其担任多模态模型负责人。田永龙将直接向腾讯混元首席AI科学家姚顺宇(Yao Shunyu)汇报。此举是腾讯在AI人才争夺战中的最新动作。
事件专题

推荐理由:腾讯混元直接从OpenAI挖研究员带队多模态,看来铁了心要在多模态大模型上发力。
10:16
10:16官方一手pandaily@contact@pandaily.com (Pandaily)
腾讯混元聘请OpenAI研究科学家田永龙担任新的多模态模型负责人,直接向首席AI科学家姚顺宇汇报。这是中国科技巨头从OpenAI挖人的最新高调案例,凸显国内大厂对多模态AI人才的竞争。
事件专题

推荐理由:腾讯混元从OpenAI挖来田永龙负责多模态,看看国内大厂怎么抢人才的。
08:54
08:54官方一手marktechpost@Asif Razzaq
NVIDIA发布了Nemotron-Labs-Audex-30B-A3B(Audex)模型,这是一个混合专家(MoE)架构,统一了音频理解、语音识别、翻译、文本转语音和音频生成五种能力。该模型以Nemotron-Cascade-2为骨干,仅在音频任务上产生边际的性能回归。Audex在30B总参数中仅有3B活跃参数,高效实现了多模态融合。
事件专题

推荐理由:NVIDIA发了款新模型Audex,能同时搞定音频理解、语音识别、翻译、TTS和音频生成,而且几乎没牺牲原有文本模型的性能。
03:59
03:59Notion@NotionHQ
Notion 推出 Agents iOS 应用,可处理语音笔记、照片涂鸦和深夜提问。用户通过语音、图片或文字输入,由多个智能体自动完成整理、回答等任务。该应用将 Notion 的 AI 能力扩展到移动端,实现随身办公。
事件专题

推荐理由:Notion 出了个 Agents iOS 应用,能自动处理语音笔记、草图照片和夜间提问,就像口袋里有个团队帮你干活。
7月7日
22:15
13:12
13:12官方一手pandaily@contact@pandaily.com (Pandaily)
Wiener Intelligence 于2026年5月28日在《Nature Communications》上发表论文,提出一种多模态深度学习模型,用于患者功能预后风险分层。这是首家中国数据生成公司在 Nature 系列期刊上发表研究成果。该论文展示了 Wiener Intelligence 在医疗 AI 领域的技术积累,涵盖影像、文本等多模态数据整合。

推荐理由:中科院的?不是,Wiener Intelligence 这家做数据生成的公司直接把多模态模型发上了 Nature 子刊,医疗预后分析这事儿他们真干出来了。