8月15日
14:05
14:05官方账号Decoder@Jonathan Kemper
Moonshot AI 发布 PerceptionBench 基准,专门测试多模态 AI 模型的视觉感知能力,并将该能力与逻辑推理分离评估。目前没有任何前沿模型在该基准上达到 60% 的准确率,GPT-5.6 Sol 以微弱优势领先。测试还发现,许多原本被认为是推理过程的错误,实际上在图像读取阶段就已经发生。

推荐理由:Moonshot AI 出了个新测试 PerceptionBench,专门查 AI 的“眼神”。结果最强模型 GPT-5.6 Sol 准确率也不到 60%,而且很多错是从看图时就错了。
8月14日
11:08
11:08官方账号arXiv cs.LG@Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou
Intern-S2-Preview 是一系列面向科学发现的智能体基础模型,支持多模态科学理解、推理、生成和长周期任务。训练流程包含科学多模态预训练、监督微调、多任务强化学习及智能体 RL,并引入部分 rollout、自适应长度正则化等技巧提升稳定性。其中 Intern-S2-Preview-397B 在 SciTS 时间序列基准上取得领先表现,同时其时间序列模块增强了科学信号理解与预测。独立的 Intern-MemDec-4B 扩展将 Biology-Instructions 平均分从 56.92 提升至 60.32,且无需修改冻结的 397B 主干。
推荐理由:这个科学智能体模型能处理多模态数据,397B 版在时间序列预测上很强,还有个 4B 小模型能直接把生物任务分数拉高,适合搞科研的人看看。
03:23
01:45
8月13日
8月12日
17:03
17:03官方账号阿里通义 Qwen@Alibaba_Qwen
精选
阿里云Qwen团队宣布Qwen-Image-3.0已上线OpenArt平台。该模型支持12种语言的原生文本渲染,能精确生成10像素大小的文字。它还能根据真实世界知识渲染完整界面,如网页、游戏和直播画面。这是目前最逼真的Qwen图像模型。
推荐理由:想生成带文字的海报或网页截图?Qwen-Image-3.0在OpenArt上就能用,支持12种语言,文字渲染到10px都清晰。
8月11日
8月10日
13:40
13:40官方账号阿里通义 Qwen@Alibaba_Qwen
精选
Qwen-MM-Plugins 是阿里 Qwen 团队发布的插件套件,能让现有智能体框架原生支持多模态输入。它可读取图片、视频与文档,还支持视频编辑和 3D/CAD 文件处理。官方演示展示了从多模态模型到多模态智能体的能力扩展。
推荐理由:Qwen出了个插件包,让你的agent能看图、读视频、改视频、处理3D模型,直接把多模态能力塞进现有框架。
12:04
11:27
11:27官方一手arXiv: OpenAI@Ivan Majic, Zexian Huang, Franziska Hübl, Krzysztof Janowicz, Meilin Shi, Mina Karimi, Zilong Liu, Alexandra Fortacz-Lazan
论文提出一种模态转移任务,要求LMM先用文本描述规则网格中的彩色方块图像,再用新的LMM实例根据文本描述重新生成原空间场景。实验采用OpenAI的近期LMM,结果显示其在重新生成简单彩色方块网格图像时仍存在困难。研究表明,LMM的强健地理空间理解需要严格的多模态对齐,当前模型在图像和文本模态间转移空间信息的能力仍是瓶颈。
事件专题

推荐理由:这篇论文拿彩色方块网格考OpenAI的多模态模型,让它们看图写话再画图,结果画不对,做自动GIS得先解决这问题。
11:05
11:05官方账号arXiv cs.AI@Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang
该论文提出ICQ任务,要求模型同时关联输入视频和人物参考图像,完成身份定位、行为理解与时间推理。配套的ISYV-Bench包含1,377个真实复杂视频和1,377个问答对,分为6个难度等级。训练集ISYV-75K提供75K个高质量样本,经自动标注和人工审核构建。实验显示主流闭源和开源多模态模型在ISYV-Bench上表现吃力,尤其在跨域身份匹配和长时跟踪方面;ISYV-Model超过强基线,部分指标接近闭源模型。
推荐理由:这篇论文搞了个新任务ICQ,让AI对着人像照片在视频里找人、看行为,还放出1377个视频测试集和75K训练集,开源模型里ISYV-Model效果最好。
10:45
10:45官方账号arXiv cs.LG@Ioannis Ziogas, Ensieh Khazaei, Bilal Taha, Aamna Al Shehhi, Ahsan H. Khandoker, Leontios J. Hadjileontiadis, Dimitrios Hatzinakos
arXiv 论文提出 OmniDecVAEs 框架,扩展 DecVAEs 学习模态条件时频潜在子空间,可同时处理分类、解纠缠表示、融合与生成。在多达 30 个模态的人类活动识别任务中,OmniDecVAEs 相比 Transformer 和 VAE 方法,活动识别准确率提升 1.01%,身份识别准确率提升 6.75%。合成数据的平均绝对误差改善 76.84%,最大均值差异改善 13.85%。模型仅 4.1M 参数,适合边缘可穿戴设备。
推荐理由:这篇论文发了个叫 OmniDecVAEs 的框架,能把几十个传感器数据揉在一起,分类和生成都行,参数才 4.1M,比 Transformer 还准。
8月9日
06:19