7月31日
06:02
06:02官方一手@OpenAIDevs@OpenAIDevs
精选
OpenAI 通过开发者账号分享了 ChatGPT 更新日志链接。日志涵盖文件上传、图像生成、代码解释器改进等功能。更新还扩展了上下文窗口至 128K tokens,并优化了实时语音对话效果。
事件专题

推荐理由:OpenAI 刚发了 ChatGPT 的更新日志,看看加了哪些实用功能,对日常使用很有帮助。
02:22
02:22lmarena.ai@lmarena_ai
精选
Arena在视觉、图像生成和代码领域基于实时偏好训练模态特定奖励模型。文本到图像奖励模型使用超过300万偏好对训练。在公开MMRB2基准上,该模型达到点式奖励模型最先进性能,比次优基线高9分以上。

推荐理由:Arena这个多模态奖励模型真强,文本到图像那块在MMRB2上比第二名高9分多,挺值的看的。
7月30日
20:38
17:38
17:38Hailuo AI@Hailuo_AI
MiniMax H3 模型能够将手绘线条与真实视频画面自然融合。用户测试显示,原本在 After Effects 中需要数小时完成的效果,该模型仅需几分钟即可生成。演示视频在 Twitter 上获得 885 次浏览和 11 个点赞,效果令人惊艳。
事件专题

推荐理由:MiniMax H3 这个模型太厉害了,手绘线条和真实视频结合得毫无痕迹,几分钟搞定以前几小时的活,快看看这个演示!
15:38
15:38AI Will@FinanceYF5
Gemma 4新增读图功能,可分析截图、手写笔记和报错信息。模型下载后完全本地运行,每次对话推理成本为零。用户只需承担电费和硬件损耗。这使Gemma 4成为低成本的本地多模态模型选择。
事件专题

推荐理由:Google的Gemma 4能本地读图分析截图和手写笔记,而且每次对话零推理成本,比云端模型省大钱。
11:04
11:04官方账号arXiv cs.AI@Weijie Wu, Junbo Li, Lin Li, Jun Fang, Qingyang Hong
MMAC基准包含5,638个音频片段,来自20多个数据源,覆盖6个能力类别和15个评估维度。它检查模型生成字幕是否提及目标维度信息以及内容与参考标签的一致性。评估了开源和商业音频大模型,结果显示不同维度下的信息覆盖度和描述可靠性差异明显。
推荐理由:想评估音频大模型的信息还原能力?MMAC有五千多段音频和十五个细粒度维度,比只看生成质量更靠谱。
01:48
01:48OpenRouter@OpenRouterAI
阿里巴巴的Qwen3.7-Flash模型在OpenRouter平台正式上线。该模型具备视觉能力,支持多模态代理、视觉编码、搜索和计算机交互,上下文窗口达100万tokens。同时支持工具调用,适合快速推理场景。
推荐理由:阿里新模型上线OpenRouter,百万上下文还能看图和操作电脑,多模态推理速度很快。
7月29日
18:38
11:57
11:57官方账号arXiv cs.AI@Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He
CHARM是一种多模态图基础模型,通过分层上下文建模解决零样本迁移问题。它用层次化图上下文替代孤立原始节点,捕捉多模态语义和跨模态关系。在多个零样本多模态图任务上,CHARM取得一致改进。
推荐理由:这篇论文提出了CHARM,用分层上下文建模多模态图,不需要目标域微调就能零样本迁移,比现有GNN和LLM方法更通用。
11:17
11:17官方账号arXiv cs.AI@Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir
76°
MODUS是一个仅解码器的any-to-any多模态模型,无需模态特定的输出头或损失函数,就能从任意组合的输入模态预测任意输出模态。它在视频、图像、语言等模态上直接使用预训练解码器,无需重头训练。在多个基准测试中,MODUS与专业模型和多任务基线性能相当甚至更优。所有代码和模型权重已在 modus-multimodal.epfl.ch 开源。
推荐理由:MODUS用一个解码器统一处理各种模态的输入输出,省去多个专用组件,性能不输专家模型,还开源了。
7月28日
11:52
11:52官方账号arXiv cs.LG@Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard
该论文提出一种多模态协同学习框架,处理训练与推理时模态不固定的缺失问题,而非传统双模态融合。实验在两种多模态分类基准上,针对任意缺失模态(单模态缺失或仅剩一模态)测试。方法一在单模态缺失时更鲁棒,方法二在极缺失条件下表现更好。代码已开源在GitHub。
推荐理由:这篇论文针对多模态分类中模态任意缺失的问题提出了两种具体方法,在单缺失和极缺失场景下各有优势,代码开源可复现。
11:47
11:47官方账号arXiv cs.LG@ Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C., Jianfeng Cai, Xinyuan Cai, Peizhou Cao, Yuxuan Cao, Ziwei Chai, Y. Charles, H. S. Che, Guanduo Chen, Guangyu Chen, Guanzheng Chen, Huarong Chen, Jia Chen, Jianlong Chen, Jun Chen, Kexin Chen, Peng Chen, Ruijue Chen, Wentao Chen, Xin Chen, Yang Chen, Yanru Chen, Yifei Chen, Yingjiang Chen, Yuankun Chen, Yujie Chen, Yutian Chen, Zhirong Chen, Dazhi Cheng, Yean Cheng, Jialei Cui, Jingbing Cui, Anqi Dai, Jiaqi Deng, Hao Ding, Rui Ding, Shaofeng Ding, Mengfan Dong, Mengnan Dong, Yuhao Dong, Yuxin Dong, Angang Du, Chenzhuang Du, Dikang Du, Jusen Du, Yulun Du, Yu Fan, Jing Feng, Qiulin Feng, Yichen Feng, Kelin Fu, Qiang Fu, Fuxuan Gao, Hongcheng Gao, Jingyue Gao, Tong Gao, Weijia Gao, Shangyi Geng, Jie Gong, Linhu Gong, Shengao Gong, Xiaochen Gong, Qizheng Gu, Yicheng Gu, Shuhao Guan, Haiqing Guo, Shiqi Guo, Xiang Guo, Zhengyan Guo, Beixi Hao, Wenxin Hao, Xiaoru Hao, Dailan He, Haotian He, Lehan He, Qi He, Weiran He, Xinran He, Xinyi He, Yibo He, Yunjia He, Chao Hong, Tiange Hong, Hao Hu, Jiaxi Hu, Ruikun Hu, Weiming Hu, Yangyang Hu, Zhenxing Hu, Liang Hua, Jinbin Huang, Ke Huang, Ruiyuan Huang, Siying Huang, Weixiao Huang, Yan Huang, Zhengjie Huang, Zhiqi Huang, Yulong Hui, Chaobo Jia, Yutong Jiang, Zhejun Jiang, Zuoyou Jiang, Wenyi Jin, Xinyi Jin, Yu Jing, Huanjun Kong, Guokun Lai, Aidi Li, Cheng Li, Chengyuan Li, Cong Li, Fang Li, Guanyu Li, Haoyang Li, Jia Li, Junxiong Li, Lei Li, Letian Li, Lincan Li, Weihong Li, Wentao Li, Xintong Li, Yang Li, Yishen Li, Yiwei Li, Yuxiao Li, Zhaowei Li, Zhaoxi Li, Zheming Li, Zhengxiao Li, Zhiyuan Li, Jiawei Lin, Xiaohan Lin, Yibo Lin, Zichao Lin, Ziyan Lin, Bill Liu, Boxiao Liu, Chuan Liu, Liang Liu, Shaowei Liu, Shudong Liu, Shuran Liu, Tianwei Liu, Weizhou Liu, Yangyang Liu, Yanming Liu, Yibo Liu, Yipeng Liu, Zhengying Liu, Zhiheng Liu, Enzhe Lu, Haoyu Lu, Linqiang Lu, Tingzhan Lu, Zhiyuan Lu, Aotian Luo, G. Luo, Junyu Luo, Yifan Luo, B. Lyu, Wenzhou Lyu, Shaoguang Mao, Yuan Mei, Xin Men, Minqing Ni, Yixuan Niu, Siyuan Pan, Shujun Peng, Zhangyang Qi, Ruoyu Qin, ZeChao Qin, Zeyu Qin, Haiquan Qiu, Jianxin Qiu, Jiezhong Qiu, Bowen Qu, Yuhao Qu, Zeyu Shang, Youbo Shao, Han Shen, Jincheng Shi, Juanfeng Shi, Lidong Shi, Shengyuan Shi, Wingchun Siu, Pengwei Song, Xiaoxi Song, Jianlin Su, Yunfeng Su, Zhaochen Su, Lin Sui, Jingsong Sun, Junyao Sun, Shaoning Sun, Shuzhe Sun, Tongyu Sun, Yujun Sun, Yunpeng Tai, Chuning Tang, Heyi Tang, Sirui Tang, Zecheng Tang, Chaoran Tian, Rongpeng Tian, Yu Tian, Wei Tu, Chensi Wang, Chuang Wang, Chunjie Wang, Dinglu Wang, Feng Wang, Hailong Wang, Haiming Wang, Hao Wang, Hao Wang, Huaqing Wang, Hui Wang, Jiayi Wang, Jinglong Wang, Jinhong Wang, Jiuzheng Wang, Linian Wang, Shaobo Wang, Shenzhi Wang, Shuyi Wang, Si Wang, Siyuan Wang, Tianfu Wang, Wenjue Wang, Xingran Wang, Xinmei Wang, Xinyuan Wang, Xusheng Wang, Yalin Wang, Yangkun Wang, Yao Wang, Yaoyu Wang, Yejie Wang, Yiqin Wang, Yucheng Wang, Yuzhi Wang, Zhaoji Wang, Zhaowei Wang, Zhengtao Wang, Zhenhao Wang, Zhongsheng Wang, Zifan Wang, Chu Wei, Ming Wei, Shouxin Wei, Zichen Wen, Fan Wu, Haoning Wu, Rucong Wu, Wenhao Wu, Xiaoxue Wu, Yingcong Wu, Yongqi Wu, Yuxin Wu, Zijian Wu, Xinglang Xian, Chenxuan Xiang, Yuye Xiang, Bocheng Xiao, Chenjun Xiao, Xin Xiao, Jin Xie, Xiaotong Xie, Yifeng Xie, Zhe Xie, Bowei Xing, Yiming Xiong, Baosheng Xu, Boyu Xu, Jiale Xu, Jianfan Xu, Jing Xu, Jinjing Xu, L. H. Xu, Qingtao Xu, Shuyao Xu, Suting Xu, Tiantian Xu, Tianxiang Xu, Weixin Xu, Xinran Xu, Yangchuan Xu, Ye Xu, Yueni Xu, Ziyao Xu, Haonan Xue, Junjie Yan, Yaoyao Yan, Fan Yang, Guangyao Yang, Hao Yang, Junwei Yang, Ruoyu Yang, Wenjie Yang, Xiaofei Yang, Xinyu Yang, Yi Yang, Yiling Yang, Ying Yang, Yuchen Yang, Zhen Yang, Zhilin Yang, Zian Yang, Zuhao Yang, Haotian Yao, Dan Ye, Haoran Ye, Wenjie Ye, Zhanbo Ye, Bohong Yin, Haoxiang Yin, Xietong Yin, Chengzhen Yu, Haozhen Yu, Longhui Yu, Shengnan Yu, Shuying Yu, Tianxiang Yu, Enming Yuan, Mengjie Yuan, Tongtian Yue, Wei Yue, Yang Yue, Dunyuan Zha, Haobing Zhan, B. H. Zhang, Dehao Zhang, Fei Zhang, Hao Zhang, Haoyuan Zhang, Huanyu Zhang, Jiapei Zhang, Jiaxuan Zhang, Jin Zhang, Kaiyi Zhang, Miaozhen Zhang, Puqi Zhang, Qinglei Zhang, Rong Zhang, Rui Zhang, Shaoshuai Zhang, Shiyi Zhang, Xiaobin Zhang, Xiaoyun Zhang, Y. Zhang, Yangkun Zhang, Ye Zhang, Yichi Zhang, Yikun Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Zijing Zhang, Bin Zhao, Chenguang Zhao, Feifan Zhao, Jinglun Zhao, Jinxiang Zhao, Shuai Zhao, Wenshuo Zhao, Xiangyu Zhao, Xuanle Zhao, Yikai Zhao, Zijia Zhao, Haozhi Zheng, Huabin Zheng, Ruihan Zheng, Shaojie Zheng, Tengyang Zheng, Haofeng Zhong, Lei Zhong, Longguang Zhong, M. Zhou, Qiankang Zhou, Runjie Zhou, Ruozhang Zhou, Xinyu Zhou, Yiqiao Zhou, Zaida Zhou, Jinguo Zhu, Liya Zhu, Xinhao Zhu, Yangjunfeng Zhu, Yuxuan Zhu, Zhen Zhu, Chen Zhuang, Weiyu Zhuang, Xinxing Zu
Kimi K3是一个2.8万亿参数的Mixture-of-Experts模型,激活参数104B,支持100万token上下文窗口和原生视觉。它采用Kimi Delta Attention和Attention Residuals改进信息流动,训练效率相比Kimi K2提升约2.5倍。后训练中应用了强化学习,覆盖通用、智能体和编程领域,实现组合泛化。在长程编码、智能体、知识、推理和视觉任务上达到前沿水平,但整体性能仍落后于Claude Fable 5和GPT-5.6 Sol。官方已开源完整模型权重。
事件专题

推荐理由:Kimi 开源了2.8T参数的K3模型,激活104B参数,能处理百万token上下文,视觉能力也不弱,性能直逼Claude和GPT-5.6,适合用来部署或研究。
10:35
10:35官方账号arXiv cs.AI@Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny
HyGAE是一种针对视觉-语言模型(VLM)智能体的强化学习框架,提出混合优势估计(Hybrid Advantage)和统一评价器(Unified Critic),同时优化令牌级和回合级目标。在五个多回合决策环境中的评估显示,HyGAE的平均成功率达到91%,相比其他方法提升了10%。理论分析表明,混合优势和回报的精确解析形式对优化至关重要。
推荐理由:这篇论文提出了HyGAE方法,让VLM智能体在多个回合的决策任务里表现更好,平均成功率91%,比别的方法高了10%,值得搞强化学习和多模态的研究者看看。
06:07
06:07Poe@poe_platform
79°
Anthropic 发布最新模型 Claude Opus 5,号称最强大的 Opus 系列模型。其智能水平接近 Claude Fable 5,但价格仅为后者一半。在 agentic coding、知识工作、视觉理解和长时间任务等方面有显著提升。该模型已上线 Poe 平台供用户试用。
事件专题

推荐理由:Anthropic 出了 Opus 5,接近 Fable 5 的能力但便宜一半,agent 编程和知识工作更强,快去 Poe 试试。
00:18
00:18Fireworks AI@FireworksAI_HQ
72°
Kimi K3 在 Fireworks 平台上线,提供推理和训练服务。这是首个3万亿参数级别的开放前沿模型。它支持1M上下文窗口和原生视觉能力。其推理性能可媲美GPT-4o等顶级闭源模型。服务托管于美国且承诺零数据保留。
事件专题

推荐理由:Fireworks 上了首个3万亿参数的开放模型 Kimi K3,百万上下文加视觉,推理不输闭源,还零数据保留,上手试试。
7月27日
11:58
11:58官方账号arXiv cs.AI@Hai-Long Nguyen, Trung Thanh Nguyen, Lars Holm, Dennis Alveringh, Duc Viet Le
PRIMS是一种物理感知的多模态Transformer,通过三个模块将物理知识融入表示学习和注意力机制。在五流体基准上,PRIMS达到98.92%平均F1分数,参数量仅0.46M,比最先进Transformer方法缩小14倍。在未见过的温度范围和流速范围分布外偏移下,PRIMS持续优于现有最佳模型,展现出对未训练工况的强鲁棒性。
推荐理由:PRIMS把物理规则直接写进模型结构,用0.46M参数在5种流体识别上拿到98.92% F1,比大模型小14倍还更抗干扰,适合微流控场景。