7月7日
7月5日
13:17
13:17Yangyi@Yangyixxxx
X平台用户@yangyi在推文(ID 2073621278356086856)中表示AI需要上下文信息。该推文获得92次浏览。他认为所有信息交互方式都能传递上下文,只是模态需要转化,该推文有0条回复和0次转发。
推荐理由:@yangyi 分享了关于AI上下文的看法:任何交互都能传上下文,关键在模态转化。这视角能帮你打开改造思路。
7月4日
03:03
7月3日
17:31
17:31官方账号阿里云 Alibaba Cloud@alibaba_cloud
精选72°
在 Flink Forward Asia Shenzhen 2026 上,阿里云 DLF 负责人 Jingsong Li 和阿里集团数据架构专家 Ziliang Zhang 介绍了 Apache Paimon 2.0。新版本将流式湖仓演进为统一多模态数据基础。通过与 Apache Flink 集成,构建端到端管道,能提供无瓶颈的高质量数据。该架构旨在支持 AI 原生工作流的实时数据需求。
事件专题

推荐理由:阿里云在Flink Forward上秀了Paimon 2.0,把流式湖仓升级成多模态数据底座,专为AI工作流扫清数据瓶颈,搞AI数据管线的可以关注。
15:45
15:45官方账号vLLM@vllm_project
74°
Qwen3-Omni采用多模态Thinker与Talker(Code2Wav)流水线架构。高并发下仅复制语音阶段,复用Thinker结果,首音频延迟从约6秒降至0.6秒。吞吐量在同GPU上提升5.4倍,语音生成快于实时。该优化由阿里、蚂蚁集团SCT团队和vLLM-Omni团队共同实现。

推荐理由:阿里和蚂蚁团队搞了个优化,Qwen3-Omni实时对话延迟从6秒降到0.6秒,吞吐还翻了5倍多,推荐看技术博客。
11:49
11:49官方账号arXiv cs.AI@Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian
研究者发布了DramaSR-532K基准,包含53.2万条带注释对话和900多个角色,需整合听觉、语言和视觉线索。他们提出DramaSR-LRM方法,基于大型推理模型(LRM),通过多模态工具自主聚合上下文证据。在短话语上,DramaSR-LRM显著优于现有基线,因为声学生物特征在这些场景中不可靠。数据和代码将公开。
推荐理由:一篇论文用推理模型做说话人识别,还建了个53万条对话的新基准,短话识别效果比现有方法强不少。
08:10
08:10lmarena.ai@lmarena_ai
Arena平台启动Claude Fable 5的Battle Mode和Agent Mode测试,覆盖文本、图像等多模态输入。用户可参与投票,直接影响最终排行榜分数。排行榜结果即将在arena.ai公布。该测试用于评估模型的多模态能力和智能体行为。
事件专题

推荐理由:Arena开始让大家测Claude Fable 5了,有Battle和Agent两种模式,你还能投票影响排名,快去试试。
7月2日
7月1日
21:48
21:48岚叔@lufzzliz
一位开发者观察发现,其网站数据显示Codex用户数量多于Claude Code。但实际内部编码场景中,Claude Code的使用比重更大。该观点认为未来当模型代码能力补齐或涌现更多优秀框架后,多模态模型如GPT和Gemini可能占据更大优势。
推荐理由:这位博主分享了Codex和Claude Code在实际使用中的差异,点出Codex用户多但内部编码Claude Code更受欢迎,还聊了多模态模型的潜力,挺接地气的。
12:51
12:51量子位@量子位的朋友们
Om AI联汇发布了VLX模型,这是全球首个面向物理世界的端侧流式多模态模型。VLX支持实时视频流分析,能够在边缘设备上运行。它适用于机器人、自动驾驶、智能家居等场景,实现了低延迟的物理世界交互。模型采用了创新的流式架构,兼顾了性能和效率。
推荐理由:Om AI联汇发布的VLX模型,能在手机上实时看懂视频流,适合做机器人或智能硬件的AI大脑,跟云端模型比延迟低得多。
09:21
09:21官方账号Google DeepMind@GoogleDeepMind
Google DeepMind 推出 Gemini Omni Flash,支持通过自然语言进行会话视频编辑。该模型可同时引用图片、文本和视频帧,组合多模态输入来操控视频动作。它还能利用真实世界知识,直接连接文字与图形到视频输出。目前已在 Google AI Studio、Gemini API 及 Gemini Enterprise Agent Platform 可用。
推荐理由:Google DeepMind 的新模型 Gemini Omni Flash 能边聊天边剪视频,还能把文字和图片直接变成视频操作,很实用。现在在 Google AI Studio 就能试。
05:18
05:18Google AI Developers@googleaidevs
72°
Google推出Nano Banana 2 Lite,号称最快、最经济的Gemini图像模型,专为高吞吐量开发者管道优化。同时发布的Gemini Omni Flash支持视频生成和编辑。两款模型即日起通过Google AI Studio和Gemini API可用。
事件专题

推荐理由:Google发了两个新模型:Nano Banana 2 Lite图像模型更快更省钱,还有Gemini Omni Flash能做视频生成和编辑,今天就能在API上用了。
04:27
04:27官方账号Google DeepMind@GoogleDeepMind
Google DeepMind 发布 Interactions API,允许将 Nano Banana 2 Lite 和 Gemini Omni Flash 两个模型串联使用。用户可先用 Nano Banana 2 Lite 生成图像,再通过 Gemini Omni Flash 将其动画化。该 API 支持会话历史,可堆叠最多三次顺序编辑。
事件专题

推荐理由:DeepMind 让 Nano Banana 和 Gemini Omni 能配合干活了,先画图后动画,还能连续改三次,挺实用。
6月30日
13:17
13:17Geek@geekbb
精选
Qwythos 9B 基于 Qwen3.5-9B,在 5 亿 token 的 Claude 思维链轨迹上全参数微调,可处理 1M 上下文。支持原生 Function Calling 和多模态视觉(图像+文本)。GGUF 量化后仅 5.2 GiB,可在低配设备上运行。该模型为开源且未经审查。
推荐理由:Empero AI 开源的 Qwythos 9B 把 Qwen3.5 和 Claude 思维链结合,1M 上下文加 Function Calling,量化后 5.2GB 的推理模型,低配机器也能跑。
11:51
11:22
11:22官方账号arXiv cs.LG@Haitao Wu, Qirui Zhang, Zhouheng Yao, Shangquan Sun, Qihao Zheng, Mianxin Liu, Chi Zhang, Wanli Ouyang, Chunfeng Song, Changqing Zhang, Jiamin Wu
BrainJanus是首个将脑、视觉和语言整合到单一框架的统一脑模型。它引入Unified Brain Tokenizer将连续神经活动量化为离散Token,并与视觉和语言表征对齐到共享的Omni空间。基于All-in-One自回归架构,该模型通过下一个Token预测实现图像到脑、文本到脑的编码以及脑到图像、脑到文本的解码。在多项基准测试中,BrainJanus取得优越性能,并展现出零样本泛化能力和可解释的生物拓扑结构。代码已在GitHub开源。
推荐理由:这篇论文提出了BrainJanus,一个能双向翻译脑信号与图像、文本的统一模型,在零样本和生物可解释性上突破传统方法。
10:21
10:21官方账号arXiv cs.AI@Chao Tian, Zikun Zhou, Chao Yang, Guoqing Zhu, Zhenyu He
本文提出一种稀疏跨模态融合机制用于RGB-T目标检测,避免传统方法中双重骨干网络和全局融合的高计算成本。该方法先通过轻量级单模态检测器快速扫描图像,生成高召回率的候选区域(RoI),再对稀疏的候选区域进行跨模态特征融合以精化检测结果。两阶段框架显著降低了参数和计算成本,同时在高分辨率图像上保持可扩展性。实验证明该方法在保持竞争力的前提下实现高效检测。
推荐理由:这篇论文找到了一种聪明的方法:先快速扫一遍图像找出可能的目标区域,再只对这几个区域做多模态融合,省了很多计算。适合想做轻量级多模态目标检测的人读。
10:16
10:16官方账号arXiv cs.AI@Elys Allesiardo, Antoine Caubrière, Valentin Vielzeuf
该论文深入分析了非序列多模态句子级嵌入,重点研究SONAR模型。研究发现某些嵌入维度对扰动敏感,可作为解码异常的指示器。通过利用编码与解码间的一致性,构建了准确的异常检测器。论文还探索了修改特定维度以尝试纠正异常。
推荐理由:这篇论文用SONAR模型把嵌入维度玩出花了,直接用一致性检测解码异常,还尝试修正,挺有意思的。
6月29日
16:34
16:34官方一手pandaily@contact@pandaily.com (Pandaily)
具身智能公司智平方(Zhipingfang)完成约50亿元新融资。其估值突破200亿元(约28亿美元),成为粤港澳大湾区首个具身智能独角兽。核心采用类脑NeuroVLA架构,模拟人脑多模态信息处理机制。

推荐理由:智平方刚融了50亿,估值200亿,靠类脑NeuroVLA搞具身智能,大湾区第一个独角兽,挺有看头。
13:50
13:50官方账号阿里云 Alibaba Cloud@alibaba_cloud
在Flink Forward Asia Shenzhen 2026上,NVIDIA的Chuan Chen介绍了与阿里云的技术合作。双方通过CUDA库加速Apache Flink的多模态数据流处理。这一开源协作实现了端到端高性能多模态流式架构,适用于AI评论、实时图文流和交互式问答。
事件专题

推荐理由:NVIDIA和阿里云用CUDA把Flink的多模态数据处理速度拉满了,想做实时AI评论或图文问答的可以看看这个架构。
13:50
13:50官方账号阶跃星辰 Stepfun@Stepfun_AI
StepFun(阶跃星辰)推出初创公司计划,为早期AI团队提供支持。入选团队可获得API额度、专属生态系统支持、联合营销机会、展示位置及合作伙伴引荐。该计划面向构建多模态应用和智能体系统的团队。申请现已开放。

推荐理由:StepFun给早期AI团队送API额度、资源和曝光,做多模态或智能体项目的小伙伴可以试试,链接在推文里。