11:58官方一手Pandaily@contact@pandaily.com (Pandaily)Weina Intelligence 于 2026 年 5 月 28 日在 Nature Communications 发表论文,题为“Multimodal deep learning model for AI-based functional prognostic risk stratification”。该公司成为首家在 Nature 子刊发表论文的中国数据生成企业。论文提出一种多模态深度学习模型,用于基于 AI 的功能预后风险分层。该工作展示了数据生成公司在学术研究上的突破。论文Weina IntelligenceNature Communications多模态推荐理由:Weina Intelligence 成了第一个发 Nature 子刊的中国数据生成公司,论文讲多模态深度学习模型做风险分层,挺有意思。原文稍后读已读值得跟进有用关注 Weina Intelligence
11:08官方账号arXiv cs.AI@Guli Zhu, Chenwei Wu, Liyue Shen论文提出M3Bench基准,专用于评估医学视觉语言模型(VLM)的模型编辑效果。M3Bench包含16,276个问题,覆盖多种解剖结构、模态和专科,支持单次和顺序编辑。研究者评估了4种代表性编辑器在6个医学和通用VLM上的表现,发现梯度方法迁移强但破坏局部性,记忆方法局部性好但缺乏组合泛化。该基准揭示了VLM潜在空间几何与编辑方法失效的关系,为安全部署提供指导。论文M3Bench医学VLM模型编辑推荐理由:这篇论文搞了个医学VLM模型编辑的测试基准M3Bench,有1.6万多个问题,测了6个模型和4种编辑方法,发现各有各的坑,想搞懂模型编辑在医学领域行不行得通可以看。原文稍后读已读值得跟进有用关注 M3Bench
10:24官方一手歸藏(guizang.ai)@op7418Anthropic 在推特上发布了一段新研究的演示视频,展示了画面与 ASCII 字符动画的配合与转换效果。视频中图像可自动转化为 ASC2(ASCII)字符动画,视觉效果流畅。该研究的具体论文名称尚未披露,但演示表明其在视觉与文本符号映射方面有所创新。论文AnthropicASCII字符动画研究演示7 个信源在谈事件专题推荐理由:Anthropic 发了个研究 demo,画图直接转成 ASCII 动画,效果很炫酷,可以看看怎么做到的。原文稍后读已读值得跟进有用关注 Anthropic
05:27LlamaIndex@llama_index精选LlamaIndex 联合 LanceDB 推出基于 LiteParse 的混合检索方案,专门应对企业级格式混乱的 PDF。LiteParse 将 PDF 分解为页面(含文本+截图+嵌入)、文本块和提取的视觉资产三个层次,存入 LanceDB 的多模态存储中。相比传统仅依赖文本块检索的 RAG 系统,该管道允许智能体跨页面、文本块和视觉资产进行联合检索与推理。最终显著提升了 agent 检索质量与响应准确性,解锁了传统方法遗漏的信息。技巧LiteParseLanceDBLlamaIndex推荐理由:LlamaIndex 和 LanceDB 教你怎么用 LiteParse 搞定那些排版混乱的企业 PDF,表格、图片里的信息也能准确被 agent 找到。原文稍后读已读值得跟进有用关注 LiteParse
02:36Gary Marcus@GaryMarcus精选Yann LeCun 在 Bloomberg 采访中指出,LLM 预训练于约 20 万亿单词(30 万亿 token),数据量约 10^14 字节,仅相当于一个 4 岁孩子通过视觉在 4 年内获取的数据量。但文本需要 40 万年才能读完,而孩子通过视觉、触觉等感官获得密集反馈。LeCun 引用 Moravec's paradox,认为理解物理世界(如玻璃杯的易碎感)远比生成流畅文本困难。行业LLMYann LeCunMoravec's paradox1 个信源在谈事件专题推荐理由:Yann LeCun 用具体数字对比,讲清了 LLM 为什么看起来聪明却不懂物理常识。想理解当前 AI 天花板的人可以看看。原文稍后读已读值得跟进有用关注 LLM
09:12IT之家(博客/媒体)日本经济产业省6月30日公布《人工智能机器人战略》修订版,计划到2040年在18个领域部署1000万台AI机器人。该战略旨在应对人口老龄化和低出生率导致的劳动力短缺。日本经产省未来5年将向软银、NEC、本田、索尼等创立的Noetra提供合计1万亿日元(约420.13亿元人民币)资金,用于多模态平台开发,其中2026财年拨款3873亿日元。行业日本AI机器人Noetra推荐理由:日本政府打算砸1万亿日元搞AI机器人,到2040年铺1000万台,软银、索尼这些公司一起上,缺劳动力的可以关注。原文稍后读已读值得跟进有用关注 日本
13:17Yangyi@YangyixxxxX平台用户@yangyi在推文(ID 2073621278356086856)中表示AI需要上下文信息。该推文获得92次浏览。他认为所有信息交互方式都能传递上下文,只是模态需要转化,该推文有0条回复和0次转发。技巧@yangyi上下文信息多模态推荐理由:@yangyi 分享了关于AI上下文的看法:任何交互都能传上下文,关键在模态转化。这视角能帮你打开改造思路。原文稍后读已读值得跟进有用关注 @yangyi
03:03elvis@omarsar0推特用户@omarsar0分享经验:与AI代理交互时使用语音、文本和视觉标注是最大杠杆之一。他默认采用多模态提示方式。他认为这种交互方式更自然,能更充分地利用代理能力并发现未知内容。技巧智能体多模态提示词工程推荐理由:这位用户分享了用语音、文字加图标注跟AI代理聊天的技巧,能拿到更多信息,试试看原文稍后读已读值得跟进有用关注 智能体
23:33IT之家(博客/媒体)72°字节豆包视频生成模型 Seedance 2.5 于 6 月 23 日发布,目前处于全球企业内测。该模型支持 30 秒单段原生直出及高质量视频延长。支持 50 个全模态素材联合输入,实现多素材统一理解与生成。支持视频二次编辑,可保持画面一致性进行局部调整。体验中心预计 7 月 6 日上线,一周后开放 API。AI模型Seedance 2.5字节豆包视频生成推荐理由:字节豆包 Seedance 2.5 要上线体验中心了,能生成 30 秒视频还能同时用 50 个素材编辑,实打实提升视频创作效率。原文稍后读已读值得跟进有用关注 Seedance 2.5
17:31官方账号阿里云 Alibaba Cloud@alibaba_cloud精选72°在 Flink Forward Asia Shenzhen 2026 上,阿里云 DLF 负责人 Jingsong Li 和阿里集团数据架构专家 Ziliang Zhang 介绍了 Apache Paimon 2.0。新版本将流式湖仓演进为统一多模态数据基础。通过与 Apache Flink 集成,构建端到端管道,能提供无瓶颈的高质量数据。该架构旨在支持 AI 原生工作流的实时数据需求。AI产品Apache PaimonAlibaba CloudApache Flink1 个信源在谈事件专题推荐理由:阿里云在Flink Forward上秀了Paimon 2.0,把流式湖仓升级成多模态数据底座,专为AI工作流扫清数据瓶颈,搞AI数据管线的可以关注。原文稍后读已读值得跟进有用关注 Apache Paimon
15:45官方账号vLLM@vllm_project74°Qwen3-Omni采用多模态Thinker与Talker(Code2Wav)流水线架构。高并发下仅复制语音阶段,复用Thinker结果,首音频延迟从约6秒降至0.6秒。吞吐量在同GPU上提升5.4倍,语音生成快于实时。该优化由阿里、蚂蚁集团SCT团队和vLLM-Omni团队共同实现。AI模型Qwen3-Omni多模态推理优化推荐理由:阿里和蚂蚁团队搞了个优化,Qwen3-Omni实时对话延迟从6秒降到0.6秒,吞吐还翻了5倍多,推荐看技术博客。原文稍后读已读值得跟进有用关注 Qwen3-Omni
11:49官方账号arXiv cs.AI@Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian研究者发布了DramaSR-532K基准,包含53.2万条带注释对话和900多个角色,需整合听觉、语言和视觉线索。他们提出DramaSR-LRM方法,基于大型推理模型(LRM),通过多模态工具自主聚合上下文证据。在短话语上,DramaSR-LRM显著优于现有基线,因为声学生物特征在这些场景中不可靠。数据和代码将公开。论文DramaSR-532KDramaSR-LRM推理模型推荐理由:一篇论文用推理模型做说话人识别,还建了个53万条对话的新基准,短话识别效果比现有方法强不少。原文稍后读已读值得跟进有用关注 DramaSR-532K
11:36官方账号arXiv cs.AI@Xuehui Wang, Xuankun Yang, Wei Shen视觉Token剪枝是加速VLM的关键策略,但现有方法在密集指令和细粒度查询下难以保留关键线索。本文提出EADP框架,首先利用统计熵量化并过滤文本噪声,得到细粒度的指令相关性分数;然后通过子模最大化问题与空间先验实现非冗余的Token选择。实验表明EADP在严格Token预算下提高了VLM的精度-效率平衡,在多个多模态基准上达到SoTA性能。论文EADP视觉语言模型Token剪枝推荐理由:这篇论文用熵过滤噪声、子模选择保留细节,在VLM加速上效果不错,适合想优化推理效率的人看看。原文稍后读已读值得跟进有用关注 EADP
09:42官方一手arXiv: Google DeepMind@Ismail Ismail Tijjani, Ahmad Abubakar Mustapaha, Sunusi Ibrahim Muhammad, Muhammad Bashir Aliyu本研究评估了五种视觉语言模型(Gemini 2.0 Flash Exp、Qwen2.5-VL-7B-Instruct、GPT-4o、Claude 4 Sonnet、Llama 3.2 Vision 90b)在尼日利亚车牌识别中的零样本学习表现。使用包含88张真实环境图像的测试集,基于字符错误率(CER)指标,Gemini与Qwen在准确性和鲁棒性上显著优于其他模型。该工作对比了VLM与传统YOLO+OCR管线的优劣,并质疑了模型提供商的性能宣称。论文Gemini 2.0 Flash ExpQwen2.5-VL-7B-Instruct零样本学习推荐理由:用真实非洲场景测了5个主流VLM,发现Gemini和Qwen在车牌识别上比YOLO+OCR更准,有数据有对比。原文稍后读已读值得跟进有用关注 Gemini 2.0 Flash Exp
08:10lmarena.ai@lmarena_aiArena平台启动Claude Fable 5的Battle Mode和Agent Mode测试,覆盖文本、图像等多模态输入。用户可参与投票,直接影响最终排行榜分数。排行榜结果即将在arena.ai公布。该测试用于评估模型的多模态能力和智能体行为。AI模型Claude Fable 5ArenaBattle Mode10 个信源在谈事件专题推荐理由:Arena开始让大家测Claude Fable 5了,有Battle和Agent两种模式,你还能投票影响排名,快去试试。原文稍后读已读值得跟进有用关注 Claude Fable 5
20:15Genspark@genspark_aiGenspark 宣布 Anthropic 的 Claude Fable 5 模型已重新在 Genspark Code Agent 和 Genspark Claw 中可用。该模型被描述为 Anthropic 最强大的 Mythos-class 模型,在编程、研究、知识工作和视觉任务上达到先进水平。Genspark 称任务越长越复杂,优势越明显。用户可通过 genspark.ai 免费体验。AI模型Claude Fable 5GensparkAnthropic10 个信源在谈事件专题推荐理由:Genspark 把 Claude Fable 5 请回来了,编程、研究、视觉都好使,任务越难越强,快去试试。原文稍后读已读值得跟进有用关注 Claude Fable 5
10:14官方账号arXiv cs.AI@Md Abu Hanif Shaikh, Abdullah Al Shafi该论文提出一个面向大学利益相关者的多模态聊天助手,基于检索增强生成(RAG)架构。系统结合大语言模型(LLM)与语义检索,能够从大学手册等机构资源中生成上下文相关回答。支持文本和图像查询(通过视觉-语言模型),并采用量化推理在受限硬件上快速部署。后端使用FastAPI构建,前端基于Next.js开发,确保实时可用性。多模态评估显示,该RAG系统将幻觉率从31.7%降至6.6%,文本和图像查询均获得高满意度评分。论文RAG多模态LLM推荐理由:这篇论文介绍了一个大学多模态聊天助手,用RAG把幻觉从31.7%压到6.6%,还能处理图片提问,代码也开源了。原文稍后读已读值得跟进有用关注 RAG
09:32IT之家(博客/媒体)葡萄牙政府于7月1日发布首个基于欧洲葡萄牙语的开源大语言模型AMALIA,该模型由60多位研究人员历时18个月开发,先期投资550万欧元。第一阶段使用约4万亿个葡语单词训练出9B规模模型,并已具备理解文本、图像和声音的多模态能力。后续计划年内新增22B版本,并引入智能体能力,需追加150万欧元投资。AI模型AMALIA葡萄牙语开源模型推荐理由:葡萄牙政府新搞了个葡语开源大模型AMALIA,9B参数就能理解文本、图像和声音,年底还要出22B带智能体,搞葡语相关任务可以试试。原文稍后读已读值得跟进有用关注 AMALIA
21:48岚叔@lufzzliz一位开发者观察发现,其网站数据显示Codex用户数量多于Claude Code。但实际内部编码场景中,Claude Code的使用比重更大。该观点认为未来当模型代码能力补齐或涌现更多优秀框架后,多模态模型如GPT和Gemini可能占据更大优势。行业CodexClaude Code编程助手推荐理由:这位博主分享了Codex和Claude Code在实际使用中的差异,点出Codex用户多但内部编码Claude Code更受欢迎,还聊了多模态模型的潜力,挺接地气的。原文稍后读已读值得跟进有用关注 Codex
19:47Geek@geekbb72°Google AI Studio 推出 Gemini Omni Flash,这是一个高质量、低成本的多模态模型,专注于视频生成和对话式编辑。用户可以通过自然语言和简单提示来精炼视频。该模型已在 AI Studio 和 Gemini API 中开放使用。Gemini Omni Flash 支持多模态工作流,旨在降低视频生成的门槛。AI模型Google AI StudioGemini Omni Flash视频生成推荐理由:Google 出了个便宜好用的视频生成模型 Gemini Omni Flash,直接用自然语言改视频,快去 AI Studio 试试。原文稍后读已读值得跟进有用关注 Google AI Studio
12:51量子位@量子位的朋友们Om AI联汇发布了VLX模型,这是全球首个面向物理世界的端侧流式多模态模型。VLX支持实时视频流分析,能够在边缘设备上运行。它适用于机器人、自动驾驶、智能家居等场景,实现了低延迟的物理世界交互。模型采用了创新的流式架构,兼顾了性能和效率。AI模型VLXOm AI多模态推荐理由:Om AI联汇发布的VLX模型,能在手机上实时看懂视频流,适合做机器人或智能硬件的AI大脑,跟云端模型比延迟低得多。原文稍后读已读值得跟进有用关注 VLX
09:52官方账号arXiv cs.LG@Johan Land该论文针对ARC-AGI-2视觉推理基准提出一种新求解器,将文本、图像和代码作为独立搜索算子生成多样候选轨迹,并通过上下文保留的整体判断模型在长上下文提示中联合比较所有候选。在ARC Prize半私有评估集上取得72.9%准确率,成本38.99美元/任务,超过GPT-5.2 Pro的54.2%和Gemini 3 Pro的54.0%。在公开评估集上达到76.1%,成本19.69美元/任务。作者开源完整代码,并报告了负面结果,如规定性提示模板和迭代细化会系统性降低假设多样性。论文ARC-AGI-2GPT-5.2 ProGemini 3 Pro推荐理由:这篇论文的方法很实在,用多模态搜索加整体判断,在ARC-AGI-2上做到了72.9%,比GPT-5.2 Pro高了将近19个点,代码还开源了。原文稍后读已读值得跟进有用关注 ARC-AGI-2
09:21官方账号Google DeepMind@GoogleDeepMindGoogle DeepMind 推出 Gemini Omni Flash,支持通过自然语言进行会话视频编辑。该模型可同时引用图片、文本和视频帧,组合多模态输入来操控视频动作。它还能利用真实世界知识,直接连接文字与图形到视频输出。目前已在 Google AI Studio、Gemini API 及 Gemini Enterprise Agent Platform 可用。AI模型Gemini Omni FlashGoogle DeepMind多模态推荐理由:Google DeepMind 的新模型 Gemini Omni Flash 能边聊天边剪视频,还能把文字和图片直接变成视频操作,很实用。现在在 Google AI Studio 就能试。原文稍后读已读值得跟进有用关注 Gemini Omni Flash
08:54berryxia@berryxiaGoogle推出Nano Banana 2 Lite图像模型,4秒内完成单次出图。同时发布Gemini Omni Flash多模态模型,支持视频生成和对话式编辑。两者串联形成从图像到视频的快速闭环,演示中上传照片后快速生成多个室内设计方案并直接动画化。该链路大幅降低生成成本,速度相比主流模型更激进。AI模型Nano Banana 2 LiteGemini Omni FlashGoogle10 个信源在谈事件专题推荐理由:Google把Nano Banana 2 Lite和Omni Flash串起来,先4秒出图再直出动画,比主流模型快且便宜。创意迭代更爽。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
05:18Google AI Developers@googleaidevs72°Google推出Nano Banana 2 Lite,号称最快、最经济的Gemini图像模型,专为高吞吐量开发者管道优化。同时发布的Gemini Omni Flash支持视频生成和编辑。两款模型即日起通过Google AI Studio和Gemini API可用。AI模型Nano Banana 2 LiteGemini Omni FlashGoogle AI Studio10 个信源在谈事件专题推荐理由:Google发了两个新模型:Nano Banana 2 Lite图像模型更快更省钱,还有Gemini Omni Flash能做视频生成和编辑,今天就能在API上用了。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
04:51Hailuo AI@Hailuo_AIMiniMax(海螺 AI)作为第 28 届上海国际电影节官方合作伙伴,在 6 月 14-15 日举办了名为“AI Backlot”的 AI 创作体验活动。活动期间,MiniMax 正式推出了产品 Hub,并展示了创作者在短短一个月内完成的电影作品。该活动汇聚了传统电影人、AI 创作者与行业专业人士,共同探讨 AI 如何将想象力转化为实际生产力。AI产品MiniMaxHailuo多模态推荐理由:MiniMax 在上海电影节上正式发布了 Hub 平台,还展示了用 AI 一个月拍出电影的成果,想看 AI 视频工具怎么落地影视创作可以了解下。原文稍后读已读值得跟进有用关注 MiniMax
04:27官方账号Google DeepMind@GoogleDeepMindGoogle DeepMind 发布 Interactions API,允许将 Nano Banana 2 Lite 和 Gemini Omni Flash 两个模型串联使用。用户可先用 Nano Banana 2 Lite 生成图像,再通过 Gemini Omni Flash 将其动画化。该 API 支持会话历史,可堆叠最多三次顺序编辑。AI产品Google DeepMindInteractions APINano Banana 2 Lite10 个信源在谈事件专题推荐理由:DeepMind 让 Nano Banana 和 Gemini Omni 能配合干活了,先画图后动画,还能连续改三次,挺实用。原文稍后读已读值得跟进有用关注 Google DeepMind
04:22lmarena.ai@lmarena_ai精选77°Claude Sonnet 5 正式加入 Agent Arena,该平台衡量模型在数百万个来自全球用户的真实世界长周期智能体任务上的表现。模型可调用网络搜索、文件系统和终端工具完成复杂工作流。排行榜使用因果追踪方法,将模型性能相对平均水平进行量化。除 Agent Arena 外,Sonnet 5 还支持文本、视觉、文档和代码前端的 Arena 评测。AI模型Claude Sonnet 5Agent ArenaAnthropic10 个信源在谈事件专题推荐理由:Anthropic 发布了更智能的 Sonnet 5,能在 Agent Arena 里自主用浏览器和终端干活,比几个月前的大模型还强。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
01:25Philipp Schmid@_philschmid精选Nano Banana 2 Lite(gemini-3.1-flash-lite-image)生成图像仅需约4秒,成本0.034美元。Gemini Omni Flash API 预览版通过对话生成和编辑视频,价格0.10美元/秒,最长10秒视频,与Veo 3.1 Fast同价。该API结合Gemini的世界知识,支持多轮视频编辑(如改成日落、加雨、换产品),每会话最多3次连续编辑。AI产品Nano Banana 2 LiteGemini Omni Flash API视频生成10 个信源在谈事件专题推荐理由:Google今天发了两个新API:一个4秒生图才3分4,另一个能边聊边改视频,价格和Veo 3.1一样。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
23:29IT之家(博客/媒体)2026年6月29日,华为与陕文投联合开发的“博观文旅大模型”在西安实现规模化应用,这是全球首个商用的多模态文旅大模型。该模型依托1.2PB文旅数据集,包含3100万张图片、440万分钟文博影像等。其支撑开发的AI伴游智能体已覆盖超400万用户,非遗数字IP衍生产品销售额超200万元。此外,“博观”还基于昇腾算力底座,成为首个以文化保护和传承为核心的行业大模型。AI模型博观文旅大模型华为陕文投1 个信源在谈事件专题推荐理由:华为和陕文投把多模态大模型用在了文旅行业,能生成博物馆级文物内容,还能做非遗IP,已服务400万用户,值得看看。原文稍后读已读值得跟进有用关注 博观文旅大模型
13:17Geek@geekbb精选Qwythos 9B 基于 Qwen3.5-9B,在 5 亿 token 的 Claude 思维链轨迹上全参数微调,可处理 1M 上下文。支持原生 Function Calling 和多模态视觉(图像+文本)。GGUF 量化后仅 5.2 GiB,可在低配设备上运行。该模型为开源且未经审查。AI模型Qwythos 9BQwen3.5-9BClaude推荐理由:Empero AI 开源的 Qwythos 9B 把 Qwen3.5 和 Claude 思维链结合,1M 上下文加 Function Calling,量化后 5.2GB 的推理模型,低配机器也能跑。原文稍后读已读值得跟进有用关注 Qwythos 9B
11:51官方账号arXiv cs.LG@Chuxiao Zuo, Yao Zhu, Minqiang Xu, Manhong Wang, Yunke Zhang, Fei Huang提出自适应模态路由(AMR)模块,用于多模态多语言说话人识别。AMR使用W2V-BERT 2.0音频编码器和IResNet-18人脸编码器,通过可训练路由器动态分配模态权重。在POLY-SIM 2026评估集上,系统在4个协议上的平均准确率达99.07%,比FOP基线提升32.73%。具体成绩:英语多模态99.93%,乌尔都语多模态100.00%,英语仅音频97.50%,乌尔都语仅音频98.83%。论文W2V-BERT 2.0IResNet-18AMR推荐理由:这篇用AMR动态融合音视频特征,缺失模态也能准确识别说话人。在POLY-SIM上平均99%准确率,比基线高32%,很实用。原文稍后读已读值得跟进有用关注 W2V-BERT 2.0
11:22官方账号arXiv cs.LG@Haitao Wu, Qirui Zhang, Zhouheng Yao, Shangquan Sun, Qihao Zheng, Mianxin Liu, Chi Zhang, Wanli Ouyang, Chunfeng Song, Changqing Zhang, Jiamin WuBrainJanus是首个将脑、视觉和语言整合到单一框架的统一脑模型。它引入Unified Brain Tokenizer将连续神经活动量化为离散Token,并与视觉和语言表征对齐到共享的Omni空间。基于All-in-One自回归架构,该模型通过下一个Token预测实现图像到脑、文本到脑的编码以及脑到图像、脑到文本的解码。在多项基准测试中,BrainJanus取得优越性能,并展现出零样本泛化能力和可解释的生物拓扑结构。代码已在GitHub开源。论文BrainJanus脑机接口多模态推荐理由:这篇论文提出了BrainJanus,一个能双向翻译脑信号与图像、文本的统一模型,在零样本和生物可解释性上突破传统方法。原文稍后读已读值得跟进有用关注 BrainJanus
10:21官方账号arXiv cs.AI@Chao Tian, Zikun Zhou, Chao Yang, Guoqing Zhu, Zhenyu He本文提出一种稀疏跨模态融合机制用于RGB-T目标检测,避免传统方法中双重骨干网络和全局融合的高计算成本。该方法先通过轻量级单模态检测器快速扫描图像,生成高召回率的候选区域(RoI),再对稀疏的候选区域进行跨模态特征融合以精化检测结果。两阶段框架显著降低了参数和计算成本,同时在高分辨率图像上保持可扩展性。实验证明该方法在保持竞争力的前提下实现高效检测。论文RGB-T稀疏融合目标检测推荐理由:这篇论文找到了一种聪明的方法:先快速扫一遍图像找出可能的目标区域,再只对这几个区域做多模态融合,省了很多计算。适合想做轻量级多模态目标检测的人读。原文稍后读已读值得跟进有用关注 RGB-T
10:16官方账号arXiv cs.AI@Elys Allesiardo, Antoine Caubrière, Valentin Vielzeuf该论文深入分析了非序列多模态句子级嵌入,重点研究SONAR模型。研究发现某些嵌入维度对扰动敏感,可作为解码异常的指示器。通过利用编码与解码间的一致性,构建了准确的异常检测器。论文还探索了修改特定维度以尝试纠正异常。论文SONAR多模态嵌入推荐理由:这篇论文用SONAR模型把嵌入维度玩出花了,直接用一致性检测解码异常,还尝试修正,挺有意思的。原文稍后读已读值得跟进有用关注 SONAR
01:57官方一手AWS Machine Learning Blog@Sanghwa Na精选AWS 博客展示如何用 Amazon Nova 2 Lite 和 Claude Sonnet 4.6 构建两模型管道,用于扫描文档的数字化。Nova 2 Lite 在单次调用中完成多模态提取(检测照片、提取姓名坐标、返回页面元数据)。Claude Sonnet 4.6 根据版面布局进行空间推理,将姓名和面孔匹配。该管道在 Amazon Bedrock 上运行,通过分工降低总处理成本。技巧Amazon Nova 2 LiteClaude Sonnet 4.6Amazon Bedrock1 个信源在谈事件专题推荐理由:用 Nova 2 Lite 做粗提取,Claude Sonnet 4.6 做精准匹配,文档数字化省心又省钱。原文稍后读已读值得跟进有用关注 Amazon Nova 2 Lite
18:50量子位@量子位的朋友们OceanBase推出AI数据库版本,将湖仓一体、多模态数据与AI能力集成于单一引擎。该版本支持SQL+AI混合查询,可同时处理结构化表格、非结构化文本及图片等数据。OceanBase在TPC-C、TPC-H等基准测试中保持领先性能,新版本使企业无需额外ETL即可直接运行AI模型。AI产品OceanBase数据库多模态推荐理由:OceanBase这次更新把数据库和AI揉在一起了,一个引擎搞定表格、文本和图片,省了来回搬数据的麻烦。原文稍后读已读值得跟进有用关注 OceanBase
16:34官方一手pandaily@contact@pandaily.com (Pandaily)具身智能公司智平方(Zhipingfang)完成约50亿元新融资。其估值突破200亿元(约28亿美元),成为粤港澳大湾区首个具身智能独角兽。核心采用类脑NeuroVLA架构,模拟人脑多模态信息处理机制。行业ZhipingfangNeuroVLA具身智能推荐理由:智平方刚融了50亿,估值200亿,靠类脑NeuroVLA搞具身智能,大湾区第一个独角兽,挺有看头。原文稍后读已读值得跟进有用关注 Zhipingfang
13:50官方账号阿里云 Alibaba Cloud@alibaba_cloud在Flink Forward Asia Shenzhen 2026上,NVIDIA的Chuan Chen介绍了与阿里云的技术合作。双方通过CUDA库加速Apache Flink的多模态数据流处理。这一开源协作实现了端到端高性能多模态流式架构,适用于AI评论、实时图文流和交互式问答。行业NVIDIAAlibaba CloudApache Flink7 个信源在谈事件专题推荐理由:NVIDIA和阿里云用CUDA把Flink的多模态数据处理速度拉满了,想做实时AI评论或图文问答的可以看看这个架构。原文稍后读已读值得跟进有用关注 NVIDIA
13:50官方账号阶跃星辰 Stepfun@Stepfun_AIStepFun(阶跃星辰)推出初创公司计划,为早期AI团队提供支持。入选团队可获得API额度、专属生态系统支持、联合营销机会、展示位置及合作伙伴引荐。该计划面向构建多模态应用和智能体系统的团队。申请现已开放。行业StepFun多模态智能体推荐理由:StepFun给早期AI团队送API额度、资源和曝光,做多模态或智能体项目的小伙伴可以试试,链接在推文里。原文稍后读已读值得跟进有用关注 StepFun