模型精选73°10:43多模态自回归扩散Transformer架构发布新发布的架构融合了语言和视频模型优势,从零开始预训练,多模态处理能力强。#多模态#Transformer#自回归扩散#视频模型AI Will@FinanceYF5原文稍后读已读值得跟进有用关注 多模态
模型73°10:33World Labs 发布 Atlas 多模态世界模型World Labs 推出 Atlas,首个能精确控制相机并生成 3D 内容的世界模型,比传统方法更逼真。#Atlas#World Labs#多模态#世界模型AI Will@FinanceYF5原文稍后读已读值得跟进有用关注 Atlas
模型中美对照73°10:18Qwen3.8-Max-0902发布阿里升级了Qwen3.8-Max到0902版本,参数量和上下文都大幅提升,企业级任务表现更强,价格也公布了。#Qwen3.8-Max-0902#Qwen#阿里巴巴#多模态官方账号阿里通义 Qwen@Alibaba_Qwen原文稍后读已读值得跟进有用关注 Qwen3.8-Max-0902
模型精选73°10:15Facet-0:机器人基础模型实现高精度装配Facet-0 模型通过预测和评估接触后果,让机器人能完成高精度装配,成功率比最强基线高出 5 倍多。#Facet-0#机器人#精密装配#强化学习aarXiv cs.LG@Haoyuan Deng 等 9 人原文稍后读已读值得跟进有用关注 Facet-0
模型78°09:58李飞飞团队发布多模态世界模型Atlas李飞飞团队推出Atlas,能精确控制镜头生成视频和3D重建,比开源模型更强。#World Labs#Atlas#李飞飞#多模态IIT之家原文稍后读已读值得跟进有用关注 World Labs
模型Agent 与开发者多源确认73°08:29Claude发布Fable 5.1与Mythos 5.1双模型Anthropic发布Fable 5.1和Mythos 5.1,前者编程能力大幅提升且成本降低25%,后者专注网络安全和生命科学领域。#Claude#Fable#Mythos#编程助手10 个信源在谈事件专题shao__meng@shao__meng11 个信源在谈原文稍后读已读值得跟进有用关注 Claude
模型中美对照73°08:28Google为Gemini推出Agentic Video UnderstandingGoogle给Gemini加了个新功能,看视频更聪明还省钱,能自己决定看哪里,长视频分析成本大降。#Gemini#Agentic Video Understanding#Google#多模态shao__meng@shao__meng原文稍后读已读值得跟进有用关注 Gemini
模型78°08:28World Labs 发布多模态世界模型 AtlasWorld Labs 推出的 Atlas 模型能同时生成、重建和仿真世界,用几何输入而非文本控制相机,在3D重建上超越专用SOTA模型。#Atlas#World Labs#多模态#世界模型shao__meng@shao__meng原文稍后读已读值得跟进有用关注 Atlas
模型中美对照多源确认精选73°08:23Claude Fable 5.1 发布Anthropic 发布了 Fable 5.1,在科学基准测试中大幅领先,推理级别设置对创意输出质量影响显著。#Claude#Fable#推理模型#多模态7 个信源在谈事件专题S官方账号Simon Willison’s Weblog8 个信源在谈原文稍后读已读值得跟进有用关注 Claude
产品Agent 与开发者04:29Fable 5.1 上线 Vercel AI GatewayVercel 上线了 Fable 5.1,一个多模型平台,fx.sh 即可体验#Fable#Vercel#AI Gateway#多模态Guillermo Rauch@rauchg原文稍后读已读值得跟进有用关注 Fable
产品中美对照多源确认03:47Anthropic发布Fable 5.1版本Anthropic的Fable 5.1更便宜限制更少,比前版本更实用。#Fable#Anthropic#多模态10 个信源在谈事件专题techcrunch@Russell Brandom11 个信源在谈原文稍后读已读值得跟进有用关注 Fable
模型73°03:47World Labs发布Atlas多模态世界模型World Labs团队发布了Atlas,首个多模态世界模型,能从单张图重建3D场景,还能模拟时空,比现有模型更精确。#Atlas#World Labs#多模态#世界模型官方账号Fei-Fei Li@drfeifei原文稍后读已读值得跟进有用关注 Atlas
产品73°03:45Claude Fable 5.1 登陆 Devin Desktop 和 CLIDevin 上线了更便宜的 Fable 5.1,价格比 Opus 还低,成本降了 47%#Claude#Fable#Devin#多模态Windsurf@windsurf_ai原文稍后读已读值得跟进有用关注 Claude
模型中美对照多源确认73°03:45Claude发布Fable 5.1模型Claude新出的Fable 5.1比Opus 5成本更低,特别适合科学工作流,是日常使用的不错选择。#Claude#Fable 5.1#Opus 5#多模态3 个信源在谈事件专题elvis@omarsar04 个信源在谈原文稍后读已读值得跟进有用关注 Claude
产品03:28Milvus 3.0 推出 StructArray 功能Milvus 3.0 新增 StructArray,一个实体可存多个向量,视频搜索、文档检索更精准。#Milvus#向量数据库#多模态#智能体Milvus@milvusio原文稍后读已读值得跟进有用关注 Milvus
产品官方一手03:21Gemini引入智能体视频理解功能Google给Gemini加了视频理解新功能,能看懂视频内容并回答问题,比普通视频分析更智能。#Gemini#视频理解#智能体#多模态G官方一手Google DeepMind: Blog原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认93°03:15Anthropic发布Claude Fable 5.1和Mythos 5.1Anthropic发布Fable 5.1和Mythos 5.1,科研能力翻倍,缓存成本降75%,企业数据留存问题解决。#Claude#Fable#Mythos#Anthropic10 个信源在谈事件专题宝玉@dotey11 个信源在谈原文稍后读已读值得跟进有用关注 Claude
模型03:03World Labs发布多模态世界模型AtlasWorld Labs的Atlas能模拟真实世界物理规律,不同于语言模型,支持3D重建和像素级相机控制。#Atlas#World Labs#多模态#世界模型a16z@a16z原文稍后读已读值得跟进有用关注 Atlas
产品73°02:24DeepSeek V4 Flash 支持原生视觉功能DeepSeek V4 Flash 在 Fireworks 上新增视觉功能,价格不变但性能提升,性价比更高。#DeepSeek#Fireworks#视觉模型#多模态Fireworks AI@FireworksAI_HQ原文稍后读已读值得跟进有用关注 DeepSeek
产品Agent 与开发者02:18Gemini实现跨视频内容动态推理GoogleDeepMind让Gemini能同时分析视频文本、音频和画面,只提取关键帧,长视频处理效率大增。#Gemini#GoogleDeepMind#视频理解#多模态官方账号Google DeepMind@GoogleDeepMind原文稍后读已读值得跟进有用关注 Gemini
产品中美对照17:08Claude手写互动学习软件发布Claude现在能和你手写对话了,像哈利波特日记一样,还能在书上做批注出题。#Claude#手写互动#学习软件#电子书小互@imxiaohu原文稍后读已读值得跟进有用关注 Claude
模型中美对照78°11:28科大讯飞开源百万 Token 端侧模型 X2.5-4B 和 1.7B科大讯飞开源百万 Token 端侧模型,支持完整售后手册分析,可部署于机器人或边缘设备,9月7日还将发布293B版本。#星火 X2.5-4B#星火 X2.5-1.7B#科大讯飞#端侧模型IIT之家原文稍后读已读值得跟进有用关注 星火 X2.5-4B
论文73°10:11GarmentWeaver:多模态服装结构化生成GarmentWeaver能从草图和文本生成可执行缝纫模式,比现有方法更准确且兼容性好。#GarmentWeaver#多模态#服装设计#视觉语言模型aarXiv cs.AI@Yinwen Lu 等 3 人原文稍后读已读值得跟进有用关注 GarmentWeaver
技巧Agent 与开发者多源确认精选09:33用 Grok Bot 搭建 AI 工程师团队Grok Bot 团队分享如何用 5 个专业 bot 组建 AI 工程团队,能同时管理 200+ cloud agent,还包含夜间审计等进阶玩法。#Grok Bot#AI 工程师团队#智能体#cloud agent2 个信源在谈事件专题shao__meng@shao__meng3 个信源在谈原文稍后读已读值得跟进有用关注 Grok Bot
论文精选09:19MedCache:纵向临床智能体的高效时效记忆框架MedCache解决了临床智能体如何处理跨时间、跨专科患者记录的难题,比传统方法更准确高效。#MedCache#临床智能体#多模态#记忆管理aarXiv cs.LG@Hei Ting 等 8 人原文稍后读已读值得跟进有用关注 MedCache
模型中美对照73°08:14Qwen3.8-Flash-Next在Agent Arena排名第7阿里Qwen3.8-Flash-Next在Agent Arena排名第7,比前代模型提升2.4%,任务完成率高达12.3%。#Qwen3.8-Flash-Next#Alibaba_Qwen#Agent Arena#开源模型lmarena.ai@lmarena_ai原文稍后读已读值得跟进有用关注 Qwen3.8-Flash-Next
模型73°05:18Runway发布Solaris界面世界模型Runway的Solaris能实时生成界面,无需代码,比其他大模型表现更好。#Solaris#Runway#界面世界模型#多模态elvis@omarsar0原文稍后读已读值得跟进有用关注 Solaris
模型73°00:48微软发布GigaPath-Flash和GigaTIME-Flash病理模型微软新出的病理模型用更少算力做更多事,适合大规模研究#GigaPath-Flash#GigaTIME-Flash#微软#病理模型官方账号Microsoft Research@MSFTResearch原文稍后读已读值得跟进有用关注 GigaPath-Flash
产品00:45荣耀 Magic8 AI 追色功能升级荣耀给 Magic8 的 AI 追色加了调色盘功能,现在能精细调影调和颜色了,比之前更专业。#荣耀#Magic8#AI追色#端侧AIIIT之家原文稍后读已读值得跟进有用关注 荣耀
模型Agent 与开发者多源确认73°21:47DeepSeek-V4-Flash-Vision-Exp 开源发布DeepSeek 10 天前发布 API,10 天后就开源了这款 305B 参数的多模态模型,性价比超高。#DeepSeek-V4-Flash-Vision-Exp#DeepSeek#多模态#开源模型2 个信源在谈事件专题shao__meng@shao__meng3 个信源在谈原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-Vision-Exp
模型中美对照精选73°19:41DeepSeek-V4-Flash-Vision-Exp 模型开源DeepSeek 开源了支持图片输入的 V4-Flash-Vision-Exp,多模态能力接近 Opus-4.8,还能做图文分析。#DeepSeek-V4-Flash-Vision-Exp#DeepSeek#多模态#AgentIIT之家原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-Vision-Exp
产品18:17H3 Max可构建AI开放世界RPGH3 Max让开发者能构建真实AI开放世界RPG,玩家可自主决策且无延迟。#H3 Max#Hailuo_AI#RPG#游戏开发1 个信源在谈事件专题Hailuo AI@Hailuo_AI2 个信源在谈原文稍后读已读值得跟进有用关注 H3 Max
产品16:20海信发布家庭智能伴侣级AIOS JUOS海信JUOS电视系统懂你所需,能根据家庭成员自动调整界面,还能通过剧情找电影片段,比普通电视智能多了。#海信#JUOS#星海大模型#智能电视1 个信源在谈事件专题IIT之家2 个信源在谈原文稍后读已读值得跟进有用关注 海信
产品多源确认精选73°15:36OpenClaw 2.0 版本发布,933位贡献者参与OpenClaw团队意外发布2.0大版本,简化安装、重构浏览器、新增多人协作功能,边开飞机边换引擎完成系统重构。#OpenClaw#Claude#ChatGPT#多模态3 个信源在谈事件专题shao__meng@shao__meng4 个信源在谈原文稍后读已读值得跟进有用关注 OpenClaw
论文09:33RetailAgent:多模态LLM交易代理的结构性逆向时机这篇论文研究了LLM交易代理是否存在可预测的结构性行为,发现其决策存在稳定的逆向时机模式。#RetailAgent#LLM#多模态#交易代理aarXiv cs.AI@Yupeng Zhang 等 5 人原文稍后读已读值得跟进有用关注 RetailAgent
论文09:32MAP:多模态无障碍规划基准测试MAP基准测试首次评估AI系统如何帮助有无障碍需求的用户规划实地访问,包含主张验证和视觉证据检索两项创新评估。#MAP#多模态#无障碍规划#基准测试aarXiv cs.AI@Jason Armitage 等 6 人原文稍后读已读值得跟进有用关注 MAP
论文73°09:04跨模态统一城市交通需求预测TransMod解决了多模态交通预测难题,能在数据不足时从其他交通模式迁移知识,提升预测准确性。#TransMod#城市交通#多模态#时空预测aarXiv cs.LG@Yixuan Zhao, Man Luo原文稍后读已读值得跟进有用关注 TransMod
模型中美对照78°17:16华为云发布瑞智病理大模型 RuiPath 2.0华为云和瑞金医院出了个病理大模型,7B参数覆盖19种癌症,205项诊断任务,还能在普通电脑上运行。#RuiPath#华为云#瑞金医院#病理大模型IIT之家原文稍后读已读值得跟进有用关注 RuiPath
模型中美对照多源确认73°13:31OpenAI Astra模型演示样本流出OpenAI的Astra模型1次交互就能生成游戏和3D对象,比GPT-5.6 Sol推理时间长但能力更强。#OpenAI#Astra#GPT-6#GTA4 个信源在谈事件专题IIT之家5 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
模型官方一手精选09:41Code-as-World:将视频转为可执行物理程序MIT新系统把视频转成可编辑的物理程序,能训练AI理解真实世界物理规律。#Code-as-World#MuJoCo#物理推理#多模态官方一手marktechpost@Michal Sutter原文稍后读已读值得跟进有用关注 Code-as-World