13:49官方账号阶跃星辰 Stepfun@Stepfun_AI精选Step 3.7 Flash 是开源多模态推理模型,现已在 DeepInfra API 上线。该模型支持私有端点部署,适用于专用负载场景。它专为智能体编码、工具使用、搜索和视觉工作流设计。开发者可通过 DeepInfra 的 API 直接调用。AI模型Step 3.7 FlashDeepInfra多模态推荐理由:Step 3.7 Flash 开源多模态推理模型刚上线 DeepInfra,支持私有部署,适合智能体编程和视觉任务,开发者可以试试。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
13:49官方账号Microsoft AI@MicrosoftAI微软的 MAI-Image-2.5 在 Artificial Analysis 的文本到图像榜单中排名第2,图像编辑排名第3。该模型能对图像进行精确编辑,例如将雨窗模糊场景转换为清晰街景,同时保持物体一致性、光照、反射和场景几何。模型现已通过 Foundry API、MAI Playground 和 OpenRouter 提供使用。AI模型MAI-Image-2.5Microsoft图像生成1 个信源在谈事件专题推荐理由:微软 MAI-Image-2.5 图像生成排第2、编辑排第3,还能把雨窗变清晰,想用去 Foundry API 或 OpenRouter 试试。原文稍后读已读值得跟进有用关注 MAI-Image-2.5
13:49官方账号阶跃星辰 Stepfun@Stepfun_AIStepFun 的 Step 3.7 Flash 模型已在 AI 平台 ZenMuxAI 上架。该模型支持多模态输入,针对实际工作流优化,推理速度较快。用户可在 ZenMuxAI 上免费使用该模型30天。AI模型Step 3.7 FlashZenMuxStepFun推荐理由:StepFun 的新模型 Step 3.7 Flash 上线 ZenMux,多模态且快,还能免费用一个月,想试试的别错过。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
13:49官方账号Jasper AI@heyjasperai精选72°Jasper Research 宣布推出 MONET 数据集,从 29 亿张图片中精炼出 1.049 亿张高质量样本,成为全球最大的开放文本-图像数据集。该数据集采用 Apache 2.0 许可,可免费商用。同时发布的 nano-t2i 方案支持在单张 GPU 上训练有竞争力的文生图模型。AI模型MONETJasper Researchnano-t2i推荐理由:Jasper Research 放出了 MONET 数据集,有 1 亿多张图,免费商用,还能用 nano-t2i 在单卡上训练模型,做文生图的值得试试。原文稍后读已读值得跟进有用关注 MONET
11:20Latent.Space@latentspacepodOpenAI首席研究官Mark Chen在播客中讨论了AGI距离,认为模型正越来越接近自主创新。他重申扩展定律和预训练仍然关键,并透露OpenAI如何分配算力。他还指出评估基准正面临危机,模型需提升长周期任务与多模态推理能力。行业OpenAIMark ChenAGI10 个信源在谈事件专题推荐理由:OpenAI内部的人聊AGI有多远,还讲了评估危机和长周期学习,干货不少。原文稍后读已读值得跟进有用关注 OpenAI
11:39IT之家(博客/媒体)Mistral AI 于6月23日发布OCR 4文档识别模型。该模型支持横跨10个语族的170种语言,在OmniDocBench基准上获得93.07分,优于GPT 5.5 Pro和Gemini 3.1 Pro Preview。OCR 4提供边框、区域分类和置信度评分,并支持RAG语义分块等下游任务。基础API定价每千页4美元,批处理可享50%优惠。AI模型Mistral AIOCR 4多模态3 个信源在谈事件专题推荐理由:Mistral出了新OCR模型,支持170种语言,评分比GPT和Gemini都高,处理文档识别可以试试它。原文稍后读已读值得跟进有用关注 Mistral AI
10:52官方账号arXiv cs.AI@Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang JiangOmniAct 提出了一个分层异步架构,将多模态语义规划器、基于事件边界压缩的自适应分层记忆和异步视觉抢占引擎模块化集成,以解决持久自主机器人的跨域工具调用与物理故障恢复问题。在40个真实世界长期任务中,使用两个机器人平台协调四个IoT设备,OmniAct在所有复杂度级别上端到端成功率一致提升,累积超过10万交互token时保持接近线性的token消耗,并让中等规模开源模型达到闭源模型性能。AI模型OmniAct具身智能多模态推荐理由:他们搞了个新架构,让机器人能自己协调API、物联网和物理动作,干活出错还能自己恢复,20个任务里成功率都比之前高,而且省钱省token。原文稍后读已读值得跟进有用关注 OmniAct
09:39向阳乔木@vista8一个团队展示了能实时计数乒乓球颠球数的AI系统,并认为Physical AGI需要满足三个必要条件:统一的多模态大脑(非模型拼接)、在同一个大脑中完成任意模态的理解与生成、理解与生成以流式方式持续运行。最关键的一点是该大脑必须完整运行在端侧。团队还提供了更多介绍和演示视频。AI模型Physical AGI多模态端侧模型推荐理由:看看这个团队对Physical AGI的看法,他们提出了3+1个必要条件,还做了颠球计数的演示,强调端侧运行和统一多模态大脑。原文稍后读已读值得跟进有用关注 Physical AGI
03:54Mustafa Suleyman@mustafasuleyman精选72°Microsoft 发布 MAI-Image-2.5,在 Artificial Analysis Image Arena 文本到图像基准中排名第2,仅次于 OpenAI 的 GPT Image 2。其图像编辑能力排名第3,仅次于 OpenAI 模型,性能与 Google 的 Nano Banana 2 相当。MAI-Image-2.5 最大输出约 1MP 分辨率,支持灵活宽高比和 32K token 上下文。定价为每千张图 $48(Flash 变体 $20),可通过 Foundry API 和 MAI Playground 使用。AI模型MAI-Image-2.5Microsoft文本到图像10 个信源在谈事件专题推荐理由:微软新出的 MAI-Image-2.5 图像生成和编辑都很强,排名只输给 OpenAI,价格也透明,值得试试看。原文稍后读已读值得跟进有用关注 MAI-Image-2.5
16:06IT之家(博客/媒体)精选商汤科技正在研发代号U1 Pro的多模态模型,聚焦设计场景,对标OpenAI GPT-Image 2。该模型由联合创始人林达华牵头,属于日日新家族,预计7月启动内部邀请测试。支持8K分辨率输出,能实现设计-生成-评审长程循环。内部评测显示,相同提示词下U1 Pro生成图片质量接近甚至优于GPT-Image 2。LMSYS Chatbot Arena中GPT-Image 2文生图评分领先谷歌Nano Banana 2。AI模型商汤科技U1 ProGPT-Image 210 个信源在谈事件专题推荐理由:商汤新模型U1 Pro专攻设计,对标GPT-Image 2,内部评测更优,支持8K输出,7月内测。原文稍后读已读值得跟进有用关注 商汤科技
11:01官方账号arXiv cs.AI@Yu-Yang Chen, Lan-Zhe GuoTriViewBench 是一个基于合成3D场景的受控多视图视觉推理基准,包含1,923个场景和超过14K个问答对,分为4个复杂度级别和3个推理类别:局部决策、物体计数和全局恢复。评估18个开源和闭源MLLMs发现,所有模型能力排序一致(局部决策>物体计数>全局恢复),且随着复杂度增加性能单调下降:局部决策下降12.11%,物体计数下降59.14%,全局恢复骤降80.02%。错误分析表明,单视图任务中因遮挡导致欠计数,多视图任务因跨视角身份混淆导致过计数。Chain-of-Thought提示几乎无收益(Δ=-0.16%),表明瓶颈在于跨视角空间表示而非推理策略。论文TriViewBenchMLLMs多模态推荐理由:这篇论文用TriViewBench测了18个多模态模型,发现它们都在多视图推理上崩得厉害,CoT也救不了。想了解当前MLLM的结构推理极限,可以看看。原文稍后读已读值得跟进有用关注 TriViewBench
10:45官方账号arXiv cs.LG@Akshay Paruchuri, Sanmi Koyejo, Ehsan Adeli精选论文提出Facet-Probe审计框架,从选项、证据块、文档排序、图像集、混合模态五个维度测试18个前沿和开源MLLM的排序敏感性。采用贝叶斯项目反应模型分离排序噪声与各维度偏差,发现所有模型均非排序不变,各维度平均翻转率在24%至50%之间。Gemini在温度0下的同序控制显示,验证单元中存在远超解码器噪声的排序超额。最优模型仍有13.4%的试次输出翻转,提示词级缓解措施无法泛化到视觉推理。论文Facet-ProbeMLLMGemini推荐理由:这篇论文用Facet-Probe测试了18个主流多模态大模型,发现它们对输入顺序都很敏感,最好的模型也错13.4%,提醒我们模型可靠性还不是想象中那么好。原文稍后读已读值得跟进有用关注 Facet-Probe
09:40官方一手arXiv: OpenAI@Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken论文介绍了Falco eleonorae,一个面向希腊小岛农民的双语(希腊语主、英语次)对话式AI助手。系统利用OpenAI GPT-5家族模型进行回答生成,并通过MCP工具查询本地作物、季节性日历、方言词汇等结构化数据。它支持语音输入(使用欧盟流式语音转文字服务)和图像描述(由视觉模型处理),并设计为渐进式Web应用以适应低带宽环境。作者论证,对于资源受限的农村部署,这种托管式检索增强方案比自托管模型更可靠且更易实现。论文Falco eleonoraeGPT-5MCP/工具5 个信源在谈事件专题推荐理由:OpenAI的GPT-5给希腊农民做了个接地气的AI助手,能说方言、看图、查作物日历,比通用聊天更实用。原文稍后读已读值得跟进有用关注 Falco eleonorae
08:42lmarena.ai@lmarena_ai精选72°Wan-2.7 I2V在视频生成竞技场中取得第5名,得分1,434。该排名来自与顶级模型的一对一对决,由全球用户在其创作任务中投票选出。它超越了Grok Imagine Video(720p)和所有Google Veo-3.1变体。该模型支持文本、图像、音频和视频的多模态控制,以及最多5个参考输入的角色自定义。阿里通义万相团队还提供了视频编辑、克隆、重风格化等全栈工具。AI模型Wan-2.7AlibabaVideo Arena推荐理由:阿里通义万相出了个新视频模型Wan-2.7,在Video Arena排第5,干掉了Grok和Veo,视频创作能力挺强,可以试试。原文稍后读已读值得跟进有用关注 Wan-2.7
01:25elvis@omarsar0精选作者完全改用语音而非文字输入与AI代理交互,发现音频描述越详细、越长,代理结果越好。他还开发了屏幕录制、截图、追踪鼠标动作和语音注释功能,帮助代理处理设计和精确开发任务。多模态提示(语音+屏幕+动作)显著提升了代理的可靠性,尽管消耗更多token。作者将这些经验制作为可复用的命令集,插入循环后效果显著改善。技巧智能体多模态提示词工程推荐理由:有人分享用语音+屏幕录制和多模态提示跟AI代理唠嗑,提示越啰嗦结果越靠谱,还教你怎么录屏加注释,值得试试原文稍后读已读值得跟进有用关注 智能体
19:12orange.ai@oran_geCola上线了Seed 2.1 Pro模型,这是一款原生多模态模型,官方声称是目前多模态最强。相比Seed 2.0版本,该模型在Coding和Agent能力上有所增强。用户可通过colaos.ai进行体验。AI模型ColaSeed 2.1 Pro多模态3 个信源在谈事件专题推荐理由:Cola刚发了Seed 2.1 Pro,说是多模态最强,coding和agent比2.0强不少,想试试去colaos.ai就行。原文稍后读已读值得跟进有用关注 Cola
17:51官方账号Decoder@Maximilian SchreinerMistral AI推出OCR 4模型,专门用于从PDF、Word和PowerPoint等文档中读取文本。公司称在盲测中,OCR 4在72%的案例中表现优于竞品。该模型专注于文档文本提取,与现有OCR方案相比有显著提升。AI模型MistralOCR 4文档处理推荐理由:Mistral新出的OCR 4在盲测里赢了七成多对手,专治PDF和PPT文字提取,文档党可以看看。原文稍后读已读值得跟进有用关注 Mistral
09:45IT之家(博客/媒体)71°火山引擎发布豆包音频生成模型1.0(Doubao-Seed-Audio 1.0),首次支持将文本、音频等多模态输入端到端生成目标音频。该模型能在长时生成中保持多角色音色一致性,减少后期修音工作。单条Prompt可编排角色对白、情绪语气、背景音乐等,直接产出完整音频作品。火山方舟已开启API邀测,个人用户可体验30分钟创作额度。AI模型豆包音频生成模型1.0火山引擎音频生成5 个信源在谈事件专题推荐理由:火山引擎新模型能一次编排对白、音效、配乐,还能保持10分钟的角色音色一致,省掉后期对轨修音,音频创作者值得一试。原文稍后读已读值得跟进有用关注 豆包音频生成模型1.0
08:24SuperTechFans(博客/媒体)精选Mistral于2026年6月24日发布OCR 4模型,新增边界框、区块分类和置信度分数。该模型在内部盲评和公开基准测试中性能领先,支持170种语言,可自托管部署。AI模型MistralOCR 4多模态推荐理由:Mistral新出的OCR 4能自己部署,支持170种语言,还带边界框和置信度分数,识别效果领先,做文档处理很合适。原文稍后读已读值得跟进有用关注 Mistral
06:52Google AI Developers@googleaidevsGoogle 发布 Gemini Interactions API,用一个端点统一处理文本、多模态输入(图片、音频、视频)、工具调用(Function Calling)和托管智能体。该 API 旨在降低开发复杂度,帮助开发者从提示词快速过渡到生产部署。开发者可在 Google AI Studio 中获取详细指南。AI产品GeminiInteractions APIGoogle推荐理由:Google 把文本、多模态、工具和智能体塞进一个 API 里,少折腾接口,直接跑。原文稍后读已读值得跟进有用关注 Gemini
14:48orange.ai@oran_ge豆包音频生成模型 Seed Audio 1.0 发布,可根据想象生成人声、音乐、音效和环境音。与传统的 TTS(仅文本转语音)不同,它能捕捉声音中的微妙细节。这是首次将智能赋予声音的模型,类似图像领域的 Seedance 时刻。AI产品豆包Seed Audio 1.0音频生成3 个信源在谈事件专题推荐理由:豆包发了 Seed Audio 1.0,不光能念稿,还能生成音乐和音效,像声音版的 DALL·E,值得听听。原文稍后读已读值得跟进有用关注 豆包
10:35官方账号arXiv cs.LG@Talia Sternberg, Gallil Maimon, Yossi Adi该论文分析了来自不同模型族和规模的交错语音文本语言模型,发现它们会在中间层隐式转录语音对应的文本词,其中77%的数据中该文本词出现在Top候选词中。随后模型在文本空间预测下一个词,再转回语音域。研究还表明,交错训练数据和文本LM初始化是诱发该行为的关键,且该行为与口语知识能力相关。论文Speech Language Models交错训练语音模型推荐理由:这篇论文让你搞懂语音语言模型内部是怎么偷偷把语音转成文本再推理的,分析得很透彻,适合想深入理解多模态模型原理的人。原文稍后读已读值得跟进有用关注 Speech Language Models
10:06IT之家(博客/媒体)字节跳动发布的豆包Seed 2.1系列包括Pro和Turbo两个版本,Pro面向高复杂度任务,Turbo面向大规模生产。该系列在Coding工程交付、Agent长链路任务执行和多模态理解三大方向实现升级。价格方面,Pro模型推理输入6元/百万tokens(缓存命中1.2元),推理输出30元/百万tokens;Turbo模型推理输入3元/百万tokens(缓存命中0.6元),推理输出15元/百万tokens。同时发布了每周至少更新一次版本的Seed-Evolving模型和面向泛娱乐的角色模型Character。AI模型豆包Seed 2.1字节跳动推理模型4 个信源在谈事件专题推荐理由:字节新出的豆包Seed 2.1 Pro和Turbo,专门优化编程、智能体和多模态任务,Pro适合高难度场景,Turbo便宜且效率高,很适合接项目用。原文稍后读已读值得跟进有用关注 豆包Seed 2.1
02:09Philipp Schmid@_philschmid精选Google 推出 Interactions API,提供单一 API 接口调用 Gemini 模型和智能体。该 API 包含隔离的远程 Linux 沙箱环境,支持异步后台运行的 background=True 参数。已集成图像生成 Nano Banana、音乐生成 Lyria 3,并预告未来支持视频生成 Omni。同时具备多模态工具调用与组合能力,以及专用编码技能。开发者可通过该 API 构建人类与智能体交互的应用。AI产品Interactions APIGeminiGoogle推荐理由:Google 上线了 Interactions API,一个 API 就能调用 Gemini 模型和智能体,还有沙箱、图像音乐生成,异步运行很简单。原文稍后读已读值得跟进有用关注 Interactions API
00:48官方一手AWS Machine Learning Blog@Gilbert V Lepadatu精选AWS博客介绍了基于Amazon Bedrock和OpenSearch Serverless构建的可搜索航空影像系统架构。团队使用OpenStreetMap地面实况数据设计了四项实验,对比了嵌入模型、融合策略、字幕生成和搜索方法。其中Amazon Nova Multimodal Embeddings在基准查询中取得了最高的F1分数。该系统最终演变为Vexcel Intelligence产品,为地理空间语义搜索提供了实用指导。AI模型Amazon Nova Multimodal EmbeddingsAmazon BedrockOpenSearch Serverless推荐理由:AWS用Amazon Nova做航空影像搜索,F1分数最高,想搞地理空间搜索的可以参考他们的实验设计。原文稍后读已读值得跟进有用关注 Amazon Nova Multimodal Embeddings
00:23AK@_akhaliqPerceptionDLM是一个新提出的多模态扩散语言模型,能够并行地感知图像中的多个区域。该模型结合了扩散模型的生成能力和语言模型的推理能力,支持多区域联合理解。它在一系列视觉定位和区域描述任务上展示了优越性能,但具体基准名称和数值未在原文中提及。AI模型PerceptionDLM多模态扩散语言模型推荐理由:这是一个新模型,能用多模态扩散语言模型同时理解图片里的多个区域,跟以前的单区域方法不一样。原文稍后读已读值得跟进有用关注 PerceptionDLM
21:30IT之家(博客/媒体)生数科技的新一代视频生成大模型 Vidu Q3 上线华为云 MaaS,支持文生视频和图生视频一体化成片。该模型是全球首个“为剧而生”的视频大模型,可生成 16 秒 1080P 画质内容,并实现声画同出、多镜头叙事。Vidu Q3 推出两个版本:Turbo 极速版优化推理速度与成本,适合快速创意打样;Pro 专业版支持 4K 分辨率,面向广告大片等专业场景。模型还具备多国语言文字渲染及多语言输出功能,可用于漫剧、短剧和影视创作。AI模型Vidu Q3华为云生数科技推荐理由:生数 Vidu Q3 上线华为云,能一键文/图生视频,支持 16 秒 1080P 和 4K,还有专为剧集设计的镜头叙事能力,做短视频或专业视频都合适。原文稍后读已读值得跟进有用关注 Vidu Q3
16:45IT之家(博客/媒体)71°京东发布并开源了实时视频视觉语言交互模型JoyAI-VL-Interaction,这是全球首个全栈开源的interaction模型和系统,获得vLLM-Omni的day-0原生支持。该模型能持续观察视频流,自主判断何时响应,而非被动等待用户提问。在58个真人盲评案例中,JoyAI-VL-Interaction对比豆包视频通话助手胜率77.6%,对比Gemini视频通话助手胜率87.9%。它支持摄像头、直播流、监控流等多种视频输入,并具备后台智能体委托能力。AI模型JoyAI-VL-Interaction京东多模态推荐理由:京东开源了JoyAI-VL-Interaction,能实时看视频主动说话,安防、直播都能用,盲评胜率比豆包和Gemini高一大截。原文稍后读已读值得跟进有用关注 JoyAI-VL-Interaction
10:48官方一手Pandaily@contact@pandaily.com (Pandaily)ByteDance Seed与学术合作伙伴提出SpatialTree,这是一个分层框架,旨在重新定义多模态大模型(MLLM)对空间的理解与推理能力。该工作已被计算机视觉顶级会议CVPR 2026接收。SpatialTree通过层级结构显著提升MLLM在空间任务上的表现。AI模型SpatialTreeByteDance SeedCVPR 20264 个信源在谈事件专题推荐理由:字节跳动Seed搞了个SpatialTree框架,专门提升多模态模型的空间推理能力,还被CVPR 2026接受了,值得一看。原文稍后读已读值得跟进有用关注 SpatialTree
15:00Geek@geekbbCowart 在 Codex 中集成了本地 tldraw 画布,用户放置 AI 占位框即可指定生成图片。还支持截图标注重绘:在画布上画标注后,Codex 能移除痕迹并生成干净新图。所有操作在本地运行,无需联网。技巧CodexCowarttldraw推荐理由:想边画草图边让 AI 生图?这个本地画布工具让 Codex 直接改,标注去除功能特别好用。原文稍后读已读值得跟进有用关注 Codex
03:53Browser Use@browser_useGLM 5.2(纯文本模型)在网站设计任务中击败了 Fable 5。团队将 GLM 5.2 与 Browser Use v2 多模态 QA 子代理配对,让代理审查网站、发现 bug、判断美学,再向 GLM 发送修复指令。整个构建加质量保证的成本低于 0.75 美元。展示了纯文本模型通过智能协作在视觉任务上的潜力。技巧GLM 5.2Browser Use v2Fable 52 个信源在谈事件专题推荐理由:GLM 5.2 纯文本模型竟然能设计网站,还打败了 Fable 5?搭配 Browser Use v2 多模态 QA 代理,成本不到 0.75 美元,太会玩了。原文稍后读已读值得跟进有用关注 GLM 5.2
10:18官方一手pandaily@contact@pandaily.com (Pandaily)小米发布并开源了Miloco 2.0全屋AI系统,具备多模态感知能力,可识别用户行为和场景。该系统支持主动智能,能预测需求并执行持续任务,如自动调节灯光温度。Miloco 2.0拥有家庭记忆功能,可记住家庭成员的偏好和习惯。该系统被比作钢铁侠的JARVIS管家,面向中国家庭提供个性化服务。AI模型小米Miloco 2.0智能家居推荐理由:小米开源了Miloco 2.0,一个像JARVIS一样有记忆能主动帮忙的智能家居AI,多模态和家庭记忆功能很实用。原文稍后读已读值得跟进有用关注 小米
07:27IT之家(博客/媒体)苹果将于今秋推送visionOS 27,M5版Vision Pro独占Siri语音定制功能,用户可调整语气的表现力和语速。M5版还独占AFM 3 Core Advanced模型,该模型支持原生多模态能力并采用稀疏架构,可在本地执行更复杂的AI任务。M2版Vision Pro仍可享受visionOS 27的大部分升级,包括全景照片转空间场景、重新设计的控制中心以及更智能的自然语言理解。苹果未来计划通过云端计算为M2设备提供部分AI功能折中方案,但细节未公布。AI产品visionOS 27M5 Vision ProSiri推荐理由:苹果给M5 Vision Pro加了本地AI模型和自定义Siri语音,其他头显暂时没有,等正式版可以试试效果。原文稍后读已读值得跟进有用关注 visionOS 27
03:05官方账号Together AI@togethercompute精选MiniMax-M3 模型支持智能体携带长历史(超过百万token)、图像、视频、文档和工具输出进入上下文,显著提升多模态信息处理能力。Together 的推理优化通过改进服务路径上的 token 吞吐量,使这一能力在大规模部署时更实用。相比之前方案,每 GPU 可处理更多 token,从而降低每美元自动化工作成本。AI模型MiniMax-M3Together智能体2 个信源在谈事件专题推荐理由:MiniMax-M3 让智能体一口气带进长历史、图、视频、文档和工具输出,Together 优化后每 GPU token 翻倍,自动任务成本更低。原文稍后读已读值得跟进有用关注 MiniMax-M3
03:05官方账号Together AI@togethercompute88°OpenAI 的 GPT Image 2 模型现已在 Together AI 的 Serverless Inference 服务中上线。开发者可通过该接口将图像生成与编辑功能集成到多模态应用中。模型支持精准布局控制、可读文本生成以及参考图像引导生成。Together AI 提供无服务器推理能力,无需管理基础设施即可调用。AI模型GPT Image 2OpenAITogether AI10 个信源在谈事件专题推荐理由:OpenAI 的新图像模型 GPT Image 2 现在能用 Together AI 的无服务器接口调用了,做多模态应用时直接用它生成和编辑图片,支持布局和文字控制,挺方便。原文稍后读已读值得跟进有用关注 GPT Image 2
11:47官方账号arXiv cs.LG@Wenhao Chi, Arkaprava Sinha, Dominick Reilly, Hieu Le, Srijan DasUNIEGO提出分层多教师蒸馏框架,使用9个教师(覆盖自我/他人视角、RGB/深度/骨架模态和4个基础模型)来训练统一编码器。为解决异构教师的不兼容架构和特征几何冲突,框架引入代理模型将不同教师知识翻译到同质化的自我中心空间。第二阶段选择性代理蒸馏(SPD)为每个样本自适应选择正确且自信的代理子集,抑制错误信号。UNIEGO在三个自我中心视频基准(动作识别、视频检索、动作分割)上达到最先进性能。AI模型UNIEGO自我中心视频知识蒸馏推荐理由:想用多视角多模态数据训练视频理解模型?UNIEGO用代理模型搞定异构教师蒸馏,在三个任务上刷新了纪录。原文稍后读已读值得跟进有用关注 UNIEGO
11:36官方账号arXiv cs.AI@Solène Debuysère, Nicolas Trouvé, Nathan Letheule, Elise Colin, Georgia ChanningSARLO-80是一个基于Umbra卫星VHR SAR SLC数据构建的SAR-光学-文本对齐数据集,包含约2500个全球场景,覆盖72个国家257个地点。所有SAR数据被标准化为80cm斜距网格,并切分为1024×1024像素图块,与对应的高分辨率光学图像精确对齐。数据集提供119,566个三元组(幅度/复数SAR图块、对齐光学图块、三种长度的自然语言描述),支持跨模态检索和条件生成等基准测试。完整代码和划分已开源在Hugging Face Hub。论文SARLO-80UmbraSAR推荐理由:想做SAR与光学图像对齐研究?这个数据集用Umbra的VHR数据做了精细对齐,还带文本描述,直接拿去做多模态训练或评测。原文稍后读已读值得跟进有用关注 SARLO-80
10:25官方账号腾讯混元 Tencent Hunyuan@TencentCloud腾讯推出了Tencent Design Miora智能体创意工作室,面向设计师和内容创作者。该工具能根据简短指令自动规划并交付图像、视频、UI/UX、3D等完整创意资产。Miora具有记忆功能,能学习用户创作风格和项目上下文。内置了品牌系统、故事板、插画、UI/UX、视频、3D等多个专业AI专家,无需切换工具。用户可将已验证的工作流程保存为可复用的技能。AI产品Tencent Design MioraTencent Cloud智能体推荐理由:腾讯出了个能记住你风格的AI设计工作台,图像视频UI/UX都能在一个画布搞定,内置多个专业AI助手。原文稍后读已读值得跟进有用关注 Tencent Design Miora
10:23IT之家(博客/媒体)谷歌与艺术家Refik Anadol合作的全球首个AI艺术博物馆Dataland将于6月20日在洛杉矶开馆,面积约2500平方米。开幕展“Machine Dreams: Rainforest”由Large Nature Model驱动,该模型基于自然世界数据集训练。博物馆使用Google Cloud工具(包括Gemini Enterprise Agent Platform和Compute Engine)协调GANs、扩散模型和Gemini,将数据转化为12亿像素的超现实画面。系统可生成动态声景、实时情绪感应并通过算法增强气味,运行使用87%无碳可再生能源。行业谷歌DatalandRefik Anadol推荐理由:谷歌和艺术家在洛杉矶开了个AI艺术博物馆,进去能看到12亿像素的实时画面,还能感应你的情绪释放气味,挺新鲜的。原文稍后读已读值得跟进有用关注 谷歌
10:10官方账号arXiv cs.AI@Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng YANSPOT-E方法针对视觉语言模型在处理证据密集型任务时因小区域视觉证据被忽略导致的读取失败问题。该方法利用答案跨度预测熵作为模型内部反馈,通过低熵锚点和熵整形目标消除歧义,避免模型陷入捷径塌缩。SPOT-E基于GRPO进行每实例轻量级调优,生成问题条件化的聚光灯。在多个VLM族和基准测试中,SPOT-E一致提升了性能并增强了视觉损坏鲁棒性。代码已开源。论文SPOT-EVLMGRPO推荐理由:SPOT-E这个新方法挺有意思,它不重训模型,只在推理时搞了个视觉聚光灯和熵整形,就让VLM在那些需要细看局部证据的任务上表现好多了。尤其用GRPO调优,效果提升还挺稳定。原文稍后读已读值得跟进有用关注 SPOT-E