09:33官方账号arXiv cs.AI@Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger多模态大模型(MLLM)在主动观察任务上能力缺失。新基准ActiveVision包含17个任务(3个类别),要求模型反复视觉感知而非单次描述。GPT-5.5在最高推理档次上仅解决10.6%的项,11个任务得零分;Claude Fable 5仅3.5%,而三名人类被试平均96.1%。即使让模型编写并运行自己的视觉代码,大部分差距依然存在,因为代码在真实图像上不可靠,且捕捉自身失败需要模型缺乏的主动感知。结果表明当前MLLM缺乏稳健的主动视觉观察能力。AI模型ActiveVisionGPT-5.5Claude Fable 510 个信源在谈事件专题推荐理由:想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。原文稍后读已读值得跟进有用关注 ActiveVision
09:31官方账号arXiv cs.AI@Binglin Zhou, Peng Shi, Ryo Kamoi, Nan Zhang, Rui Zhang多模态科学声明验证需依托论文中的图表、表格等视觉证据。现有方法在定位关键视觉证据、准确读取结构化科学图表、整合多模态观察方面存在不足。本文提出首个工具增强框架ToolSciVer,为视觉语言模型(VLM)配备三种类型感知视觉工具:表格行列聚焦、图表结构化解析、高分辨率区域放大。采用分组相对策略优化(GRPO)训练策略,综合奖励答案正确性、格式、长度、工具使用效率及有效性。在SciVer和MuSciClaims数据集上基于Qwen、InternVL、Gemma三个系列的五个VLM进行实验,结果表明该方法优于包括提示词和强化学习方法在内的四个基线。论文ToolSciVer多模态科学声明验证推荐理由:这篇论文给VLM配了三种看图工具(表格、图表、放大),再用GRPO训练工具使用策略,比普通prompt和RL方法更准,适合处理科学图表验证。原文稍后读已读值得跟进有用关注 ToolSciVer
09:23官方账号arXiv cs.AI@Bhavana Verma, Priyanka Meel, Dinesh Kumar Vishwakarma论文提出HCIG和GCCN两个新框架,以建模文本与图像之间的多粒度语义不一致。在MMSD讽刺检测基准上,HCIG达到85.74%准确率和85.29%宏F1。在MultiBully网络霸凌数据集上,GCCN宏F1为68.66%,HCIG准确率69.62%、霸凌类F1 74.90%。实验表明分层多粒度不一致建模优于传统融合策略,为多模态推理提供有效方法。论文HCIGGCCNMMSD推荐理由:这篇论文提出了HCIG和GCCN,在MMSD和MultiBully上分别达到85.74%和69.62%准确率,比传统融合方法更善于捕捉图文矛盾。原文稍后读已读值得跟进有用关注 HCIG
09:15官方账号arXiv cs.AI@ SciForge Team, Zhangyang Gao, Minghao Fang, Yifei Liu, Hanhui Yang, Xinyu Gu, Shixiang Tang, Siqi Sun, Lei Bai, Cheng Tan, Mengdi Liu, Hao Wu, Shuizhou ChenarXiv 论文提出 SciForge,一个专为科学研究设计的 AI 原生多模态工作台。该工作台基于五个核心理念构建:目标导向的决策治理、先翻译后推理的多模态处理、可审计的证据链、协作式团队科学以及实际应用场景。论文通过八个端到端用户案例验证,包括基因发现、从头蛋白质设计、分子优化等旗舰演示。SciForge 目前为桌面应用,已开源在 GitHub 上。论文SciForge多模态智能体推荐理由:想用 AI 管理整个科研流程?SciForge 把论文、代码、数据整合成可追溯的工作状态,还帮你做基因发现和蛋白质设计,开源可玩。原文稍后读已读值得跟进有用关注 SciForge
05:45官方一手marktechpost@Asif Razzaq阿里Qwen团队预览了Qwen3.8-Max-Preview,该模型拥有2.4万亿参数,采用MoE架构,自称性能仅次于Fable 5。预览版已在Token Plan、Qoder和QoderWork上以标准定价的10%提供服务。官方未公布任何基准测试表格、模型卡或许可证,也未说明激活参数数量。读者需区分阿里的确认信息与声称内容。AI模型Qwen3.8-MaxAlibabaKimi K310 个信源在谈事件专题推荐理由:阿里放了个大招,Qwen3.8-Max有2.4万亿参数,号称仅次于Fable 5,但没给具体跑分,价格只要十分之一,值得关注。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
20:15官方账号Decoder@Matthias Bastian73°阿里巴巴推出Qwen 3.8多模态AI模型,参数规模达2.4万亿。该模型在多项基准测试中表现优异,Qwen团队称其性能仅次于Fable 5。目前预览版已开放,可直接体验。AI模型Qwen 3.8AlibabaKimi K310 个信源在谈事件专题推荐理由:阿里新出的Qwen 3.8有2.4万亿参数,多模态能力强,号称只输给Fable 5,快去试试预览版吧。原文稍后读已读值得跟进有用关注 Qwen 3.8
16:42量子位@量子位的朋友们分子之心在WAIC 2026上展示其AI设计平台在30天内连续产出两个成功案例:一个针对SARS-CoV-2的纳米抗体亲和力达到0.1nM,另一个环肽药物分子结合能优于现有临床候选分子。两项成果均通过湿实验验证,表明AI能从序列直接设计具有功能活性的生物分子。该公司正将这些能力整合到多模态生物经济新基建中。行业分子之心纳米抗体环肽推荐理由:分子之心30天连出两个AI设计生物分子的硬核验证,从纳米抗体到环肽,都有实验数据支撑,不是PPT。原文稍后读已读值得跟进有用关注 分子之心
10:54IT之家(博客/媒体)72°阿里巴巴发布 HappyOyster 1.0(快乐生蚝),已登陆阿里云百炼面向企业和开发者开启灰测。该模型提供世界探索(Adventure)与实时导演(Directing)两种模式。世界探索模式支持输入一句话或一张图,生成可实时探索和交互的开放世界,体验时长 1 分钟以上且音画同出。实时导演模式允许用户用文字指令操控镜头、调度角色、改变剧情走向,支持暂停、改写、回溯。HappyOyster 1.0 提供 Android/iOS/Web 三端 SDK,开发者可通过 Open API 管理世界,客户端 SDK 封装 RTC 连接和视频渲染。AI模型HappyOyster阿里巴巴多模态推荐理由:阿里刚发的 HappyOyster 1.0,能根据一句话或一张图生成实时可探索的 3D 世界,还能像导演一样用文字操控剧情,支持 1 分钟以上互动,挺有新意的。原文稍后读已读值得跟进有用关注 HappyOyster
09:27官方一手Pandaily@contact@pandaily.com (Pandaily)香港数码港正成为中国AI企业全球化的重要枢纽。其AI超算中心算力达3000 PFLOPS,并推出300亿港元资助计划。通过三板块战略,数码港将连接内地AI初创公司与东南亚、中东市场。此举旨在利用香港的国际金融与法规优势,加速国产AI技术出海。行业香港数码港CyberportAI出海推荐理由:数码港砸300亿港元和3000 PFLOPS算力,专门帮内地AI公司打通东南亚和中东市场,不是画饼。原文稍后读已读值得跟进有用关注 香港数码港
08:33IT之家(博客/媒体)荣耀在2026世界人工智能大会上正式发布AgenticOS,该系统具备意图驱动、自然交互、主动智能、天生跨端四大特征,拥有行业首个系统级Agent架构。荣耀Robot Phone将于8月首发AgenticOS内核,该手机搭载第五代骁龙8至尊版芯片并集成4DoF钛合金机械云台系统。Q4发布的荣耀Magic9系列将推出AgenticOS尝鲜版。AI产品AgenticOS荣耀Robot Phone推荐理由:荣耀新系统AgenticOS,8月Robot Phone首发有机械云台,支持多智能体协同,试试看。原文稍后读已读值得跟进有用关注 AgenticOS
18:33IT之家(博客/媒体)商汤科技发布日日新SenseNova U1 Pro图片创作模型,支持最高8K原生分辨率输出,画幅放大后文字、线条仍清晰。该模型通过内生图文交错思维链提升内容准确性,文字渲染出错率极低。图像生成从细节逼真推进到专业设计美感,宣称告别AI味。同时支持长程Agentic Generation Loop,可围绕复杂目标进行数十轮智能体生成循环,实现局部文本同步精准编辑。AI模型商汤科技日日新U1 Pro8K推荐理由:商汤新出的U1 Pro能直接生成8K高清图片,设计感专业,文字不乱码,还能反复修改,比很多海外模型都实用。原文稍后读已读值得跟进有用关注 商汤科技
15:14IT之家(博客/媒体)腾讯 WorkBuddy 正式版 App 于7月18日发布,支持安卓、iOS、鸿蒙三端,成为首个登陆鸿蒙系统的通用智能体应用。该App保留桌面端核心功能,并支持远程向电脑端发起任务。提供两种执行模式:连接电脑直连本地设备,云端工作则包含Skills、专家团、自动化定时任务等。支持文字、语音、拍照、文件导入及腾讯文档、ima知识库一键导入等多模态交互。AI产品WorkBuddy腾讯鸿蒙推荐理由:腾讯刚发了WorkBuddy的正式版App,安卓、iOS、鸿蒙都能用,还能远程连电脑干活,功能挺全的。原文稍后读已读值得跟进有用关注 WorkBuddy
11:52Geek@geekbb该项目利用OpenAI视觉模型自动识别照片中的衣物,并进行自动抠图。随后基于抠图结果生成模特上身预览效果。配套的Codex技能支持一键导入衣物素材或生成模特穿搭画册。整个流程可帮助电商卖家快速制作商品展示图。技巧OpenAICodex多模态9 个信源在谈事件专题推荐理由:这个开源项目用OpenAI视觉模型自动识别衣物、抠图,还能生成模特上身图,适合电商卖家快速出图。原文稍后读已读值得跟进有用关注 OpenAI
08:09OpenRouter@OpenRouterAIThink Machines开发的Inkling模型已上线OpenRouter。该模型采用MoE架构,总参数975B、活跃参数41B。支持1M上下文长度,可处理文本、图像和音频。具备可控推理能力。AI模型InklingThink MachinesOpenRouter10 个信源在谈事件专题推荐理由:Think Machines的Inkling模型很特别,总参数975B但只激活41B,还有1M上下文和多种模态支持,值得上手试试。原文稍后读已读值得跟进有用关注 Inkling
02:16AK@_akhaliqVideoChat3 是一款完全开源的视频多模态大型语言模型,专注于高效通用视频理解。该模型在视频问答、时序定位等任务上展现能力。开发者可通过 GitHub 获取权重与代码。AI模型VideoChat3视频理解多模态推荐理由:VideoChat3 完全开源,适合研究视频理解,你可以自己部署试试效果。原文稍后读已读值得跟进有用关注 VideoChat3
02:13Justine Moore@venturetwinsDecartAI推出Nano Banana模型,允许用户通过视频或文本提示编辑直播流。用户上传场景截图作为参考图像,输入文本指令(如将女人改为穿背心的网红),模型能保留原光照效果。该功能基于参考图像进行编辑,无需从头生成。演示中展示了从截图到修改后画面的流程。AI模型DecartAINano Banana视频编辑推荐理由:DecartAI发了Nano Banana,能让你用视频或一句话改直播画面,上传截图就能保留原光照,挺好玩的。原文稍后读已读值得跟进有用关注 DecartAI
01:22官方账号NVIDIA AI@NVIDIAAI精选英伟达开源微调库 NeMo AutoModel 新增对 Hugging Face Diffusers 的支持。此前仅限 Transformer 模型,现在可微调图像和视频生成模型。提供即用的全参数和 LoRA 训练脚本,免去手动编写分布式训练代码的繁琐。AI产品AutoModelDiffusers微调推荐理由:英伟达开源微调工具 AutoModel 现在也能调图像视频模型了,提供现成 LoRA 脚本,省去写分布式训练的麻烦。原文稍后读已读值得跟进有用关注 AutoModel
16:42官方一手Pandaily@contact@pandaily.com (Pandaily)WeRide推出物理AI基础模型WITT,该模型通过最小物理事实单元统一多模态场景理解。WITT可同时处理视觉、激光雷达等多传感器数据,为自动驾驶和机器人提供通用感知基础。官方表示,WITT在多个自动驾驶基准测试中取得领先成绩,并已集成到WeRide的L4级自动驾驶系统中。AI模型WITTWeRide自动驾驶推荐理由:WeRide搞了个新模型WITT,用最小物理事实做多模态理解,开车和机器人都能通用,性能挺猛。原文稍后读已读值得跟进有用关注 WITT
16:25AI Will@FinanceYF5精选76°Kimi K3是一个具有2.8万亿参数和100万上下文窗口的原生多模态开放模型。其Kimi Delta Attention机制在百万Token解码速度最高提升6.3倍。Attention Residuals使训练效率提升约25%,额外成本低于2%。该模型面向长周期Agentic Coding和自我进化工作流。AI模型Kimi K3Kimi多模态10 个信源在谈事件专题推荐理由:月之暗面发了Kimi K3,2.8万亿参数还支持原生多模态,解码快6倍,写代码和长文处理很强。原文稍后读已读值得跟进有用关注 Kimi K3
16:06IT之家(博客/媒体)阿里通义实验室发布 Wan-Streamer v0.2 模型,端到端响应延迟仅 550ms(含 350ms 网络延迟)。输出分辨率从 v0.1 的 192×336 提升至 640×368@25FPS,微表情清晰可见。模型采用“Thinker+Performer”双架构,Thinker 单卡处理感知与理解,Performer 多卡并行生成高清视频。Wan-Streamer 将文本、音频、视频输入统一映射到因果时间线,每 160ms 完成一次感知-理解-生成-解码循环。相比常见实时语音对话模型,Wan-Streamer 支持全双工视频交互且延迟控制在 1 秒内。AI模型Wan-Streamer阿里通义多模态推荐理由:阿里发了 Wan-Streamer v0.2,视频电话延迟才 550ms,画质从模糊到高清,还能边听边看边回应,挺有意思。原文稍后读已读值得跟进有用关注 Wan-Streamer
13:49AI Will@FinanceYF5精选71°Kimi K3 发布,参数规模达 2.8 万亿,支持 100 万 token 上下文和原生多模态。采用 Kimi Delta Attention 机制,百万 token 上下文中解码速度提升 6.3 倍。Attention Residuals 使训练效率提升约 25%,额外成本低于 2%。在 Online Exp、DECK-Bench、Finance-Bench 三项内部跑分中全面超过 Opus 4.8 和 GPT-5.5。该模型面向长周期 Agentic Coding 和自我进化工作流。AI模型Kimi K3Opus 4.8GPT-5.510 个信源在谈事件专题推荐理由:Kimi 新模型 K3 跑分赢了 Opus 4.8 和 GPT-5.5,2.8 万亿参数还带百万上下文,解码快到飞起,技术细节值得细看。原文稍后读已读值得跟进有用关注 Kimi K3
13:46IT之家(博客/媒体)谷歌在 Google Vids 中推出数字分身功能,用户上传一张自拍照和一段语音录音即可生成外貌和声音模仿本人的虚拟形象。多模态 AI 模型 Gemini Omni 也登陆该平台,支持文字提示词和参考图片生成视频,并可更换背景、改善光线或加入特效。Omni 还支持分步编辑,无需重新生成整段视频。数字分身绑定谷歌账号并嵌入 SynthID 隐形水印,仅面向部分国家年满18岁的用户开放。AI产品Google VidsGemini Omni数字分身1 个信源在谈事件专题推荐理由:谷歌给 Vids 加了数字分身,上传自拍和录音就能生成自己出镜的 AI 视频,还能用 Gemini Omni 改背景调光线,比 HeyGen 更方便。原文稍后读已读值得跟进有用关注 Google Vids
12:17AI Will@FinanceYF572°Kimi 发布了 K3 模型,结合 3D 推理、编程和视觉理解能力。它能够将文本概念、图片或视频转化为可玩的交互式 3D 体验。K3 实现了"vision in the loop"机制,模型可在代码和实时截图之间来回迭代。AI模型K3Kimi多模态推荐理由:Kimi 刚发了 K3,能把图片视频转成可交互 3D,还能边写代码边看效果,挺实用的。原文稍后读已读值得跟进有用关注 K3
12:14AI Will@FinanceYF582°Kimi K3模型正式发布,拥有2.8万亿参数、100万Token上下文窗口,并支持原生多模态处理。其Kimi Delta Attention技术可在百万Token上下文中将解码速度提升最高6.3倍。Attention Residuals机制将训练效率提升约25%,额外成本控制在2%以内。该模型主要面向长周期Agentic Coding和自我进化工作流。AI模型Kimi K3Kimi多模态10 个信源在谈事件专题推荐理由:Kimi出了K3,2.8万亿参数还有百万级上下文,解码速度快了6倍多,做长代码任务很合适。原文稍后读已读值得跟进有用关注 Kimi K3
10:59官方账号arXiv cs.AI@Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao ZhengMM-IssueLoc 是评估多模态仓库级问题定位的新基准,包含 652 个 issue-PR 实例、23 种编程语言,标注了 7 种图像类别和 4 个相关性等级。它提供文件级与函数级真值标签,支持纯文本与带图像两种评估模式。在测试中,最强 agent 仅达到 38.96 文件 Acc@5 和 22.45 函数 Acc@10,最强检索器达到 33.86 函数 Acc@10,表明现有系统在多模态定位上仍不可靠。该基准将视觉证据作为显式评估变量,避免与下游补丁生成效果混在一起。论文MM-IssueLoc多模态仓库级问题定位推荐理由:新基准 MM-IssueLoc 专门测模型到底有没有用截图这类视觉证据,而不是全靠文本猜。当前最强系统得分才三十多,说明视觉定位远没解决。原文稍后读已读值得跟进有用关注 MM-IssueLoc
10:06shao__meng@shao__mengKimi K3 是全球首个 3T(2.8T)级开源模型,支持 1M token 上下文和原生多模态,定位长时程智能体编码与知识工作。在 Frontend Code Arena 中获得 1679 分,领先第二名 Claude Fable 5 的 1631 分和第三名 GPT-5.6 Sol 的 1618 分。整体性能仅弱于 Claude Fable 5 和 GPT 5.6 Sol,在开源模型中表现最强,权重将于 7 月 27 日前开放。AI模型KimiK3开源模型推荐理由:Kimi 发了 K3 开源模型,2.8T 参数加上百万上下文,在编程评测里甚至超过了 Claude 和 GPT,做智能体特别合适。原文稍后读已读值得跟进有用关注 Kimi
09:59官方账号arXiv cs.AI@Patrick Phuoc Do, Chau M. Ta, Chaoli Wang本文对6个多模态大模型(MLLM)进行了科学可视化素养评估测试,该测试包含49道题目、18个科学可视化图表,覆盖8种可视化技术和11种任务类型。模型成绩与485名人类参与者数据对比,Gemini整体表现最强,在评估子集上超过人类平均水平,而开源模型低于人类基线。模型在科学插画、搜索和空间理解任务上表现较好,但在基于纹理和整合的可视化以及定量估计任务上表现不佳。误差分析显示模型在细粒度定量估计、流向判读和编码含义解读上存在系统性失败。代码和模型输出已开源。论文GeminiMLLM科学可视化推荐理由:这篇论文用49道题测了Gemini、GPT-4等6个模型对科学图表的理解力,发现Gemini最强但人类平均还是更高,开源模型差距明显,想了解模型真实视觉推理能力可以一读。原文稍后读已读值得跟进有用关注 Gemini
09:31官方一手arXiv: OpenAI@Amir Bralin, N. Sanjay Rebello研究团队评估了OpenAI的o4-mini模型在Halliday和Resnick的《物理学基础》习题上的表现。整体准确率约90%,但文本问题准确率高达96%,而需要图文协调的问题仅79%。问题难度从低到高时,准确率显著下降。结果表明,当前最强推理模型能解答大部分标准物理题,但表现受模态和难度制约。AI模型o4-miniOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI的o4-mini做大学物理题整体准,但看图题就露馅了,准确率从96%掉到79%。原文稍后读已读值得跟进有用关注 o4-mini
09:25官方账号arXiv cs.LG@Sara Ketabi, Matthias W. Wagner, Cynthia Hawkins, Uri Tabori, Birgit Betina Ertl-Wagner, Farzad Khalvati该论文提出MseaCL框架,在儿科3D脑部MRI和放射学报告的多模态对比学习中,通过语义相似性引导减少假阴性样本。传统对比学习将非配对样本视为负例,但医学影像中语义相似的样本常被误判为负例。MseaCL在儿科队列上训练,将报告语义相似度作为信号,下游任务中儿科脑肿瘤分子分类AUC提升至少22.6%。论文MseaCL多模态对比学习推荐理由:新论文用语义感知对比学习解决医学影像的假阴性问题,在脑肿瘤分类上AUC涨了22.6%,值得搞多模态医疗AI的人看看。原文稍后读已读值得跟进有用关注 MseaCL
08:04官方账号Together AI@togethercompute精选Thinking Machines Lab 联合 Together AI 发布了 Inkling 多模态 MoE 模型。该模型原生支持文本、图像、音频三种输入。它具备可控推理努力机制,允许在推理时动态调整计算量。基于 Together 的 FlashAttention-4 内核优化,显著提升 token 效率。在多个基准上展示了高效推理能力。AI模型InklingThinking Machines LabTogether AI10 个信源在谈事件专题推荐理由:Inkling 是 Thinking Machines Lab 的新多模态 MoE 模型,同时支持文本、图像、音频输入,还能控制推理计算量,效率很高。原文稍后读已读值得跟进有用关注 Inkling
05:54elvis@omarsar072°Kimi发布K3开源模型,拥有2.8万亿参数、100万上下文窗口和原生多模态能力。K3采用Kimi Delta Attention,在百万token上下文中实现解码速度提升6.3倍。Attention Residuals机制以不到2%的额外成本带来约25%的训练效率提升。该模型面向长程智能体编程和自演进工作流设计,开源权重计划于2026年7月27日开放。AI模型Kimi K3Moonshot AI开源模型10 个信源在谈事件专题推荐理由:Kimi新开源模型K3,参数2.8万亿,能处理百万上下文,速度还快了6倍多,做长程智能体任务很合适。原文稍后读已读值得跟进有用关注 Kimi K3
04:54AI SDK@aisdk76°Moonshot推出Kimi K3模型,拥有2.8万亿参数和100万上下文窗口,支持原生多模态。采用Kimi Delta Attention技术,百万token上下文解码速度提升至6.3倍。Attention Residuals机制实现约25%更高训练效率,成本仅增加不到2%。模型已上线Kimi.com、Kimi Work、Kimi Code及Kimi API,计划2026年7月27日开源权重。AI模型MoonshotKimi K3推理模型10 个信源在谈事件专题推荐理由:Kimi K3参数2.8万亿,百万上下文,解码快6.3倍,适合长任务编程,赶紧试试。原文稍后读已读值得跟进有用关注 Moonshot
04:13lmarena.ai@lmarena_ai精选74°Kimi K3拥有2.8万亿参数和100万token上下文窗口,采用Kimi Delta Attention技术,在百万token上下文中解码速度提升最多6.3倍。Attention Residuals技术以不到2%的额外成本实现约25%更高的训练效率。该模型专注于长时智能体编码和自演进工作流,已在Kimi.com等平台上线,开放权重将于2026年7月27日发布。AI模型Kimi K3Kimi长上下文10 个信源在谈事件专题推荐理由:月之暗面刚发Kimi K3,2.8万亿参数能处理百万上下文,解码快6倍多,适合搞长代码项目。原文稍后读已读值得跟进有用关注 Kimi K3
04:00官方账号Decoder@Matthias BastianKimi发布名为K3的多模态开放权重模型,拥有2.8万亿参数和100万token上下文。在自有基准测试中,K3接近GPT-5.6 Sol和Claude Fable 5,并显著超过Opus 4.8和GLM 5.2。该模型定价大幅高于前代,标志着中国AI低价时代可能结束。完整权重计划于7月27日前公开发布。AI模型KimiK3GPT-5.6 Sol10 个信源在谈事件专题推荐理由:Kimi搞了个2.8万亿参数的开源模型K3,性能追平GPT-5.6 Sol和Claude Fable 5,不过价格也上去了,中国AI要涨钱了。原文稍后读已读值得跟进有用关注 Kimi
03:39官方一手AWS Machine Learning Blog@Melanie LiGrok 4.3现已上线Amazon Bedrock。该模型支持可配置的推理努力(reasoning effort)、工具调用(tool calling)和结构化输出。它还能处理图像输入并支持有状态的多轮对话。这些能力使其适用于智能体和企业级工作负载。AI模型GrokAmazon Bedrock智能体推荐理由:Grok 4.3上Bedrock了,支持工具调用和图像输入,做智能体应用很顺手。原文稍后读已读值得跟进有用关注 Grok
02:55OpenRouter@OpenRouterAI精选71°Meta 发布 Muse Spark 1.1 模型,已在 OpenRouter 平台上线,目前仅限美国开发者使用。输入价格为 1.25 美元/百万 token,输出价格为 4.25 美元/百万 token,定位高性价比。该模型专为生产级智能体工作负载设计,支持多模态输入,具备高智能水平。OpenRouter 称其为最具性价比的高智能模型之一。AI模型Muse Spark 1.1OpenRouterMeta推荐理由:Meta 新模型 Muse Spark 1.1 上架 OpenRouter,输入才 $1.25/M,还支持多模态,做智能体很划算,美国开发者快试试。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
02:54OpenRouter@OpenRouterAIMuse Spark 1.1 是一个多模态推理模型,专为智能体任务设计,涵盖编码、工具使用、计算机使用和多模态理解。该模型在多个能力维度上展示了性能表现。AI模型Muse Spark 1.1多模态推理模型推荐理由:Muse Spark 1.1 专门做智能体任务,能同时处理代码、工具调用和多模态理解,和通用模型路线不一样。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
02:43lmarena.ai@lmarena_ai精选Kimi K3 由 Moonshot AI 推出,已在 Agent Arena 上线。Agent Arena 使用数百万真实世界的长期任务评估模型性能,模型可调用网页搜索、文件系统和终端工具。Kimi K3 还支持 Text、Vision、Document 和 Frontend Code 等竞技场,用户投票将驱动排行榜更新。其评估采用因果追溯方法,衡量模型在复杂工作流中的成果表现。AI模型Kimi K3MoonshotAgent Arena10 个信源在谈事件专题推荐理由:Kimi K3 来了,在 Agent Arena 上测真实长期任务,还能调工具,快去看它和别的模型比咋样。原文稍后读已读值得跟进有用关注 Kimi K3
02:42lmarena.ai@lmarena_ai精选Inkling 在 Frontend Code Arena 开放权重模型中排名第10,得分1434,总体排名第37。它是前15名中唯一的美国开放权重模型。在品牌与营销领域排名第4,数据与分析领域排名第7,其余领域均进入前20。该模型由 Thinking Machines 发布,支持文本、图像、音频多模态推理,并提供全权重下载。即日起可通过 Tinker 进行微调并在 Inkling Playground 体验。AI模型InklingThinking MachinesFrontend Code Arena10 个信源在谈事件专题推荐理由:Thinking Machines 出的 Inkling 开放权重模型在多模态推理和多个基准上表现不错,是美国目前排名最高的开放模型,不妨试试它的推理效果。原文稍后读已读值得跟进有用关注 Inkling
01:03官方一手歸藏(guizang.ai)@op7418Kimi 的多模态理解能力被用户评价为表现优异。用户提到 Claude 似乎越来越不重视多模态任务。该用户认为 Kimi 的多模态功能在对比中有明显价值。AI模型KimiClaude多模态推荐理由:Kimi 多模态理解很能打,Claude 如果放弃这块,Kimi 就是刚需原文稍后读已读值得跟进有用关注 Kimi