7月27日
16:21
16:21官方一手Pandaily@contact@pandaily.com (Pandaily)
Lightelligence 在 WAIC 2026 上展示了全球首个实际部署的光计算系统——天书光立方门禁控制。该公司同步发布 PACE 3 光芯片,其 256x256 光子矩阵用于低延迟推理任务。该芯片已在真实场景中运行,标志光计算从实验室走向商业化。PACE 3 的光子矩阵设计相比传统电子芯片在功耗和延迟上有数量级优势。

推荐理由:Lightelligence 把光计算从论文带到了真实门禁系统里,PACE 3 芯片的 256x256 矩阵能跑低延迟推理,是商用落地的首个案例,值得关注。
16:15
16:15官方一手pandaily@contact@pandaily.com (Pandaily)
中科院计算所发布智境(ZhiJing)社交智能系统,包含SoMBench评估基准和Zing模型。Zing在社交认知任务上超越GPT-5.5,采用FLARE自进化训练和OPD蒸馏技术。该系统使AI能理解社交情境、情绪和未言明信号。

推荐理由:中科院搞了个能懂人情世故的AI模型Zing,社交认知吊打GPT-5.5,值得一看。
11:41
11:41量子位@量子位的朋友们
蚂蚁百灵发布了新一代原生混合推理模型Ling-3.0-Flash。该模型在MATH-500和HumanEval基准上取得了领先成绩,推理速度相比上一代有显著提升。它支持文本与代码等多模态输入,已通过百灵开放平台提供API。
推荐理由:蚂蚁百灵出了Ling-3.0-Flash,数学和代码能力强,速度更快,开发者直接调API就能用。
7月26日
18:55
18:55官方一手marktechpost@Michal Sutter
快手KwaiKAT团队发布技术报告,推出KAT-Coder-V2.5智能体编程模型,在10万个可验证仓库环境上训练。团队开发AutoBuilder工具,将环境构建成功率从16.5%提升至57.2%,覆盖12种编程语言。沙盒审计机制将强化学习反馈错误率从约16%降低至2%以下。研究指出,智能体编程能力的瓶颈在于训练基础设施而非模型规模。
推荐理由:快手开源了KAT-Coder-V2.5,用10万个可验证环境训练代码智能体。AutoBuilder把环境搭建成功率从16%拉到57%,沙盒审计又让反馈错误降到2%以下。做编程智能体训练的值得一看。
17:16
17:16官方一手marktechpost@Michal Sutter
Induction Labs 推出 Imagination Models 架构,其候选模型 Photon-1 为稀疏 106B-A5B MoE,仅在未标注动作的原始视频上完成单次预训练。Photon-1 能够模拟桌面操作、玩跳棋,并建模台球物理。该架构挑战了传统需动作标签的预训练范式。
推荐理由:Induction Labs 搞了个新套路:不用动作标签,只看视频就能学会模拟桌面、跳棋和台球物理。106B 参数的 MoE 模型,一次预训练就够了。
16:12
16:12官方一手pandaily@contact@pandaily.com (Pandaily)
腾讯 Robotics X 在 WAIC 2026 上开源三个具身基础模型:VLM 负责场景理解,RxBrain 认知模型基于视觉状态进行规划,VLA 连续动作控制频率达 500-1000Hz。首席科学家张正友解释了三层大脑架构,解决了机器人反应速度问题。这些模型分别对应感知、认知和动作层,可组合用于复杂操作任务。

推荐理由:腾讯开源了三个具身模型,像搭积木一样分层解决机器人从看懂到动起来的难题,VLA 能做到毫秒级反应,做机器人开发的一定要看看。
08:18
08:18官方一手marktechpost@Asif Razzaq
Sakana AI 发布了基于 Fugu 编排模型的安全调优端点 Fugu-Cyber。该模型在 CyberGym 基准上取得 86.9% 准确率,在 CTI-REALM 上达到 72.1%。其性能超过了 GPT-5.5-Cyber 和 Claude Mythos Preview。访问需要手动批准并遵循防御性使用政策及 Token 计划。
推荐理由:Sakana AI 新出的网络安全模型 Fugu-Cyber 在 CyberGym 上拿了 86.9%,比 GPT-5.5-Cyber 还高,做安全测试的可以关注。
7月25日
18:53
18:53官方账号Decoder@Matthias Bastian
Anthropic的Opus 5模型在Auto Mode下,针对浏览器智能体在129个测试场景中实现零提示注入成功率。无额外保护时成功率仅为3.7%。若实际表现一致,该模型可能解决了浏览器AI智能体最严重的安全问题。
事件专题

推荐理由:Anthropic的Opus 5在Auto Mode下把浏览器智能体的提示注入防御做到了100%,129个测试全过,这可能彻底解决智能体安全难题。
16:02
16:02官方账号Latent Space (swyx)博客/媒体
Anthropic发布了Claude Opus 5模型,性能达到Fable级别,但定价与Opus相同,即Fable价格的一半。这表明Anthropic在模型蒸馏上具备显著优势,能将高价模型能力压缩到低价模型。该模型主要面向需要高性能低成本的推理场景。
事件专题

推荐理由:Anthropic整了个Claude Opus 5,性能赶上Fable只卖Opus的价,蒸馏技术太猛了!
13:11
13:11量子位@henry
Vivix推出首个实时互动模型,采用统一流式架构。单卡视频生成速度突破10000 video tokens/s。该模型打通实时多模态生成全链路,支持视频、图像、音频等模态的实时交互。相比传统非实时方案,延迟降低至毫秒级。
推荐理由:Vivix这个新模型单卡就能每秒生成上万视频token,做实时互动视频、多模态聊天特别带劲,比之前那些慢吞吞的方案强多了。
09:09
09:09官方账号Simon Willison’s Weblog博客/媒体
精选
Anthropic 的 Claude Opus 5 在提示注入(prompt injection)防护上取得显著进展。根据官方系统卡和红队评估,Opus 5 是 Anthropic 迄今最难以被成功提示注入的模型。这一结果基于多项 PI 评估和对抗测试,标志着大模型安全性的一次重要提升。
事件专题

推荐理由:Anthropic 的 Opus 5 在防提示注入上做到了史上最强,红队测试都很难攻破,安全团队值得关注。
05:57
05:57官方一手marktechpost@Asif Razzaq
82°
Anthropic推出Claude Opus 5,取代Opus 4.8成为Opus系列旗舰模型。输入价格维持$5/百万token,输出价格$25/百万token。该模型智能接近Claude Fable 5但价格仅为后者一半。它支持代理编码和计算机使用功能。
事件专题

推荐理由:Anthropic新出的Claude Opus 5,定价和以前一样,能力却快赶上更贵的Fable 5了,特别适合搞AI编程和控制电脑。
02:55
02:55官方账号Decoder@Matthias Bastian
74°
Anthropic推出了旗舰模型Claude Opus 5,在编码和知识工作基准上取得高分。该模型在ARC-AGI-3(评估新颖问题解决能力的基准)上达到30.2%,几乎是GPT-5.6 Sol的四倍。其token价格仅为Fable 5的一半。
事件专题

推荐理由:Anthropic的新模型Opus 5在推理和编程上很强,价格只有Fable 5一半,性价比高。
02:03
02:03官方一手AWS Machine Learning Blog@Aamna Najmi
81°
Anthropic宣布Claude Opus 5在AWS Bedrock上可用,这是目前最强大的Opus系列模型。新模型针对智能体系统和生产推理负载进行了优化,提供了更好的性能和集成能力。AI工程师可通过Amazon Bedrock直接调用该模型,并获取相关文档和部署指南。
事件专题

推荐理由:Anthropic最新的Claude Opus 5上了AWS,想试试最强Opus做智能体或生产部署的,可以直接用Bedrock了。
01:03
7月24日
23:03
23:03官方账号Decoder@Matthias Bastian
Sakana AI更新了Fugu Ultra AI路由器至v1.1版本,声称性能比v1.0提升最多7.9个点。新版本添加了一个Claude Code兼容的端点。Sakana声称v1.1在基准测试中击败了Fable 5,尽管Fable 5并未包含在路由器的模型池中。该服务仍不支持欧盟地区,且独立验证尚未进行。
事件专题

推荐理由:Sakana的新版Fugu Ultra v1.1性能提升7.9分,还多了Claude Code接口。没把Fable 5放池里就说能赢,挺有意思的。
14:51
14:51IT之家博客/媒体
81°
阿里云发布OvisOCR2,一个0.8B参数端到端文档解析模型。在OmniDocBench v1.6上以96.58综合得分登顶,首次超越流水线方法。该模型由Qwen3.5-0.8B后训练得到,采用SFT、RL、在线策略蒸馏和模型融合四阶段训练。以Apache 2.0开源,兼容vLLM和Qwen3.5推理生态,可无缝集成。

推荐理由:阿里新开源的0.8B模型OvisOCR2,端到端做文档解析,96.58分刷榜OmniDocBench,比传统流水线方法强。小模型就能做到,部署还简单,搞RAG、知识库的可以试试。
13:58
13:58量子位@林, 方舟
因果世界模型在35家大型央国企完成实地测试,并宣布正式落地应用。该模型基于因果推断技术,可提升预测与决策的准确性。实测覆盖了能源、制造、金融等多个行业场景。
推荐理由:35家央国企实测验证,因果世界模型在因果推断上能帮企业做更准的决策,适合业务落地。
13:03
13:03官方账号Latent Space (swyx)博客/媒体
Black Forest Labs 发布了 FLUX 3,这是一种多模态流模型。它在图像生成等任务上击败了 Seedance 2.0、Gemini Omni 和 Grok Imagine。此外还推出了 FLUX-mimic 视频动作机器人模型。这些模型展示了 BFL 在多模态生成和机器人领域的进展。
事件专题

推荐理由:BFL 新出的 FLUX 3 图像生成超强,直接吊打 Seedance 2.0、Gemini Omni 和 Grok Imagine,还带了个机器人模型,快来看看。
7月23日