08:38官方账号Simon Willison’s Weblog(博客/媒体)精选76°Anthropic 发布了 Claude Opus 4.8,官方描述为“微小但切实的改进”。该模型最大的亮点是诚实性提升,在评估中错误率最低,主要通过不确定时主动弃权而非强行回答来减少幻觉。定价与 Opus 4.7 相同,但新增了“快速模式”且价格大幅降低。技术上新支持对话中插入系统消息,可动态调整指令而不影响缓存,对长对话和智能体循环更友好。提示缓存最低门槛也从 1024 降至 512 token,进一步降低成本。AI模型Claude Opus 4.8Anthropic诚实性10 个信源在谈事件专题推荐理由:Anthropic 坦诚承认这是小幅升级,但诚实性改进和对话中系统消息功能对做长对话应用或智能体开发的团队很实用,建议关注缓存优化带来的成本节省。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
07:36官方一手marktechpost@Asif RazzaqLiquid AI 发布了 LFM2.5-8B-A1B,一款面向端侧设备的混合专家(MoE)模型。该模型总参数量为 8.3B,但每次推理仅激活 1.5B 参数,大幅降低了计算和内存需求。它支持 128K 上下文长度,具备推理和工具调用能力,可在消费级硬件上运行。这标志着端侧 AI 模型在效率与能力之间取得了重要平衡,为移动设备和边缘计算场景提供了新的选择。AI模型端侧模型MoELiquid AI推荐理由:端侧部署大模型一直受限于算力和内存,LFM2.5-8B-A1B 用 1.5B 激活参数实现 128K 上下文和工具调用,做移动端 AI 应用或边缘推理的开发者可以直接评估其性能。原文稍后读已读值得跟进有用关注 端侧模型
06:54IT之家(博客/媒体)83°Anthropic 于 5 月 29 日发布旗舰模型 Claude Opus 4.8,重点提升编程、智能体和知识工作能力。相比 Opus 4.7,新模型在复杂任务中更稳定,能主动提问、识别错误,并减少无依据结论。官方评估显示,其放任代码缺陷的概率降低约 4 倍,同时亲社会行为指标创新高。claude.ai 新增 effort 程度控制,用户可平衡质量与响应速度。定价不变,快速模式速度提升 2.5 倍,成本降至 1/3。AI模型Claude Opus 4.8编程助手智能体10 个信源在谈事件专题推荐理由:做 AI 编程和智能体开发的团队终于有了更可靠的模型——Opus 4.8 减少无依据结论,主动标出不确定性,建议在复杂多步骤任务中直接试用。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
05:36官方账号Decoder@Matthias Bastian88°Anthropic 推出了 Claude Opus 4.8,该模型在大多数基准测试中超越了 GPT-5.5 和 Gemini 3.1 Pro。相比前代,它发现自身编码错误的频率提高了四倍。同时,Anthropic 还推出了动态工作流功能,可启动数百个并行子智能体来处理代码库迁移等任务。这标志着 Claude 在性能和自动化能力上的显著提升。AI模型Claude Opus 4.8GPT-5.5Gemini 3.1 Pro10 个信源在谈事件专题推荐理由:Claude Opus 4.8 在编码错误检测和并行任务处理上大幅进化,做大型代码库迁移或复杂自动化的开发者可以直接体验动态工作流带来的效率提升。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
17:17官方一手marktechpost@Asif Razzaq精选72°Perplexity AI 开源了其重写的 Unigram 分词器,该分词器在 p50 延迟上比 Hugging Face tokenizers crate 低 5 倍,同时将生产环境的 CPU 利用率降低了 5-6 倍。这一改进主要针对重排序器(reranker)的延迟瓶颈,通过优化分词效率来提升整体推理性能。开源版本已在 GitHub 上发布,可供开发者直接使用。对于依赖大规模文本处理的 AI 团队来说,这能显著降低计算成本并加快响应速度。AI模型分词器开源/仓库Perplexity AI推荐理由:做搜索或 RAG 系统的团队终于有了更快的分词方案——Perplexity 开源的这个 Unigram 分词器直接降低 5 倍延迟和 6 倍 CPU 消耗,建议有高吞吐需求的开发者立刻试一下。原文稍后读已读值得跟进有用关注 分词器
16:10IT之家(博客/媒体)联发科官网上线天玑 8550 处理器参数,基于台积电 4nm N4P 工艺。CPU 采用全大核 8 核 Cortex-A725 架构,包括 1 颗 3.4GHz、3 颗 3.2GHz 和 4 颗 2.2GHz 核心。GPU 为 Mali-G720 MC8,配备 NPU 880 并支持 Google Gemini Nano V3。OPPO Reno 16 和荣耀 600 Pro 已分别搭载天玑 8550 SUPER 和 Elite 版本。AI模型天玑8550联发科Cortex-A7251 个信源在谈事件专题推荐理由:全大核新旗舰,4nm工艺原文稍后读已读值得跟进有用关注 天玑8550
15:39官方一手pandaily@contact@pandaily.com (Pandaily)精选76°Sphere AI Lab 开源了 Orbit,一个强化学习后训练框架,支持在单个 8×B200 节点上对万亿参数模型(如 DeepSeek-V4)进行微调。该框架通过优化内存和计算效率,大幅降低了大规模模型训练的门槛,使得资源有限的团队也能进行高效的后训练。Orbit 的发布解决了万亿参数模型训练需要大规模集群的痛点,有望推动更多研究者和开发者参与大模型的后训练优化。AI模型开源/仓库强化学习后训练推荐理由:Orbit 让万亿参数模型的后训练不再依赖大规模集群,做 RL 微调或大模型优化的团队可以直接在单节点上跑 DeepSeek-V4,建议试试这个开源方案。原文稍后读已读值得跟进有用关注 开源/仓库
15:39官方一手pandaily@contact@pandaily.com (Pandaily)精选中国 AI 独角兽 MiniMax 正在准备推出其下一代 M3 大语言模型,该模型采用自研稀疏注意力机制,声称预填充速度提升 9.7 倍。M3 模型旨在解决长上下文场景下的计算效率瓶颈,通过稀疏化注意力计算减少冗余,从而加速推理并降低资源消耗。这一进展对需要处理超长文本的 AI 应用(如文档分析、对话系统)具有重要意义。MiniMax 预计在 2026 年 5 月正式发布 M3 模型。AI模型MiniMaxM3稀疏注意力推荐理由:稀疏注意力是当前大模型效率优化的关键方向,MiniMax 的 9.7 倍提速对做长文本推理的开发者是直接利好,值得关注其技术细节和开源计划。原文稍后读已读值得跟进有用关注 MiniMax
15:35官方一手Pandaily@contact@pandaily.com (Pandaily)精选中国多家研究机构联合推出RoboMemArena基准。该基准专门用于评估机器人记忆能力。它聚焦长时操作任务(long-horizon manipulation tasks)。这是首个全面评估机器人记忆的基准。AI模型RoboMemArena机器人记忆基准测试推荐理由:首个机器人记忆基准原文稍后读已读值得跟进有用关注 RoboMemArena
14:49IT之家(博客/媒体)精选阿里巴巴达摩院5月28日发布“敏迭”求解器(MindOpt)GPU版本,在近2000个通用算例测试中,稳定求解99%以上的问题类型。该版本新算法缓解了GPU求解器的“长尾效应”,在高精度下求解成功率比主流产品提升14%,速度平均提升2.67倍。它还能稳定求解超过80%的亿级变量线性规划问题,如某数字广告平台3.3亿变量、1600万约束的问题可在1700秒内解到可靠精度。AI模型敏迭求解器MindOpt达摩院推荐理由:达摩院GPU求解器,算亿级变量快准稳原文稍后读已读值得跟进有用关注 敏迭求解器
03:09官方账号Decoder@Matthias Bastian微软最新图像生成模型 MAI-Image-2.5 在 Arena 文生图排行榜上位列第三,与谷歌的 Nano Banana 2 持平,但仍落后于 OpenAI 的 Image-2。相比前代,该模型在图像内文本渲染和商业视觉内容方面有显著提升。这标志着微软在图像生成领域与谷歌的竞争进入白热化阶段,尤其适合需要高质量图文混排的营销和设计场景。AI模型微软MAI-Image-2.5谷歌7 个信源在谈事件专题推荐理由:做营销素材和电商设计的团队可以关注——MAI-Image-2.5 的文本渲染能力直接对标谷歌,生成带字海报和产品图更靠谱,值得在内部测试中对比一下。原文稍后读已读值得跟进有用关注 微软
02:42官方一手Hugging Face: Blog(博客/媒体)IBM与Artificial Analysis联合推出ITBench-AA,这是首个针对企业IT运维场景的智能体基准测试。测试涵盖事件响应、故障排查等真实任务,结果显示包括GPT-4、Claude在内的前沿模型平均得分低于50%。该基准揭示了当前AI智能体在处理复杂企业IT流程时的能力短板,为行业提供了可量化的评估标准。AI模型智能体企业IT基准测试推荐理由:企业IT团队终于有了衡量AI智能体真实能力的标尺——前沿模型都不到50分,说明自动化运维还有很大提升空间,做IT运维或AI落地的建议点开看看差距在哪。原文稍后读已读值得跟进有用关注 智能体
01:12官方一手marktechpost@Asif Razzaq76°NVIDIA 研究人员推出 Polar,一个 token 忠实展开框架,用于通过强化学习训练语言智能体,无需修改其智能体框架。Polar 在框架和推理服务器之间放置模型 API 代理,捕获 token 级交互并重建训练器就绪轨迹。基于 Qwen3.5-4B 基础模型使用 GRPO,Polar 在 Codex 框架下将 SWE-Bench Verified pass@1 提升 22.6 个百分点,在 Claude Code 下提升 4.8 个百分点,在 Pi 下提升 6.2 个百分点。该框架已注册为 NeMo Gym 环境,并在 ProRL Agent Server 仓库中发布。AI模型NVIDIAPolarGRPO4 个信源在谈事件专题推荐理由:Polar 解决了 RL 训练智能体时需修改框架的痛点,做代码智能体或 RL 训练的开发者可以直接集成,无需改动现有工具链,值得一试。原文稍后读已读值得跟进有用关注 NVIDIA
19:06IT之家(博客/媒体)76°Anthropic 工程师 Sholto Douglas 宣布,其 Claude Mythos 模型成功解出了 1946 年提出的“平面单位距离猜想”。该难题此前由 OpenAI 的 GPT-5.5 模型攻克。Douglas 表示,Claude Mythos 给出了一份“巧妙而简洁”的证明,并认为这显示了 AI 在数学发现领域的巨大潜力。测试中,团队搭建了多实例系统,让多个 Claude Code 实例独立探索证明路径,再汇总优化。数学家 Daniel Litt 评价称,Mythos 的结果“略逊于”OpenAI 的版本。AI模型Claude MythosGPT-5.5数学推理10 个信源在谈事件专题推荐理由:AI 连续攻克经典数学难题,证明大模型在数学推理上正在突破边界。对数学研究者和 AI 能力观察者来说,这是值得关注的里程碑——Claude 的解法虽稍逊,但思路独特,建议点开对比两家思路。原文稍后读已读值得跟进有用关注 Claude Mythos
15:30官方一手marktechpost@Michal Sutter72°EAGLE 团队联合 vLLM 和 TorchSpec 发布了 EAGLE 3.1,旨在解决生产环境中推测解码的不稳定性。该算法通过修复注意力漂移问题,提升了 LLM 推理的效率和可靠性。EAGLE 3.1 针对大规模部署场景优化,减少了推理延迟和资源消耗。这一更新对于需要高性能 LLM 推理的团队具有重要意义。AI模型EAGLE 3.1推测解码注意力漂移推荐理由:EAGLE 3.1 解决了生产环境中推测解码的稳定性痛点,做 LLM 推理优化的团队可以直接用上,减少注意力漂移带来的性能损失。原文稍后读已读值得跟进有用关注 EAGLE 3.1
15:23IT之家(博客/媒体)72°MiniMax 在 X 平台预告即将推出 M3 系列 AI 模型,并转发了一篇关于 M2 系列的 arxiv 论文。M2 系列总参数 229.9B,但每个词元仅激活 9.8B 参数,主打低激活高智能,配备 192K 上下文窗口。论文重点介绍了 M2.7 的自我进化雏形:模型能自主排查训练失败、阅读日志、修改代码,并在内部任务上完成 100 轮自主迭代,吸收团队 30%-50% 的日常迭代工作量。此外,MiniMax 还提出了面向智能体的强化学习系统 Forge,支持白盒与黑盒智能体统一接入,降低长轨迹训练成本。这些进展表明 MiniMax 在高效模型架构和模型自主迭代方面取得重要突破。AI模型MiniMaxM3系列M2系列推荐理由:MiniMax 的 M2 论文展示了模型开始参与自身开发闭环,做 AI 训练和模型优化的团队值得关注——自我进化能力可能改变模型迭代方式。原文稍后读已读值得跟进有用关注 MiniMax
14:14IT之家(博客/媒体)微软研究院发布 MAI-Image-2.5,这是其 MAI-Image 系列最强图像生成模型,在 Arena 文生图榜单升至第三。该模型重点增强了文字渲染能力,可胜任信息图、海报、包装等需要准确呈现文字的任务,同时在风格化插画、商业图像和视觉推理方面表现更稳定。用户已可在 Arena 体验,未来两周内将上线 MAI Playground 与 Foundry。AI模型微软MAI-Image-2.5图像生成推荐理由:做设计、营销或内容创作的团队终于有了更靠谱的商用级生图工具——文字渲染和视觉推理的提升让海报、包装这类需求不再翻车,建议直接去 Arena 试效果。原文稍后读已读值得跟进有用关注 微软
14:05IT之家(博客/媒体)PrismML 发布 Bonsai Image 4B 系列图像生成模型,包含 1-bit 和 Ternary 两个版本,专为本地设备优化。该模型基于 LUX.2 Klein 4B 构建,通过二值/三值权重大幅压缩体积,1-bit 版 Transformer 仅 0.93GB,内存占用降至 1.5GB。在 iPhone 17 Pro Max 上生成 512×512 图像仅需 9.4 秒,Mac M4 Pro 上约 6 秒,速度比全精度模型快 5.6 倍。质量方面,Ternary 版在 1.21GB 体积下保留约 95% 的准确性,1-bit 版在不足 1GB 下保留约 88%。这标志着高质量图像生成模型首次在手机上实现实时可用。AI模型图像生成模型压缩本地部署推荐理由:手机端终于能跑正经的图像生成模型了,做移动端 AI 应用或创意工具的开发者可以直接在 iPhone 上体验,9.4 秒出图的速度已经可用。原文稍后读已读值得跟进有用关注 图像生成
13:50IT之家(博客/媒体)精选72°英伟达团队发布 PiD(像素扩散解码器)图像生成技术,将潜在解码与上采样合并为一个生成模块,在消费级 RTX 5090 上仅需 13GB 显存、不到 1 秒即可将 512×512 潜变量解码放大至 2048×2048 像素。PiD 基于 PixelDiT 构建,加入轻量级 ControlNet 适配器,并通过 DMD2 蒸馏将推理步数压缩至 4 步,配合早停机制兼顾速度与质量。相比级联式扩散超分方案,端到端延迟最多快 5.9 倍,视觉保真度更优。该技术兼容传统 VAE 和语义潜变量(如 SigLIP、DINOv2),具备较强通用性。AI模型英伟达PiD图像生成推荐理由:英伟达 PiD 解决了高分辨率图像生成中解码器速度慢、显存占用高的痛点,做 AI 图像生成或超分应用的开发者可以直接在消费级显卡上跑通,值得关注。原文稍后读已读值得跟进有用关注 英伟达
10:52官方一手Pandaily@contact@pandaily.com (Pandaily)精选美团发布LongCat-Video-Avatar 1.5版本,这是一个开源的数字人视频生成框架。该框架在口型同步精度上达到最先进水平,只需8步推理即可生成逼真视频。AI模型LongCat-Video-AvatarMeituan数字人1 个信源在谈事件专题推荐理由:8步推理生成逼真数字人原文稍后读已读值得跟进有用关注 LongCat-Video-Avatar
08:24IT之家(博客/媒体)精选SiPearl 宣布其基于 Arm Neoverse V1 内核的 80 核 CPU Rhea1 成功点亮。该芯片采用台积电 6nm 工艺,集成超 610 亿晶体管,配备 64GB HBM + 四通道 DDR5 混合内存和 104 条 PCIe Gen5 通道。初步测试结果积极,后续将进行 12 周功能启动验证。目标今年底装配至欧洲首台 E 级超算 JUPITER 服役。AI模型Rhea1SiPearlArm推荐理由:欧洲自研最强CPU点亮了原文稍后读已读值得跟进有用关注 Rhea1
07:14官方一手marktechpost@Sana Hassan本文教程介绍了如何使用 ZeroEntropy 的 Zerank-2 重排序器(基于 Qwen3 的 4B 交叉编码器)来提升检索质量。教程从设置运行环境、加载模型开始,逐步讲解如何对查询-文档对进行评分。接着,从简单的成对评分过渡到实用的两阶段检索-重排序管道:先用快速的双编码器检索候选文档,再用 Zerank-2 进行精排。该方案能显著提高检索精度,适合需要高准确率的信息检索场景。AI模型检索增强生成重排序交叉编码器推荐理由:做 RAG 或搜索系统的开发者,这个教程直接教你用 Zerank-2 搭建两阶段管道,从环境配置到实战代码都有,值得跟着跑一遍。原文稍后读已读值得跟进有用关注 检索增强生成
06:32官方一手marktechpost@Asif Razzaq76°Stability AI 发布了 Stable Audio 3,一个用于乐器音乐和音效生成的潜在扩散模型家族。该版本包含小型和中等变体的开源权重。小型模型可在 MacBook Pro M4 CPU 上运行,中等模型适配 8GB VRAM 的消费级 GPU。两者均通过三阶段训练流程(流匹配、蒸馏预热、对抗后训练)生成 44.1 kHz 立体声音频。在 BBC 音效基准测试中,SA3 中等模型在 5 秒片段上取得 FAD 0.369 的分数,低于论文中评估的所有开源基线。AI模型Stable Audio 3音频生成潜在扩散模型推荐理由:Stable Audio 3 让音频生成门槛大幅降低——小型模型在普通笔记本上就能跑,做游戏音效、短视频配乐的创作者可以直接上手试试。原文稍后读已读值得跟进有用关注 Stable Audio 3
02:50官方账号Decoder@Matthias Bastian76°继 OpenAI 推翻 Erdős 单位距离猜想后,Anthropic 的 Claude Mythos 模型在周末独立解决了同一问题。工程师 Sholto Douglas 称 Mythos 给出了一个“可爱、简单的证明”,这被视为 AI 驱动数学发现中“严重悬而未决”的迹象。该问题源于 1946 年的 Erdős 猜想,此前被认为极具挑战性。这一事件凸显了 AI 在数学推理领域的快速进步,以及不同模型间能力的重叠。AI模型Claude Mythos数学推理Erdős 问题10 个信源在谈事件专题推荐理由:数学和 AI 研究者值得关注——Claude Mythos 用简洁证明攻克了经典难题,说明 AI 在数学发现上的潜力远超预期,建议点开看看这个“可爱”的证明细节。原文稍后读已读值得跟进有用关注 Claude Mythos
23:52IT之家(博客/媒体)精选华为发布以逻辑折叠技术为核心的'韬定律',将芯片设计从2D平面转向标准单元堆叠的3D重构。北京大学团队随后官宣面向该设计的'真3D'EDA工具原型,覆盖布局规划和布局阶段,支持GPU加速和千万级实例规模。相比当前赝3D流程,该工具实现平均约30%线长缩减、约6%WNS改善与约12%TNS改善,峰值温度下降3%以上。验证实例规模从约100万到约2470万。AI模型华为韬定律北京大学推荐理由:华为3D芯片新思,北大EDA实测线长缩30%原文稍后读已读值得跟进有用关注 华为
15:51IT之家(博客/媒体)精选AMD CEO 苏姿丰已开始为 Zen 7 平台布局供应链,代号 Grimlock。核心芯片组采用台积电 A14 工艺制程,搭配新一代 3D V-Cache 技术,产品力争 2028 年问世。台积电台中 Fab 25 P1 厂区预计 2027 年试产、2028 年量产。AMD 正评估力成 FOPLP 封装方案,旗舰 CCD 将采用 16 核心设计,单颗 CCD 的 L3 缓存最高可达 224MB。谱瑞为 AMD 打造下一代 ASIC-Like 产品,采用 6nm 与 12nm 制程,已开始试产。AI模型Zen 7AMD台积电推荐理由:AMD 开始布局下一代 CPU,工艺和封装都有新动作原文稍后读已读值得跟进有用关注 Zen 7
13:43IT之家(博客/媒体)精选阿里旗舰模型 Qwen3.7-Max 在权威编程榜单 Code Arena 上以 1541 分排名全球第二,仅次于 Claude 系列,超越了 Claude Opus 4.6、GLM-5.1 和 Kimi K2.6。Code Arena 采用用户随机盲测,防止刷榜,评估真实代码生成、调试和重构能力。此外,该模型在 Design Arena 榜单也位列第十。这标志着国产大模型在硬核编程能力上首次进入全球第一梯队。AI模型Qwen3.7-Max阿里千问Code Arena推荐理由:国产模型首次在权威编程盲测中超越 Claude Opus 4.6,做 AI 编程工具选型或关注国产大模型进展的开发者值得关注,建议直接去 Code Arena 看榜单。原文稍后读已读值得跟进有用关注 Qwen3.7-Max
13:34IT之家(博客/媒体)精选华为在ISCAS 2026上提出半导体新演进路径“韬定律”,核心指标从晶体管尺寸转向时间常数τ。基于该定律,华为6年量产381款芯片,并通过“τ缩微”和“逻辑折叠”技术在垂直方向堆叠电路。华为预计2031年高端芯片晶体管密度可达1.4纳米制程同等水平。上海交通大学教授周健军称该定律重构了沿用50余年的摩尔定律范式,为产业开辟全新发展指引。AI模型韬定律华为逻辑折叠推荐理由:华为用时间换性能,芯片不用只拼制程了原文稍后读已读值得跟进有用关注 韬定律
13:15IT之家(博客/媒体)83°面壁智能联合清华大学、OpenBMB 开源社区发布了 MiniCPM5-1B 端侧文本基座大模型。该模型仅 1B 参数,在 AA-Index 榜单上超越了所有 2B 参数以下模型,性能优于 3 个月前发布的 Qwen3.5-2B 且参数量减半。INT4 量化后权重仅 0.5GB,可直接在手机和浏览器上运行。模型权重、训练数据集与部署方案已全面开源,基于面壁智能自研的 ForgeTrain 框架预训练。AI模型端侧模型开源/仓库MiniCPM5-1B推荐理由:端侧部署大模型终于有了小参数高性能的选择——做移动端 AI 应用或边缘计算的开发者,可以直接在手机或浏览器里跑这个模型,建议试试它的量化版本。原文稍后读已读值得跟进有用关注 端侧模型
13:13IT之家(博客/媒体)精选昆仑万维天工 AI 推出 SkyClaw-v1.0 及轻量版 SkyClaw-v1.0-lite,支持百万 token 上下文,专为真实智能体工作流设计。模型在复杂工具调用、多轮任务、代码生成等场景表现优异,全面超越 Minimax 2.7、DeepSeek V4 Flash 等开源模型,性能接近更大规模顶级模型。定价低于同类一半,已接入天工 Skywork 平台,即日起开放 2-4 周免费试用。AI模型Agent 模型百万上下文开源/仓库推荐理由:做 Agent 开发或自动化工作流的团队终于有了性价比之选——SkyClaw 百万上下文且定价低于同类一半,建议直接免费试用看看能否替代现有方案。原文稍后读已读值得跟进有用关注 Agent 模型
12:58IT之家(博客/媒体)83°谷歌 DeepMind 推出 AlphaProof Nexus,结合大语言模型与 Lean 形式化验证,在 353 个开放的 Erdős 问题中自主解决 9 个,包括 2 个悬而未决 56 年的问题。该系统由 4 个复杂度递增的 AI 智能体组成,每个问题推理成本仅数百美元。研究还发现,最简单的 Agent A 也能证明这些难题,反映出底层模型能力提升和编译器反馈的锚定作用。这标志着 AI 在数学研究领域取得重大突破,能自主发现并证明长期未解猜想。AI模型谷歌 DeepMindAlphaProof Nexus数学证明推荐理由:数学研究者和 AI 爱好者会兴奋——AlphaProof Nexus 用数百美元成本就解决了人类 56 年未解的难题,证明 AI 已能自主推进数学前沿,值得点开看看具体怎么做到的。原文稍后读已读值得跟进有用关注 谷歌 DeepMind
12:57官方一手pandaily@contact@pandaily.com (Pandaily)精选72°Model Best 开源了 BitCPM-CANN 训练框架,首次在国产 AI 加速器上实现 1.58-bit 模型训练。该框架相比全精度训练,推理内存需求降低高达 6 倍,大幅降低硬件门槛。这一突破使得国产算力也能高效运行低比特模型,对依赖国产芯片的 AI 团队意义重大。开源框架已发布,开发者可直接使用。AI模型开源/仓库训练框架低比特量化推荐理由:国产芯片终于能跑 1.58-bit 训练了,内存需求直降 6 倍,用国产算力的 AI 团队可以直接上手试试。原文稍后读已读值得跟进有用关注 开源/仓库
10:57IT之家(博客/媒体)精选科技媒体报道,谷歌针对Antigravity用户抱怨简单任务消耗过多Token,推出Gemini 3.5 Flash (Low)版本。该版本通过调整推理投入强度,比Medium版本节省约45% Token,且在软件工程任务上优于更早的Gemini 3 Flash。谷歌同时重置了所有免费和付费Gemini计划的配额,保证用户本周有足够额度。AI模型AntigravityGemini 3.5 Flash谷歌推荐理由:谷歌新出省Token版Gemini,比Medium省45%原文稍后读已读值得跟进有用关注 Antigravity
08:41IT之家(博客/媒体)88°Anthropic 的最强模型 Claude Mythos 预览版在 Claude Code 和 Claude Security 中短暂出现后被撤下,暗示即将公开上线。该模型定位为面向计算机安全任务的前沿模型,相比 Opus 4.7 在代码推理和自主执行方面显著提升。Anthropic 此前警告 Mythos 能自动开发专业级网络攻击手段,因此迟迟未全面开放。同时,Anthropic 推进名为 Glasswing 的项目,联合其他公司保护关键软件系统,已使用 Mythos Preview 帮助 50 家组织。这一动态表明 Anthropic 在平衡模型能力与安全风险后,可能准备向更广泛用户开放。AI模型AnthropicClaude Mythos推理模型10 个信源在谈事件专题推荐理由:Anthropic 最强模型 Mythos 即将公开,做安全研究和代码自动化的开发者值得关注——它既能大幅提升效率,也带来新的安全挑战,建议提前了解其能力边界。原文稍后读已读值得跟进有用关注 Anthropic
07:04IT之家(博客/媒体)88°多名开发者在 OpenAI Codex 后端日志中发现未官宣模型 GPT-5.6,内部代号 iris-alpha,支持 150 万 tokens 上下文窗口,预计今年 6 月发布。相比当前 GPT-5.5 API 的 105 万 tokens 提升 43%,极端测试显示 90 万 tokens 仍能流畅响应。该模型还展示了强大的前端界面生成能力,能直接生成极简记事应用界面,接近商用水平。此外,Anthropic、Google 和 xAI 的竞品也可能瞄准同期发布。AI模型OpenAIGPT-5.6上下文窗口10 个信源在谈事件专题推荐理由:150 万 tokens 上下文窗口让处理超长合同、分析大型代码仓库成为可能,做文档密集型工作或复杂编程的开发者值得关注,可以直接用上更强大的长文本能力。原文稍后读已读值得跟进有用关注 OpenAI
05:31官方一手marktechpost@Asif Razzaq72°Together AI 开源了 OSCAR,一种面向长上下文 LLM 推理的 INT2 KV 缓存量化方法。与依赖数据无关的 Hadamard 变换不同,OSCAR 通过离线估计注意力感知的协方差结构,为键和值分别推导旋转矩阵。在 Qwen3-4B-Thinking-2507 和 Qwen3-8B 上,OSCAR 以每 KV 元素 2.28 比特的精度,将 BF16 精度差距分别缩小至 3.78 和 1.42 分。该方法可实现约 8 倍的 KV 内存缩减,并在 100K 上下文长度下带来最高 3 倍的解码加速。AI模型量化KV 缓存长上下文推荐理由:长上下文 LLM 推理的内存瓶颈终于有了实用解法——OSCAR 在 2-bit 量化下几乎不损失精度,做长文档/多轮对话推理的团队可以直接集成,显著降低硬件成本。原文稍后读已读值得跟进有用关注 量化
19:02官方账号Decoder@Matthias Bastian83°Google DeepMind 的 AlphaProof Nexus 系统自主解决了九个开放的 Erdős 问题,其中两个困扰数学家长达56年,每个问题的推理成本仅需数百美元。与 OpenAI 的自然语言方法不同,该系统使用 Lean 编译器自动验证每一步证明,确保结果严谨可靠。不过,整体成功率仅为2.5%,表明 AI 在数学推理领域仍有巨大提升空间。这一成果展示了 AI 在解决高难度数学问题上的潜力,可能加速数学研究进程。AI模型AlphaProof Nexus数学推理Lean编译器7 个信源在谈事件专题推荐理由:数学研究者和 AI 推理方向开发者值得关注——AlphaProof Nexus 用极低成本攻克了人类多年未解的难题,虽然成功率低,但证明了形式化验证路径的可行性,建议点开了解其技术细节。原文稍后读已读值得跟进有用关注 AlphaProof Nexus
14:52IT之家(博客/媒体)88°马斯克宣布 Grok V9-Medium 模型(1.5 万亿参数)已完成训练,评估结果不错。该模型在补充训练中加入了大量 Cursor 数据,旨在提升编程任务处理能力。微调和强化学习正在进行中,预计 2 到 3 周后公开发布。相比当前使用的 0.5T V8-Small 版本,V9-Medium 将是一个重大进步,尤其针对困难编程任务。xAI 已被 SpaceX 收购并更名为 SpaceXAI。AI模型GrokV9-Medium1.5T 参数2 个信源在谈事件专题推荐理由:Grok V9-Medium 加入 Cursor 数据后编程能力有望大幅提升,做 AI 编程或需要强推理模型的开发者可以关注发布进度,值得提前了解。原文稍后读已读值得跟进有用关注 Grok
11:52IT之家(博客/媒体)精选76°面壁智能联合清华大学、OpenBMB开源社区发布BitCPM-CANN,这是中国首个完全基于华为昇腾算力平台实现端到端训练并开源的三值(1.58-bit)大模型。该模型包含0.5B、1B、3B、8B四个尺寸,在推理阶段相比传统BF16精度释放约6倍显存红利,模型能力保留率维持在90%-97.2%。这意味着8B参数模型可轻松运行在当前主流旗舰手机上。面壁智能还基于MindSpeed×Megatron-LM搭建了完整的低比特训练底座,为后续昇腾上的低比特训练提供公共基础设施。全系列模型权重已在HuggingFace和ModelScope开源。AI模型端侧大模型低比特量化华为昇腾推荐理由:国产算力终于跑通端侧大模型全链路——6倍显存红利让8B模型直接上手机,做端侧AI部署或国产芯片适配的团队值得一试。原文稍后读已读值得跟进有用关注 端侧大模型
11:47美团技术团队@美团技术团队美团开源了 LongCat-Video-Avatar 1.5,这是一款从 SOTA 迈向商业级应用的数字人视频模型。它在唇形同步、物理合理性、长视频稳定性、多人互动和高效推理上实现了全面提升,能稳定输出高质量内容。该模型解决了数字人视频在复杂商业场景中不自然、不稳定、成本高的问题,让数字人从实验室走向真实应用。开源版本可供开发者直接使用,推动数字人视频生成技术的普及。AI模型数字人视频生成开源/仓库推荐理由:做数字人视频生成或虚拟主播的团队,终于有了一个能直接商用的开源模型——唇形同步和长视频稳定性提升明显,建议试试 LongCat 1.5 来降低制作成本。原文稍后读已读值得跟进有用关注 数字人