Reflection AI 放出了首个开源模型 Beam,501B 只激活 23B,官方说打平 GLM-5.2 还省 3-4 倍算力,做编程和智能体的可以关注权重发布。
Uber 用 MCP 网关盘活数千内部 API,智能体基建成今日主线
2026年10月6日:今日最大新闻是 Uber 开源其 MCP 网关工程实践——用控制平面+数据平面把全公司数千个存量 API 自动转成 MCP 工具,已托管 800+ MCP 服务器、5000+ 工具,AI 智能体零改动即可调用,代表智能体基础设施正加速企业落地。第二条主线是 AI for Science 突破:ImmuneAgent 闭环系统从人 B 细胞库中发现广谱中和抗体,110 个候选中 60 个有效,5 个抗体在小鼠流感模型中提供 100% 保护,媲美临床疗法。第三条主线是训练与推理效率:Hugging Face 把 Claude Code、Codex 等 10 个编程 harness 直接变成 RL 训练环境;iS-KV 在 DeepSeek-R1-Distill-Llama-8B 上以 4.06 倍 KV 压缩保住 82.6% 准确率;LESSER 用输出层梯度把后训练数据选择成本最多降低 9.7 倍。整体看,智能体从工具调用到训练环境的全栈正在快速成型。
模型发布/更新
5 篇Hugging Face 把 Claude Code、Codex 这些真实编程工具直接当 RL 训练环境用,不用改一行代码,LFM2.5-2.6B 训练后 OpenCode 成绩从 34% 涨到 58%,全套开源可复现。
MIT开源的JAZ只用一个invoke函数就干了记忆库和优化管道的活,成本不到Letta一半,成绩还更高,做Agent的可以看看源码。
NVIDIA把PixelUMM开源了,一个模型搞定图文视频的理解和生成,做法是不用视觉编码器直接吃像素块,搞多模态研究的可以看看源码。
产品发布/更新
4 篇有人真金白银测了九家订阅到底谁划算,200 美元档 Claude 给的 Token 多得多,正在选编程套餐的可以看看再掏钱。
Uber 把公司几千个 API 全自动变成 MCP 工具给 AI Agent 用,零代码接入、默认禁用加审核,还有三招防上下文爆掉,做 Agent 基建的都该看看。
有人在单张 RTX 5090 上跑 Qwen3-Omni,用 AWQ-4bit 把首音频延迟从 213ms 压到 23ms,本地语音对话流畅度差了近十倍。
行业动态
4 篇Gary Marcus 拿数据泼冷水:只有 3% 美国家庭付费用 AI,9% GDP 的投资逻辑靠企业买单撑着,数据很扎实,适合冷静看看。
OpenAI 在欧盟给 ChatGPT 文本加了隐形水印,检测率最高 95%,但换掉四分之一词就降到 17%,API 用户还能直接关掉。
论文研究
3 篇一个把 AI 推理和湿实验闭环起来的抗体发现系统,110 个候选里 60 个真中和,还顺带找到了 bnAb 的细胞来源,免疫学背景的读者别错过。
技巧与观点
5 篇AWS 官方教程,教你用 LangChain 搭 Bedrock 的智能体检索,还能看 trace 排查每步检索、对比两种路径的成本。
AWS 出的实操教程,教你怎么用 Bedrock AgentCore 评估多智能体系统,供应链场景例子很完整,做 Agent 工程的可以照着搭。
斯坦福 138 页 LLM 讲义免费公开,从缩放定律讲到 RoPE 和 GQA,想系统补基础的直接看这份。
用 Claude Code 的可以试试,这个开源项目让你直接调用 Codex 那套电脑操控能力,写段 JS 就能点鼠标敲键盘,不用再切换工具。
Milvus 官方把 HNSW 的三种量化方案讲清楚了:SQ8/SQ6、PQ、PRQ 各自怎么压缩、省内存多少、代价是什么,做向量检索选型前很值得看。