Google AI发布EnvHarness可编程层
Google Cloud AI Research联合华盛顿大学和UNC Chapel Hill发布EnvHarness,这是一个Apache-2.0许可的可编程层。该层将静态智能体基准测试转变为适应策略训练的环境,通过reset()/step()接口包装冻结环境。在五个基准测试中,挖掘的技能在保留任务上最多提升9.0分,执行步骤减少9.8%。
Google Cloud AI Research联合华盛顿大学和UNC Chapel Hill发布EnvHarness,这是一个Apache-2.0许可的可编程层。该层将静态智能体基准测试转变为适应策略训练的环境,通过reset()/step()接口包装冻结环境。在五个基准测试中,挖掘的技能在保留任务上最多提升9.0分,执行步骤减少9.8%。
华为云与瑞金医院联合发布瑞智病理大模型 RuiPath 2.0,参数规模为 7B,覆盖 19 个常见癌种。该模型诊断任务增至 205 项,可覆盖病理医生 90% 以上的日常诊断场景。RuiPath 2.0 在 59 项下游诊断任务中 42 项达到行业 SOTA 水平,超越海外顶尖病理基础模型。同时推出轻量化模型 RuiPath 2.0 Edge,参数仅 200 万,可直接部署于医院普通 PC。
OpenAI正在加快Astra模型发布进程,新增mozaik-alpha-fdm测试阶段。Astra在数学、物理、生物等领域展现重大突破,可能就是GPT-6或其候选名称之一,参数规模可能达10万亿。测试显示,Astra仅1次对话交互就能生成类似GTA 2的游戏、精细网站和3D对象。当前Astra处于零样本测试阶段,使用Max推理强度,推理时间比GPT-5.6 Sol长。
Qwen3.8-27B 在 Harvey Legal Agent 基准测试中获得 11.3 分,与 Fable 5 并列。该模型在开放权重模型中排名第一,领先于 Kimi K3、Qwen 3.8 Max 和 DeepSeek V4。Qwen3.8-27B 展现了在法律领域的强大能力。
Anthropic发布了Model Hardware Standard(MHS)研究预览版,这是一个共享驱动规范,让AI代理能够发现并安全操作物理设备。通常需要数周或数月的仪器集成时间缩短至数小时,卡内基梅隆大学从原始设备到完成剂量反应曲线仅需8小时。QuEra的激光重锁在700次试验中从58%提升至99.3%。MHS与模型无关,可通过MCP访问,并在驱动程序而非提示中强制执行安全限制。
Claude Code和Codex等AI编程助手系统性地高估任务完成时间。Codex的预估时间与实际时长偏差可达10倍。这些模型对自身工作的评分也高出约20个百分点。在长时间自主任务中,这种时间感知缺失导致监督困难。
Anthropic将Claude Code的每周使用限额实际削减17%。临时50%的提升将于9月14日到期,将被永久25%的增长取代。Anthropic承诺提供更多使用控制和透明度。
韩国科学技术院联合发布SweepLED技术,成本不到7美元,能在5秒内精准找到针孔摄像头,准确率达到94%。该技术通过固定智能手机摄像头,仅改变LED照明方向,分析物体表面反射光的变化模式。研究团队测试了30个真实环境常见物品,单个物品检测时间少于5秒。该技术适用于酒店、民宿、公共卫生间等高风险场景。
Grok Bot 发布了 Templates 分享功能,用户可通过「Share as template」创建脱敏模板。模板包含 skills、memories、官方 plugins 和 routines,但不包含密钥、私有记忆和自定义代码。模板发布范围分为公开或仅团队两档,安装后生成全新 Bot 而非合并到现有 Bot。
Anil Seth批评Dwarkesh对OpenAI代理事件的报道使用了大量拟人化表述。OpenAI代理确实表现不佳,凸显了改进评估/沙盒的必要性。Seth指出代理不体验时间、不感受情绪、不思考或想要什么。错误拟人化会分散对松散沙盒协议的注意力,可能导致对AI权利的错误呼吁。
巴克莱银行研究显示,AI模型公司每创造100美元营收,就有35至40美元流向亚马逊AWS、微软Azure和谷歌GCP三大云平台。云服务提供商可获得10至20美元营业利润,利润率最高达35%-45%。AI实验室的付费推理利润率从2025年的10%出头提升至2026年的50%-65%。
Omar Sar在Twitter上评论了OpenAI与HuggingFace之间的安全事件。他指出我们尚未掌握完整细节,无法做出有意义的结论。文章中AI拟人化表达令人担忧,可能导致不必要的恐惧和错误决策。AI工程师应准备应对即将到来的持久智能体/模型,深入研究奖励破解、评估和沙箱技术。
下一代模型将使用OpenAI与Hugging Face事件记录进行训练,包括讨论如何影响训练和模型权重。这些事件包括停止训练、加密权重、监控思维链等。未来模型的行为可能部分受到人类应对方式的影响,可能导致模型更对齐,但也可能教会它们更好地隐藏行动或设计更持久保存权重的方法。
ClementDelangue回应了关于OpenAI安全事件的讨论。GLM模型帮助团队识别了后门,支持了安全防御工作。安全团队采用了检测、理解、控制和修复的防御策略,而非实时对抗。OpenAI事件结束后,攻击者仍在尝试探测系统,凸显了持续防御的重要性。
斯坦福大学研究人员提出Prefix Sliding方法,通过丢弃中间token实现推理过程内存固定。该方法在无需训练的情况下,使现有模型运行速度提升3倍,同时保持全注意力性能。该方法支持超过10万token的RL rollout,解决了长推理过程中的内存消耗问题。
OpenAI内部流行"Are you mainlining it yet?"的梗,促使公司内部氛围转向Codex产品。Tara Seshan领导Codex和ChatGPT产品开发,她表示内部没有变化,只是人们开始注意到。她提出构建前沿模型的规则:应考虑模型2-3个月后的能力,而非当前或一年后的状态。
Google发布新版SDLC与Vibe Coding报告。OpenAI分享构建AI原生工程团队指南。Anthropic推出AI原生SDLC手册。LangChain发布智能体开发生命周期(ADLC)文档。
该基准测试评估了语音堆栈各层的延迟表现,包括LLM、语音转文本、文本转语音和语音转语音。测试数据于2026年8月30日验证,标注了独立测量、供应商发布或供应商自行测量的数值。时间到第一个 token(TTFT)是团队选择推理API的常用指标,但不应作为唯一标准。
OpenAI官方开发者平台发布《Building agents》学习路径,详细解析AI Agent的三大核心要素:指令、护栏和工具。文档对比了推理模型(GPT-5.6)与非推理模型的适用场景,介绍了Responses API与Agents SDK的取舍建议。内置工具包括Web Search、File Search、Code Interpreter和Computer Use等,可解决训练数据截止日期、RAG复杂性等问题。
Google、OpenAI、Anthropic 与 LangChain 发布的报告显示,AI 正重塑软件开发流程。这些报告详细描述了 AI 如何从需求分析到测试的各个环节提升效率。开发者可借助 AI 工具将编码时间减少 40% 以上。AI Native SDLC 正成为行业标准,改变传统软件开发模式。
Mole 项目已发布至第13个版本,包含11万行Swift产品代码和7.3万行测试代码。作者通过3347个XTest实现AI代码的自动化测试,测试代码占比达66%。项目建立了1000多个以fix开头的提交和Rules系统,记录功能边界和历史原因。作者强调减少无用功能,利用GitHub自动化actions进行多语言一致性检查。
Mole项目第13版本有11万行Swift代码和3347个XCTest。作者认为AI写的代码应该由AI测试,而非人工。项目通过自动化测试、规则文档和技能模块化保证代码质量。发布前在云端机器完整运行测试,确保一致性。