CABLE:通过互补前导链接扩展记忆检索范围
CABLE是一种插件式内存增强方法,专为解决LLM代理长期记忆中的证据可达性问题。该方法在LoCoMo和MA-LongMemEval基准测试中使用Qwen3.5-27B、DeepSeek-chat和GPT-4o-mini进行评估。CABLE通过构建稀疏的推理相关关联,而非重复主机检索器已覆盖的内容,显著提升了跨记忆和会话的证据检索能力。在开放域、多会话和偏好导向问题类别中,CABLE实现了最大的性能提升。
CABLE是一种插件式内存增强方法,专为解决LLM代理长期记忆中的证据可达性问题。该方法在LoCoMo和MA-LongMemEval基准测试中使用Qwen3.5-27B、DeepSeek-chat和GPT-4o-mini进行评估。CABLE通过构建稀疏的推理相关关联,而非重复主机检索器已覆盖的内容,显著提升了跨记忆和会话的证据检索能力。在开放域、多会话和偏好导向问题类别中,CABLE实现了最大的性能提升。
Claude模型在蛋白质设计任务中表现出色,成功从零开始设计出针对14个目标的蛋白质结合物。这一过程仅需人类专家编写提示词,Claude便能自主完成设计工作。随后,Adaptyv Bio和Twist Bioscience公司独立验证了Claude设计的蛋白质功能。
亚马逊Bedrock的AgentCore在AWS无服务器管道中采用异步调用模式,该模式包含任务令牌回调、直接服务集成、无服务器函数三种形式,使用后可降低AI代理处理请求时的闲置计算成本,借助AWS Step Functions实现高效调用
智谱推出的GLM-5.3模型,以GLM-5.2为底座进行后训练,编码能力较之前提升了50%;该模型为约743B参数的MoE架构,通过后训练优化后性能表现更优;与GLM-5.2版本对比,后训练方式让模型编码能力提升明显。
Asana 使用 OpenAI 的 Codex 模型,仅两周完成从前端测试框架 Enzyme 到 React Testing Library 的迁移。原本预计该迁移需耗时五年,实际仅花费两星期。通过使用 Codex,Asana 高效完成了复杂的前端测试框架切换任务。
Fanatics Betting and Gaming利用AWS构建多代理客服系统,应对体育博彩各州特定规则;该系统支持实时负责任博彩功能,提升客户服务效率;面对大型赛事期间流量高峰,系统能高效处理复杂问题。
Cloudflare团队重新评估了2024 - 2025年针对其Workers基础设施的远程Spectre攻击,发现新攻击基础如Spectre gadget与远程计时器等技术,同时新防御进一步加固Cloudflare Workers。
RadixArk公司发布了Miles v0.1,这是一个开源的强化学习框架,专门用于训练LLM和多模态模型。该框架已在过去9个月内有72名贡献者提交了1,326次代码提交,并进行了85个GPU端到端CI测试。Miles已在Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2等前沿开源模型上进行了实战测试。目前已有包括humansand、periodiclabs等多家公司在NVIDIA和AMD硬件上使用Miles进行前沿模型开发和生产强化学习工作负载。
GoogleAIStudio现支持导入GitHub仓库并实现代码双向同步,新增UI支持强制推送与合并等操作,双向推送/拉取功能开发周期长如今正式上线
Cerebras推出新一代芯片WSE-3 Turbo和基于该芯片的CS-4系统,与上代CS-3相比带来10倍词元容量和2倍速度。WSE-3 Turbo集成90万个核心和44GB SRAM片上缓存,其FP16稀疏AI算力、内存带宽、片上互联带宽、I/O带宽均实现翻倍。CS-4系统在OpenAI GPT-OSS模型上拥有4465 Token/s的词元交付速度,是GPU方案的30倍,较CS-3提升93%。对于超高参数模型,CS-4的2μs低延迟晶圆间互连能在10T规模上实现超1000 Token/s的词元输出。
Anthropic发布了最新技术报告,详细介绍了其AI系统的设计原理。该公司同时开源了提示词和数据集,位于Hugging Face平台。技术报告可在Anthropic官网获取,包含系统架构和训练方法细节。
Gary Marcus指出OpenAI已将20%的研究推理计算用于思维链监控,表明对齐问题日益严重。他认为以LLM为中心的架构未能实现对齐,需要投资更多替代方案。Marcus强调这一关键点可能对人类产生深远影响,但几乎无人关注。
Chamath预测未来36个月内,企业将普遍采用8090 Software Factory、Palantir和Hermes等独立控制层。这些控制层允许企业随时替换底层AI模型,而不影响业务流程。企业更关注防止数据与IP泄露,保留对判断和知识的完整主权,而非单纯比较模型价格。
第11届世界机器人大会于8月19日在北京E-Town举办,共展出超300家展商、150余款新品,并设有采购日;广东派出34家涵盖机器人全供应链的企业参展,包含伊维能源电池、奥比中光三维视觉等企业,与49家中央国企共同亮相,呈现12类应用
根据泄露的 SemiAnalysis 报告,谷歌正与 AMD 合作开发第十代 TPU 项目。这可能是 AMD 首个定制 AI ASIC 项目,谷歌希望利用 AMD 的先进封装与 SoC IP 阵容。谷歌正开发单一封装内同时集成 TPU 和 CPU 的 SoC,以应对强化学习工作负载需求。谷歌的 AI ASIC 合作伙伴已包括博通、联发科等公司,此次合作进一步扩展了其芯片设计生态。
研究使用AI-Infra-Guard工具对DeepSeek Harness进行间接提示注入安全评估。实验覆盖16个间接内容通道、35个负载目标和12种攻击方法,共执行14,560次受控测试。评估采用RuleJudge和LLMJudge两种判断方法,发现文本模式下假完成攻击成功率最高达17.0%,文件模式下隐藏Unicode攻击成功率高达25.5%。研究分析了DSH工具结果处理机制,确定了应在不受信任内容和敏感操作间设置的控制措施。
论文提出Bounded-State Restoration(BSR)方法,分离完整发现与本地驻留。在DeepSeek-V4-Flash模型测试中,外部状态达31.277 GiB/rank时,L1 RWS仅保持500.75 MiB/rank,实现63.959倍的外部到实时暂存比例。BSR通过最多W个块的窗口安装确认状态,在辅助状态有界的情况下,恢复容量为O(W)。SSD优化将512K恢复TTFT从43.1降至17.6秒,不改变RWS大小。
研究人员提出能力驱动的数据基础设施,构建了440M图像的T2I语料库和120M编辑对。该框架包含三个专门数据引擎,为文本-图像接地、图像间转换和图像-知识关联提供监督。基于此,团队训练了3B和6B两种规模的多模态扩散模型,在CPI-Bench评估中展现广泛视觉覆盖和多功能渲染能力。
研究对三个前沿专家混合模型(阿里巴巴、OpenAI、NVIDIA,3.6-4.0B参数)进行微调,使其在低资源语言中推理。准确率基准显示几乎无变化,基准本身存在噪声(随机种子变动导致分数变化7.7点)。基础模型从不使用希腊语思考(0/1000推理轨迹),而SFT后98%的推理使用问题语言,且四个模型的语法判断均有提升。SFT无法修复自身缺陷,但强化学习可显著改善格式跳过和答案泄漏问题。
研究提出了一种基于流动匹配的模型,通过势诱导速度产生显式标量能量,其梯度恰好是转换后的学习评分函数。该方法在PDE场生成任务中实现了能量校正的数据生成,相比传统流动ODE基线,降低了PDE残差和谱距离。论文展示了能量函数可作为分布外(OOD)检测的评分工具,通过结合数据能量和基于物理的能量提高检测准确率。在逆问题应用中,研究将能量与二次观测似然组合形成后验能量,作为推理时明确选择的家族目标。
StagedWorkspace是为知识工作智能体设计的版本化工作空间,解决了智能体在处理代码、文档等数字工件时的版本管理问题。在OfficeQA Pro和APEX-Agents基准测试中,双解析/原生访问方式将OfficeQA Pass@1提高了8.3-12.1分,APEX平均评分提高了4.7-9.2分。SW-AGENT在Gemini 3.1 Pro上获得63.9%的OfficeQA分数,在GPT-5.4 Nano上获得42.1的APEX分数,显著高于同模型的已发布分数。
使用Claude进行轻量修改后的转录表明,在某些情况下,代码行数可作为AI辅助软件开发效率的参考指标,源自约35分钟的对话节选内容;若代码质量(如经过调试且可维护的生产级代码)维持一致,产出一千行此类代码对生产力提升极具价值;但要达成此效果,需大量工程经验和专业知识,这是资深工程师的核心特质;此外,团队协作仍具必要性——新的制约因素是认知容量,单人难以驾驭百倍于前的代码规模。
医疗场景里,若成员提自伤或急性情况,代码绕过模型直拨911,模型没看到过程;用LLM模拟患者后,真实患者觉得更像真人,这是四组盲测得出的结论;每天处理10000次通话时,1%错误率会让每日出现100次错误安排;Clinicians能识别虚假数据的概率达60%,且ECRI将AI聊天滥用列为2026年医疗技术第一大隐患。
拥有170万粉丝的AI创作者@rileybrown公开了其Codex工作流,通过Supadata API一秒获取YouTube视频文字稿,30秒完成整个频道竞品研究。他使用Remotion插件生成动画图形,Excalidraw图表skill将10分钟口述转化为9页图表,并通过AI换脸技术制作缩略图。工作流强调以结果为导向迭代Skills,组合串联不同功能,每周产出4条长视频和5条短视频。
@TheRealSergio91 指出编码代理标准中,agents.md作为markdown文件用于定义技能和功能。skills 以markdown目录形式组织工具、记忆等内容。这种实现方式让编码代理更像目录指令而非传统应用程序。