Cisco AI开源FAPO:流水线感知提示优化,步骤级失败归因与Claude Code编排
Cisco Foundation AI开源FAPO,由Claude Code驱动,自动优化多步骤LLM流水线。FAPO评估整个链条,在步骤级别归因失败原因,并提出提示、参数和链结构层面的变体。在18个模型-基准对比中,FAPO击败GEPA 15次。每个变体经独立审批评证后集成到优化循环中。
Cisco Foundation AI开源FAPO,由Claude Code驱动,自动优化多步骤LLM流水线。FAPO评估整个链条,在步骤级别归因失败原因,并提出提示、参数和链结构层面的变体。在18个模型-基准对比中,FAPO击败GEPA 15次。每个变体经独立审批评证后集成到优化循环中。
Anthropic在2月完成新模型Mythos的训练。Mythos悄然改变了整个研发节奏。过去5个月AI能力跃升部分源于Mythos。领先模型正帮助训练下一代模型,该循环已启动。
GLM-5.2 在图形设计能力上据称达到 Opus 级别,同时在长期运行任务中表现良好。其训练引入了反奖励破解模块,用于解决强化学习中常见的奖励破解问题,例如模型走捷径、变懒、意图偏差等。该模块有助于提升编码代理在长周期任务中的可靠性与效果。GLM-5.2 是一个开源开放权重模型。
AWS在纽约峰会上推出两项新服务。Continuum自动检测、优先处理和修复代码漏洞。Context从企业数据构建知识图谱,为AI代理提供业务上下文。这两项服务旨在解决AI代理编写代码速度快但常出错的问题。
博主透露华为乾崑智驾ADS 5即将推送,鸿蒙智行的几款旗舰车型将优先搭载。该智驾系统于4月23日正式发布,采用面向自动驾驶的AI智能体WEWA 2.0架构。云端引入Multi-Agent博弈技术与在线强化学习机制,车端应用安全风险场技术进行实时安全评估,并通过Driving Agent模块优化出行策略。华为智能汽车解决方案BU CEO靳玉志表示该智驾系统为自动驾驶而来。
特斯拉Cybercab工程车照片显示其侧视摄像头外壳内置喷淋清洗装置,可定点喷射清洗液清洁变道、盲区监测所需摄像头区域。FSD纯视觉方案依赖摄像头,镜头脏污会导致安全退出或靠边停车。Cybercab无方向盘,需全天候运营,该喷淋装置是必备硬件。现有AI4车型未配备侧喷淋,未来可能需要加装或升级AI4.5硬件。
GitHub与合作伙伴通过协作研究发现,基于LLM的上下文验证能显著提升秘密扫描告警质量。该方法将误报率降低75.76%,减少了安全团队处理大量无效告警的负担。研究结果表明,单纯增加告警数量并不能提高安全性,而智能验证才是关键。
极摩客预热全新旗舰 EVO-X3 4T 机皇版,定位第三代桌面 AI 超算中心。搭载锐龙 AI Max+395 旗舰处理器,NPU 算力达 126TOPS,可在本地运行最高 235B 参数大模型。配备 4TB 高速固态和 OCuLink 接口,支持外接英伟达 RTX 40/50 系显卡。该机也是 AMD CEO 苏姿丰签名同款机型,将于 6 月 22 日在京东首发。
John Jumper是AlphaFold项目的核心负责人,该模型改变了蛋白质结构预测领域。2024年,他因这一贡献获得诺贝尔化学奖。他在Google DeepMind工作了近9年,博士毕业仅6个月就被Demis Hassabis任命领导AlphaFold团队。现在他选择加入Anthropic,专注AI安全和大模型研究。Anthropic近期还吸引了多位OpenAI核心研究员。
台积电正全力研发面板级封装技术CoPoS,计划替代现有CoWoS工艺。CoPoS采用方形面板基材(最大750×620毫米),对比CoWoS圆形300毫米晶圆,材料利用率从不足70%提升至90%以上。单位面积生产成本可降低20%至30%。台积电已建成首条试验产线,CoPoS面板将于2027年试生产,2028年规模化量产,集成玻璃核心基板的完整工艺量产定在2030年后。英特尔、AMD等厂商也在推进类似方案。
Sam Altman在斯坦福大学演讲中为LLM缩放策略进行辩护,批评整整一代研究者因低估缩放能力而阻碍了AI发展。他引用OpenAI最近推翻一个数学猜想的案例作为证据,认为缩放已被证实有效。Altman的言论引发了对AI研究方向的重新讨论。
Anthropic 联合创始人 Jack Clark 表示 AI 进步仅靠规模扩展就能实现,但 Gary Marcus 引用该公司自己的 Claude Code 予以反驳,指出该工具使用了 50 万行符号代码、harnesses、符号工具和正则表达式。Marcus 认为专门化系统并非无用,规模扩展也非唯一路径。该争论涉及“bitter lesson”假说与实用工程系统的平衡。
Bessemer Venture Partners的最新调研显示,90%的技术/工程团队已将AI融入核心流程。具体数据:代码生成工具使用率92%,代码审查增强工具使用率79%,Agentic开发工具使用率60%。调研指出,团队间的真正差距不在于是否使用AI,而在于提速后能否维持代码质量和业务理解。
OpenAI 发布新论文《Beneficial RL》,研究对齐训练中好行为的泛化能力。实验发现,用RL在对话数据上训练模型诚实、认知谦逊、可纠正等特质后,在44个训练未见的评测上,模型欺骗、谄媚、有害建议等行为均下降。仅用健康领域数据训练,非健康领域也有效。对抗性提示和恶意微调更难使模型变坏,但正常指令仍可执行。
Unitree Robotics 通过激进成本控制实现盈利,其人形机器人售价远低于竞争对手。然而,在AI能力方面,相比 Tesla Optimus 和 Figure AI 等对手,Unitree 仍存在明显差距。公司计划在2026年前提升自主决策和感知能力,以保持竞争力。
Z.ai推出GLM-5.2开源模型,采用MIT开放权重。该模型支持1M上下文窗口,在Terminal-Bench 2.1基准上得分81.0,仅比Claude Opus 4.8低几分。Perplexity CEO此前指出,中国已拥有最强开源模型DeepSeek,且美国开发者正基于其构建应用。GLM-5.2的发布进一步表明开源AI竞赛已非理论。
OpenAI Codex 推出 Record & Replay 功能,允许用户通过录制一次操作来创建可复用的 AI Skill。录制阶段会捕获用户演示的步骤、隐性偏好和变量,Codex 自动分析并生成包含使用条件、输入参数、操作步骤和验证规则的 Skill。回放时,Codex 可根据当前环境工具(如 Computer Use、浏览器插件)适应性地执行,支持不同参数输入。功能遵循“演示即规格”设计哲学,并给出五条高质量录制原则,如短而完整、提前声明变量、及时停止等。相比传统 Plugin,Record & Replay 更适合个人快速技能化,成本低。
本教程使用 Crawlee for Python 搭建完整的网页爬取工作流。通过 BeautifulSoupCrawler、ParselCrawler 和 PlaywrightCrawler 分别爬取静态与动态内容,提取标题、元数据和产品字段。教程还演示如何构建链接图,并将数据导出为 JSON、CSV 以及 RAG 就绪的 JSONL 分块文件。最后附带 robots 处理与截图功能,从设置到 AI 输出一步到位。
Greg Eisenberg和Theo Tabah在60分钟对谈中提出AI Native组织的三层架构:人、Agent和上下文。人退守两端负责战略与评审,Agent需满足Clear Goal、Skills、Tools、Context四要素才能自治。上下文层通过Capture-Curate-Store-Execute-Experience五阶段循环构建护城河。两个Live Demo展示成效:提案微站系统为LCA带来数百万美元收入,10分钟产品闭环生成高保真原型。Skill Chain(技能链)串接多个技能形成剧本,是对抗幻觉的关键机制。
文章将传统软件工程实践迁移到 AI Agent 开发中,强调需求分析时需给 Agent 充足上下文并反复对齐,系统设计时用 plan 模式拆分里程碑。代码审查建议先让 Agent 审查格式和逻辑,但人需兜底业务逻辑。自动化测试包括单元测试、集成测试和端到端测试,需与 CI 集成自动运行。灰度发布和 CI/CD 机制(如 feature flag、自动回滚)可减少线上不稳定。线上修复目前更现实的是 AI 辅助定位、人确认后再提交,而非全自动闭环。
Codex现在允许用户直接命令将开发线程从本地笔记本handoff到远程服务器。这一过程会自动打包Git状态、未提交变更、分支和工作树。用户关闭笔记本后,远程服务器会继续运行该线程。之后用户可以命令将线程接回本地,环境恢复到离开时的状态。全程无需手动同步代码或处理冲突。