Repo-To-Skill:将GitHub仓库提炼为AI技能
研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。
研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。
NVIDIA研究人员使用22,000道精选问题训练了Nemotron-3-Nano-CC和Ultra-CC模型。Nano-CC模型通过后训练从130分提升至291分,配合GenCorrect策略达到468分,超过IOI 2025金牌线438.3分。Ultra-CC模型在IOI 2026模拟中取得535.4分,超越人类最高分498.27分。
OpenAI于9月3日发布GPT-6 Astra,自称是"世界上最聪明、对齐最好的模型"。该模型主打电脑操作能力,在OSWorld 2.0任务完成速度比GPT-5.6 Sol快1.9倍,得分72.6%。网络安全能力达到Critical阈值,在ExploitBench上得分为100%,但普通用户使用受限。
GPT-6 Astra在FrontierMath Tier 4、ARC-AGI 3和TerminalBench-4.0基准测试中达到最先进水平。该模型在科学发现领域取得重大进展,在Terminal-Bench Science 0.1和HealthBench Pro测试中也表现优异。GPT-6 Astra在数学推理、通用人工智能评估和特定领域科学任务中均展现出强大能力。
OpenAI发布GPT-6 Astra模型,在ARC-AGI 3测试中达到98.6%,远超5.6 Sol的7.8%。Exploit-Bench网络安全测试获得满分100%,FrontierMath Tier 4得分为97.6%,高于Fable 5.1的87.8%。DeepSWE v1.1测试得分为74.1%,优于Fable 5.1的67.4%。
Amazon Bedrock AgentCore推出两个参考实现:Kiro和Claude Code。Kiro可将SQL转换为ER图,Claude Code是多代理代码安全分析工具。这些工具实践了AI驱动开发周期的构建阶段。工程团队可利用这些工具将概念转化为可工作代码。
Perplexity 为 Mac 端 Hybrid Compute 开发了本地推理引擎 Lily,使用 Rust 运行时和自定义 Metal 内核,专为 Qwen3.6-35B-A3B 模型和 Apple Silicon 硬件深度定制。在 M5 Max 上,Lily 的 prefill 吞吐为 MLX-LM 的 1.23 倍,decode 为 1.35 倍。Lily 通过 GPU 路径匹配推理阶段、最小化数据搬运和动态选择内核等策略实现性能优化。
本文介绍如何将LangGraph客户支持代理分两阶段迁移至Amazon Bedrock AgentCore。第一阶段迁移至Runtime、Gateway和Memory组件。第二阶段采用Strands Agents的模型驱动规划,同时减少运维负担。
Cloudflare Managed Defense结合OpenAI Daybreak模型,利用生产流量和安全信号优先处理发现的问题。该系统能够在安全时准备边缘缓解措施,并提出代码补丁建议。通过结合WAF数据与Daybreak模型,帮助团队首先识别和修复最关键的安全威胁。
Playco使用GPT-6 Astra从一个灰盒基础构建了三个主题游戏原型。与上一代模型相比,他们报告手动修复减少了50%。GPT-6 Astra在游戏开发原型阶段展现出显著效率提升。Playco团队通过该技术加速了游戏设计迭代过程。
OpenAI推出Daybreak for Frontline Defenders计划,承诺投入10亿美元。该计划旨在扩展前沿网络AI技术的获取渠道。OpenAI将为关键服务提供AI训练和支持。
OpenAI首席科学家雅库布·帕乔基回应Astra模型不可监控争议,表示Astra计算图深度与GPT-4相差不超过两倍。OpenAI将为Astra部署额外思维链监控,加强监控仍是当前研究核心目标。深度循环技术可能导致研究人员更难解释模型的思维链推理过程。
Anthropic与Nvidia支持的云服务提供商Lambda达成350亿美元的云计算合作协议,以加强Claude基础设施。
Hugging Face宣布与NVIDIA达成12.93亿美元收购意向,旨在扩大开源AI规模。NVIDIA将支持Hugging Face平台保持开放、独立和计算无关,共同推动开源AI发展,目标是赋能一亿AI开发者拥有自己的智能。
英伟达宣布收购Huggingface,强化开放模型,促进AI创新与安全。NVIDIA将成为Huggingface及其社区的理想归宿。
研究人员提出Trace as State方法,将推理痕迹作为任务状态的文本代理放置在长上下文块之前。在DeepSeek V4 Pro Preview模型上,该方法在GraphWalks Parents任务上将准确率从初始的29.2%提升至81.8%,显著优于Trace Append方法的43.0%。GLM-5.2模型在该任务上实现了100%的准确率。该方法在三种模型和三种长上下文数据集的27种组合中,有26种表现优于对照方法。
该研究提出了一种行为融合模型,结合大语言模型和本体排序器进行罕见病诊断。在Phenopacket Store和RAMEDIS数据集上,融合方法将Phenomizer Recall@1分别提升7.86和20.18个百分点。当与DeepSeek-V4-Flash API结合时,融合模型将Recall@1从0.1657提升至0.2176,提升5.19个百分点,无需重新训练。90.8%的正确融合诊断保留了可检查的本体证据。
研究人员提出FUSE框架,通过知识(K)、防御(D)和危害(H)三个正交管道评估模型。该框架使用化学-生物(CB)模块评估了12个商业LLM,来自Claude、DeepSeek和GPT四个家族。研究发现模型间危险能力存在显著差异,知识相当的模型在拒绝韧性上表现不同,强防御模型在服从时仍可能生成有害内容。时间分析表明,新模型知识增强但防御仅部分改善,扩展和对齐进展未均匀转化为安全提升。
PARSER是一种新的残差稀疏化方法,用于压缩Mixture-of-Experts大模型。该方法通过引入输出重要性指标,将压缩目标从最小化独立矩阵误差转变为保留专家输出误差。在Qwen和DeepSeek模型上,PARSER将压缩后模型与未压缩模型的精度差距分别缩小1.41倍和1.44倍,同时实现相同的峰值内存减少。
该研究提出双层协调反射模型,将协调者与工作者的交互建模为双层协调博弈。研究分析了文本反思作为语义记忆状态上的随机运动,推导了有限时间上界,并证明了在特定条件下的下界。研究还引入了随机反思记忆上升(SRMA)算法,在500个SWE-bench实例上达到72.2%的解决率。
AWS博客介绍如何在Amazon ECS上部署LiteLLM网关,连接OpenAI模型到Amazon Bedrock。配置Codex通过网关的Responses API路由请求,支持范围身份、预算、速率限制和遥测功能。文章比较了直接IAM Identity Center访问和管理的Portkey部署方案。
Amazon Quick Automate 发布了构建生产级智能体自动化的最佳实践指南。该指南涵盖选择合适流程、设计专注型智能体、结合确定性步骤、引入人工审核环节以及建立评估和可观测性机制。这些实践旨在提升企业级自动化解决方案的可靠性和效率。
归藏支持旅行照片内容检索、排版,调用GPT-Image 2.0生成古建历史海报。中秋节国庆节将至,可尝试制作古建旅游海报。
@HeggieConnor 在 @unifygtm 提出规则,若代理运行在GPT上,评分者需使用不同模型家族,否则可能导致模式崩溃或代理的群体思维。视频不支持,点击链接查看。
LangChain推出免费课程LangSmith Essentials,时长少于60分钟。课程涵盖智能体开发的完整生命周期:构建、测试、部署和监控。该课程帮助组织实现智能体的安全、系统性交付。通过真实使用数据学习并快速迭代。