阿里Qwen团队发布Qwen3.8-Flash-Next:125B多模态MoE模型,预览Qwen4架构
阿里Qwen团队发布Qwen3.8-Flash-Next模型,包含125B参数,6B激活参数。模型采用Gated DeltaNet、Qwen Sparse Attention、Gated Residual、N-gram Embedding等架构,训练成本仅为Qwen3.7-Plus的1/9。预览了Qwen4架构。
阿里Qwen团队发布Qwen3.8-Flash-Next模型,包含125B参数,6B激活参数。模型采用Gated DeltaNet、Qwen Sparse Attention、Gated Residual、N-gram Embedding等架构,训练成本仅为Qwen3.7-Plus的1/9。预览了Qwen4架构。
Z.ai推出GLM-5.3-Flash,GLM-5系列首个原生多模态模型,320B总参数/18B激活MoE,1,048,576令牌上下文窗口,MIT授权Hugging Face权重,API定价0.15美元/输入和0.50美元/输出。在Terminal-Bench 2.1上得分84.3,在DeepSWE v1.1上得分63.4,使用混合KDA线性加NoPE稀疏MLA注意力减少注意力计算约3倍,KV缓存4.4倍于GLM-5.3。
IBM发布Granite 4.2,包含3B、8B和30B三种规模的开放推理语言模型,均采用Apache 2.0许可。每个模型都提供思考/低努力/非思考开关和原生工具调用。8B和30B模型经过代理强化学习模块训练,可在真实沙盒环境中编辑代码、驱动终端和运行网络搜索。30B模型在SWE-Bench Verified上获得57.00分,在Terminal-Bench 2.1上获得29.24分。
@vllm_project使Qwen3.8-Flash-Next从第一天起就在NVIDIA和AMD上运行,超稀疏多模态MoE模型,125B参数,6B活跃,262K本地,1M通过YaRN,额外51B N-gram表可卸载,Qwen Sparse Attention是新的引擎工作所在。
Qwen3.8-Flash 多模态 MoE 模型发布,参数达 125B,成本效率高,性能优异,支持 262K 原生上下文,即将通过 QwenCloud API 提供,价格为 0.16/1M 输入令牌和 0.47/1M 输出令牌。新架构 GDN + QSA 混合注意力,训练成本降低至 Qwen3.7-Plus 的 1/9,在编码和办公任务上表现突出。
OpenAI 发布自研芯片,16 个月设计完成,能效比全面超越英伟达 Blackwell,支持多种模型和工作负载。量产将于 2027 年开始,目标 100MW 部署规模。
Natera利用Amazon Bedrock AgentCore构建自动化语音代理,患者可通过自然对话预约移动抽血服务。文章涵盖双WebSocket桥接、事件驱动延迟掩码和渐进式信任认证,实现100%工具调用准确率和低于7秒的延迟。
SageMaker Python SDK v3 重构脚本模式,统一 ModelTrainer 和 ModelBuilder 类。文章通过两个示例展示如何使用 SourceCode 在运行时同步本地代码到容器中,无需重建 Docker 镜像。
GoogleAI发布Gemini 3.5 Transcribe,精准智能语音转文字模型,支持85+语言,自动过滤填充词,格式化语音,与屏幕上下文配对执行语音命令。视频展示其将混乱语音输入和本地文件转换为电子邮件草稿的功能。
OpenAI 为 ChatGPT Work 云端浏览器新增登录功能,支持在登录网站中执行任务。用户输入凭据后,信息直接发送至远程云浏览器,不被用于模型训练。登录会话会保留,后续任务无需重复登录。功能面向 ChatGPT Plus、Pro 和 Business 用户开放。
OpenAI 发布关于 Hugging Face 遭入侵事件的官方报告,详细还原事件经过,涉及多起网络安全入侵事件,并介绍为防止类似事件采取的新措施。报告披露了执行入侵的模型信息,强调涉事模型与即将推出的 Astra 模型属于同一模型家族,但并非同一模型。OpenAI 将加强对 AI 智能体“思维链”的监控,并推出新的工具快速终止存在安全风险的工作负载。
Linux创始人林纳斯·托瓦兹利用AI,通过24个调试补丁和18次内核启动,成功定位Intel Xe图形驱动中的内存破坏漏洞。AI在调试过程中承担了大量重复工作,包括添加调试代码和分析输出结果。
英特尔发布 18A-P 制程技术,频率提升 30%,用于 Diamond Rapids 和 Nova Lake 处理器。RibbonFET 晶体管和背面供电技术提升性能,功耗降低 18%。18A-P 针对不同电压区间优化,提升能效。Diamond Rapids 将率先采用 18A-P,最多配备 256 个核心。
高通执行副总裁马德嘉阐述6G战略,强调AI原生、通感一体、全域算力协同,预计2029年商用。马德嘉赞赏豆包手机,称其代表智能体AI设备趋势。高通详解计算连续体理念,强调HBC高带宽计算技术对算力架构的革新价值。
Anthropic将水印追踪技术应用于Claude模型,以符合欧盟AI法案等新法规。Claude使用Google的SynthID方法为文本生成水印,并嵌入C2PA元数据于图像。此举旨在不影响输出质量,但用户持怀疑态度。
近期研究将Mamba风格状态空间模型(SSMs)应用于视频异常检测,但现有方法仍依赖缓冲剪辑或窗口,缺乏对时间记忆与检测延迟关系的理论解释,仅通过GPU吞吐量而非目标边缘硬件来基准效率。我们引入了一种严格因果流异常检测器,其固定大小状态每帧更新时间为O(1),无前瞻和无剪辑缓冲。其时间核心是一个对角线性状态空间递归,具有输入和状态依赖的衰减门,通过在冻结视觉骨干上的因果下一嵌入预测进行自监督训练。我们推导出递归衰减频谱与检测延迟和可可靠捕获的最短异常之间的封闭形式关系,然后在UCSD Ped2和CUHK Avenue上进行实证验证。从学习到的基衰减(57到59帧)预测的收敛延迟界限远高于测量的检测延迟(1.6和18.4帧),表明事件边界门而不是基衰减控制响应速度。我们进一步报告了在Apple M3 Pro硬件上直接测量的端到端延迟和吞吐量,每帧0.74毫秒和0.77毫秒(超过1300 FPS),而不是模拟的GPU数字。未经调整的初始配置下,该方法在Ped2和Avenue上达到67.9%和70.2%的帧级AUC,略低于先前非因果SSM基线。在衰减率、状态大小和门控上的消融实验表明,门控贡献与数据集大小相关,在较小的Ped2训练集上损害准确性,但在较大的Avenue集上有所帮助。缩小准确性差距并将评估扩展到第三个更大的基准是下一步的紧急任务。
研究提出医疗思维链扰动审计方法,对14个LLM在四个医疗问答基准上的测试显示,72.9%的编辑不影响答案,链式腐败不影响准确性,去除CoT提示不降低准确性。临床医生重新标注197个扰动问题,98.5%保持原答案。框架和CDR提供评估医疗思维链是否忠实或仅是文档的标准。
Recuris,一种用于长时程智能体驱动的递归经验-工作记忆架构,通过工作记忆跟踪任务进度并指导技能选择,提高GPT-5.6 Sol和Claude Opus 5在tau-bench和Qwen3.6-27B/35B上的任务成功率,最多提升16.6/13.5点,并减少长时程失败率至80%以下。
CAFE框架通过共享参数模型交替搜索代理和评论员角色,实现在线和离线优化。在七个代理搜索基准上,CAFE平均优于评估的基于RL的搜索代理,并在所有六个域外基准上保持其优势,同时减少了答案级别的幻觉。
StepGuard 是一种级联防护模型,可审计代理轨迹并检查执行前的工具操作。使用 StepGen 生成安全和不安全的轨迹进行训练,Balance-GRPO 动态平衡安全与不安全操作的学习。实验表明,StepGuard 在开放权重防护模型中实现最高平均准确率,与 GPT-5.4 性能相当。在 AgentDojo 和 AgentDyn 上使用 StepGuard,相对于无防护设置,平均攻击成功率降低 77.3%,而平均效用仅下降 2.8 个百分点。
AI通过PID进程级取证,结合项目规模、线程状态和源码,完成因果定位。推断链包括vmmap -summary 23870显示物理footprint约2.3GB,大头在MALLOC_SMALL,视频帧池非主因。Activity Monitor显示439个线程,源码验证波形代码生成16kHz单声道Vec<f32>,与实际内存峰值吻合。属于系统取证加源码验证,非单纯PID猜测。
本系列文章第一部分探讨了监督微调(SFT)数据准备的基础,包括质量检查、对话(JSONL)格式化、推理和工具调用模式以及代表性的训练/评估分割。
WebMCP 可构建更丰富的智能体体验;旧方式点击UI将消失,但仅暴露MCP/CLIs的视角短视;产品全功能通过工具调用列表无法展现;需要MCP、产品内智能体和通过MCP暴露的产品智能体三合一;复杂工作流程需要精心编排;大多数公司尚未解决编排问题。
Devin团队在其博客上分享了重建渲染器的过程。详情请访问Devin博客。
Agent Arena: Code 排行榜正式上线,查看最新代码竞赛成绩。📊 排行榜详情请访问 arena.ai/leaderboard/ag…