DeepSeek 直接把自家旗舰 V4 Pro 下线了,换成 V4.1 Flash,说明新模型确实更强,对开发者来说,用 V4.1 Flash 能省不少钱,尤其是处理长上下文和频繁调用的时候。
AI 多领域突破:混合专家抗过拟合、因果发现新基准、大模型输出压缩
2026年9月12日 AI 多领域取得突破性进展。混合专家模型抗过拟合研究发现,在重复数据训练中,通过强掩码正则化方法可让混合专家模型在64倍重复数据下超越密集模型,但无法完全匹配使用唯一数据训练的性能。因果发现新基准测试框架CausalArena发布,通过合成、语义和公式化数据集评估模型,实验显示不同基准下的模型排名显著变化,凸显基础模型时代评估因果发现能力的挑战。大语言模型输出压缩新方法LOCUS在Pythia-2.8B上使输出长度减少高达39.84%,在Qwen2.5-3B上减少14.87%到17.58%,仅更新不到0.3%的参数。此外,RetroThinker框架提升语音大语言模型推理能力,3D点散射方法实现毫米波雷达新视角合成,多模态饮食上下文对CGM预测有显著影响,AI代理系统实现跨任务自主控制等研究也取得进展。
模型发布/更新
5 篇产品发布/更新
5 篇OpenAI 的这个技术升级很棒,他们把一个 Python 库变成了能服务 10 亿用户的大平台,每秒处理 2200 万次请求,技术细节很值得看看。
阿里 Qoder 推出 Mobile Use 插件,能让代码修改在安卓、鸿蒙和 iOS 设备上运行并交互,验证修改是否生效,解决了移动端 App 开发中构建和验证的问题。
行业动态
5 篇蚂蚁集团CEO韩歆毅说,智能体商业的“ChatGPT”时刻已经到来,关键变化是智能体从“能力展示”走向“真实交易”,用户开始把真实生活需求交给智能体处理。
英伟达CEO黄仁勋说,网络安全是AI下一个重要市场,还驳斥了AI恐慌论,说网络安全厂商有动机把威胁描述得极其严重,从而让客户“排队购买”
A16z 的两位专家和 Accolade Partners 的 Aram Verdiyan 聊了聊,为什么现在 AI 公司要花那么多钱在算力上,这能帮你理解行业竞争格局。
美国 ARPA-H 启动了 6300 万美元的心血管 AI 计划,和 FDA 合作搞新监管框架,这事儿挺有意思。
论文研究
5 篇技巧与观点
3 篇IBM研究说,给AI代理加更多内存不一定更好,反而可能让无关历史干扰当前任务。他们发现不同模型对记忆的需求不同,比如gpt-oss-120b模型用精选检索比用完整指南集效果更好,还少用很多令牌。如果你在开发需要持久记忆的代理,这个研究方法值得参考。