小红书悄然开源自研大模型:内容平台构建自身基础
小红书发布自研大模型dots3-note,MoE模型,总参数280B,激活参数16B,512K上下文,支持文本、视觉和语音理解。以Apache 2.0协议在Hugging Face和GitHub上开源,华为Ascend零延迟适配,标志着月活跃用户超3亿的平台上,AI从功能转变为基础。
小红书发布自研大模型dots3-note,MoE模型,总参数280B,激活参数16B,512K上下文,支持文本、视觉和语音理解。以Apache 2.0协议在Hugging Face和GitHub上开源,华为Ascend零延迟适配,标志着月活跃用户超3亿的平台上,AI从功能转变为基础。
Alibaba's Qwen-UI-Agent, a GUI agent foundation model for various devices, achieves high accuracy in screen reading and interaction. It scores 82.1% on MobileWorld, 79.5% on OSWorld-Verified, and leads in WebArena. It also ensures security by not prompting for confirmation on sensitive actions like payments.
Amazon Bedrock实现查询感知上下文压缩,通过在主模型回答前过滤检索到的片段,减少输入令牌和成本,同时保持答案质量。
T-Rex 是一种全新的机器人触觉探索方法,通过将触觉视为模型的第一公民,结合视觉和触觉专家进行实时运动规划与修正。同时,开源了最大的触觉数据集,并提供了训练方法。NVIDIA 和加州大学伯克利分校合作开发。
Deepseek发布新模型Deepseek V4 Flash Vision EXP,多模态能力逼近Opus 4.8,文本能力与Deepseek V4 Flash相同,价格一致。DeepSeek Harness 0.1.1支持新模型。
Anthropic 将其最擅长网络的模型 Claude Mythos 5 引入 Claude Security 产品,供企业团队使用。扫描连接到 GitHub 仓库,追踪数据流,并返回带有 CWE 类别、置信度和严重性评分以及建议补丁的结果。设计理念是包装:用户收到扫描结果而不是提示框,因此发现漏洞的模型不会引导编写漏洞利用代码。
OpenAI开源Codex Harness,开发者可将其嵌入产品,提高效率;Codex Harness是AI Agent的执行系统,支持CLI工具、SDK和app-server;OpenAI提供三大开源组件,助力开发者集成 Harness;Codex Harness已在税务申报和云控制平台等领域得到应用。
Agentic数据操作平台(ADOP)基于Amazon Bedrock,利用专用AI智能体自动化青铜到白银再到黄金的数据管道生命周期,将新数据源接入时间从数周缩短至数小时,同时保持数据治理和合规控制。
Amazon Bedrock AgentCore Gateway提供了一种无需基础设施整合的方式来治理AI代理对企业工具的访问。文章介绍了四个成熟度模型(连接、控制、目录和强化),用于构建受治理的工具网关,仅在真正的治理痛点出现时才进行升级。
DeepSeek Harness支持新模型,同时推出免费文件API,支持图片ID引用免重复上传。
Nvidia以60亿美元收购初创公司Poolside的AI模型构建软件,并计划吸纳109名员工。
GPT-5.6 Sol自7月初推出以来,OpenAI本季度收入增长35%,企业收入增长超过50%。Ramp数据显示,OpenAI首次在商业API支出方面超越Anthropic,此前Anthropic曾超越OpenAI的季度收入。
OpenRouter,一个为模型实验室提供预测性容量和分布服务的双边模型市场平台,被Stripe收购。自成立以来,OpenRouter实现了快速增长,其独特的排名页面成为多模型使用的首选数据源。创始人Alex Atallah、Chris Clark和Louis Vichy带领团队专注于产品,不炒作收入,无募集资金,仅专注于产品。
前OpenStack创始人Martin Casado表示,AI将资本从彩票变为自动售货机,通过RL环境或付费问答等方式,将资本转化为特定技能。AI是首个投入10美元即可可靠获得回报的技术。Cursor和OpenRouter的收购案例说明了战略价值与业务质量的关系。
OpenAI 对 Codex 使用限额差异进行调查,指出通过 sub2api 转售共享会触发风控,官方客户端及支持 ChatGPT 的第三方开源客户端不受影响。
This paper presents a study on non-invasive decoding of silent reading using EEG. It explores the extraction of lexical and semantic information from EEG signals during silent reading, using a convolutional EEG encoder and a causal transformer. The results show reliable decoding performance, with no sign of saturation in the data. The study also investigates the impact of electrode placement and control analyses separate word-level decoding from narrative context tracking.
本文提出了一种新的确定性算法,用于精确计算任何二维模型的学习系数,这些系数与多项式的Kullback-Leibler距离接触等价。该算法适用于多项式神经网络等模型,为采样估计器提供基准,并揭示了学习系数中的代数结构。
本文探讨AGI时代后的经济模式,企业拥有AI和机器人代理,成为能源、计算、维护和升级的生产和消费者。结果显示,需求闭环、瓶颈移除和GDP与人类福利的完全脱钩。在最大增长时,利率等于增长率,任何正的人类消费率都会使人类份额以相同速率指数衰减。结论是,在AGI经济中,就业政策过时,所有权政策至关重要。
法律AI系统日益用于回答法律问题,但现有基准假设查询完全指定。InsufficiencyBench是第一个针对查询不足的法律基准,评估模型是否识别查询缺乏法律相关信息,识别缺失内容,并避免过早结论。该基准包含八个典型缺失元素类别,涵盖三种结构故障模式,并构建了202个基准项目,涵盖六个法律领域和24个美国司法管辖区。评估了十个前沿模型,发现没有模型在缺失元素识别上超过F2 = 0.46,平均召回率为0.44。模型要么无差别地打掩护,要么在虚构的假设下沉默。没有模型既能识别和限定对不足查询的响应,又能直接针对完整查询。
本研究针对离散扩散语言模型的文本生成推理时间控制,旨在引导采样向序列级奖励发展,无需重新训练。通过嵌套蒙特卡洛方法解决现有粒子方法如best-of-n采样和bootstrap SMC的过度优化和权重退化问题。NSMC和FA-NSMC在毒性和流畅性引导任务上优于best-of-n和bootstrap SMC。
本教程探讨了AutoFigure,这是一个从文本描述和研究论文中直接生成专业科学图表的实用工具包。我们介绍了设置环境、配置API支持的生成工作流程,以及将复杂的文档智能管道转换为出版物风格的图表,包括自定义引用样式和画廊导出。
NVIDIA 深入解析堆栈组件,从引导智能体行为的组件到确保其安全边界的基础设施。阅读详细分析:nvda.ws/4zyvjHm
Thomas Ptacek提倡为即使是个人工具的最小版本也构建真正的原生用户界面,因为编码代理降低了获得可用GUI的成本。他分享了关于自己编写的带宽和GPU监控macOS任务栏应用程序的经验,并鼓励将CLI转换为原生应用,这可能会改变你的思维方式。
LangChain Academy introduces Tutors to teach LangChain concepts, quizzes, and feedback via coding agents. Customize teaching style. Visit academy.langchain.com or check out the LCA Tutors Repo on GitHub.
Fable 默认用 high 模式,主要承担编排和验收任务,具体执行交由 subagent,如 Opus 或 Sonnet。使用 Agent 工具派任务,提高效率。Fable max 消耗 token 较高,xhigh 节约 token。