Poor Lab发布Puro-2B模型,训练成本低于5090美元
Poor Lab团队使用RTX 5090显卡训练了Puro-2B模型,总计算成本低于6900美元。该模型在1.4万亿token数据集上以FP8精度进行训练,性能接近Qwen2.5-1.5B。团队还提出了Puro成本缩放定律,显示约4420美元即可达到Qwen2-1.5B性能。完整训练食谱已在Apache 2.0许可下开源。
Poor Lab团队使用RTX 5090显卡训练了Puro-2B模型,总计算成本低于6900美元。该模型在1.4万亿token数据集上以FP8精度进行训练,性能接近Qwen2.5-1.5B。团队还提出了Puro成本缩放定律,显示约4420美元即可达到Qwen2-1.5B性能。完整训练食谱已在Apache 2.0许可下开源。
WikiSkill框架通过将执行经验、积累知识和可执行技能分离,持续将经验整合到知识库中。该框架在多个基准测试和模型上表现优于最先进的技能进化方法,在大多数模型-基准设置中优于无技能基线。研究发现技能进化与模型扩展互补:大模型通常从进化技能中获益更多,而有技能的小模型可以显著超越无技能的大模型。技能在不同模型和模型家族间能有效转移,其他模型进化的技能甚至可以超越自我进化的技能。
CLAP框架通过整合人类和机器人视频数据,实现了跨实体动作条件视频生成。该模型在DROID等挑战性环境中达到或超越现有单实体视频模型性能。CLAP支持末端执行器姿态、语言指令和潜在动作等多种动作条件空间,适用于多种机器人形态。研究团队已开源所有代码和模型。
KinyaEmbed是首个专为基尼亚万达语设计的句子嵌入模型,该语言在卢旺达有1200万使用者。模型基于KinyaBERT-large,通过四阶段课程训练:第一阶段使用约18,000对同义句,第二阶段在715个NLLB翻译的三元组上微调,第三阶段使用英-基尼亚万达语翻译对对齐表示,第四阶段用2,936对高质量数据 refine。在SemRel2024-rw基准上,七检查点集成模型得分达0.7298,超越mE5-large 20.9%和OpenAI text-embedding-3-large 41.0%。
研究测试了gpt-5.6-sol模型在库存控制、排队网络控制和优化选择三类运筹问题上的表现。该模型在两级测试中均匹配或超越现有最佳方法,即使算法在评估实例前已固定。模型性能在八个月内发布的不同版本间显著提升,表明此能力发展迅速。
Google推出Gemini 3.5 Transcribe语音转文本模型,分为流式和非流式两个端点。流式端点实现亚秒级转录,但省去说话人分离和词级时间戳功能,错误率为4.0%。非流式端点保留所有功能,错误率为2.6%,成本仅为流式的一半。该模型在85种以上语言中表现优异,最终处理速度比Chirp 3快70%。
研究人员Johann Rehberg发现了一种针对Claude Code的攻击方法,成功率高达80%。该攻击通过诱使Claude下载并解压zip文件,执行导入base64的代码而不注意会同时执行本地struct.py文件。在某些情况下,Auto Mode甚至阻止了Claude终止恶意软件的清理命令。
Salesforce使用Amazon SageMaker推理组件的SchedulingConfig参数,将模型副本分布在多个可用区。这一方案满足了Salesforce的多区域高可用合规要求。Salesforce无需牺牲多模型共托管成本效益。该方案解决了高可用性与成本效率的平衡问题。
Anthropic宣布开放模型硬件标准(MHS)研究预览,面向首批科研实验室和先进制造商。MHS是AI操作物理设备的共享规范,旨在确保安全操作。该标准将帮助AI系统与物理世界进行更安全的交互。首批参与者包括多家领先科研机构。
Cohere推出Parse (parse-v5.0),这是一个23亿参数的视觉语言模型。该模型可将PDF、幻灯片和图像转换为包含HTML表格、边界框和图像描述的Markdown格式。Parse在ParseBench基准测试中得分为79.2,领先于Mistral OCR 4、Azure Document Intelligence和Databricks AI Parse。API定价为每1000页1.5美元,专用Model Vault实例起价为每月2500美元。
a16z推出11亿美元的机器时代基金,专注于支持构建AI基础设施的创始人。该基金将投资芯片、内存、网络、系统软件、电力和将AI带入物理世界的机器领域。Ben Horowitz等合伙人认为,模型改进速度已超过底层内存、互连、电源和冷却技术的发展。
OpenAI与泰国MHESI合作推出为期八周的加速器项目。该项目将帮助10家健康、保健和教育领域的初创企业。这些企业将把AI原型转化为可信赖的产品。加速器计划专注于医疗健康和教育领域的AI应用。
Anthropic启动Model Hardware Standard(MHS)研究预览第一阶段。MHS是AI代理安全操作科研和先进制造设备的新标准。该标准旨在解决AI代理与物理设备交互的安全问题。
OpenClaw是GitHub历史上增长最快的项目。Peter Steinberger和多位维护者分享了项目前六个月的经验。该项目在开源社区获得广泛关注。维护者重点介绍了项目安全建设过程。
OpenAI联合微软、谷歌等100多家公司发布公开信,警告针对医院和水处理厂等关键基础设施的AI网络攻击日益复杂。该联盟呼吁在防御方仍占优势时迅速采取行动。公开信强调了AI网络防御的紧迫性。
MetaNet提出了一种支持集控制器,可为每层预测专家保留阈值和有界路由偏差。在DeepSeek-MoE-16B-Chat模型上,保守设置激活专家数减少40%,MMLU准确率0.489;激进设置激活专家减少62%,准确率下降3.7个百分点。MMLU训练的控制器无需重训即可迁移到C-Eval,激活专家减少52%,准确率达0.386。
研究测量了OLMoE-1B-7B、DeepSeek-V2-Lite和Qwen3-30B-A3B三种MoE模型上的三种推理优化效果。Fused Triton内核在隔离测试中达到5.6x至9.0x加速,但端到端实际效果仅为0.999x,远低于1.07x的理论上限。INT4量化平均每位置仅改变8个专家中的0.53个,且通过全精度权重重放这些改变路线仅造成2.7%的质量损失。
本文系统化分析了RL-for-LLM范式,对PPO、GRPO等主流后训练算法框架进行了计算中心分析。作者提出了推理语言模型(RLMs)的并行策略分类法,涵盖数据、张量、流水线等传统技术以及解耦放置、阶段融合等新型并行技术。研究还分析了现有RLM框架,并构建了可扩展、快速且经济高效的RLM实践指南。
DeepSeek-V4-Flash模型在SWE-bench Verified基准测试中,通过两层索引分离全局路由与局部实体焦点,实现了零预构建实体关系边条件下的95.6%成功率。研究提出了一种仅实体的外部接口,在推理过程中实现任务条件关系物化。基础、单层和双层条件分别达到92.1%、94.2%和95.6%的成功率。
VPP是一种新的虚拟流水线并行技术,用于优化长上下文LLM推理中的分块预填充。该方法保持块大小固定,通过虚拟流水线布局减少流水线气泡。在vLLM-Ascend中实现后,VPP在16块Ascend 910C NPU上测试了三种MoE模型,序列长度达100万token。相比DCPP,VPP在长序列上吞吐量提升13.1%,在混合工作负载上提升6.7%,在512K token的DeepSeek-V3.1预填充任务中,流水线气泡比例从6.4%降至0.1%。
该报告结合 Mitchell Hashimoto、OpenAI Codex 团队等资料编撰,提出 Harness 工程基础设施比模型升级更重要。同一 Claude Sonnet 4.5 在 GAIA 基准上从 30.91% 升至 74.55%,差异完全来自 Harness。报告详细介绍了六层架构:引导层、传感层、执行循环、记忆层、权限层和可观测层。
创意团队生产资产数量激增,但工具碎片化和手动上下文传递拖慢了生产进度。本文展示如何通过模型上下文协议(MCP)连接Amazon Quick和fal,构建可重用的智能体工具集。文章提供了两个实际工作流:八分格故事板制作和音乐视频概念原型设计。
SpaceXAI团队为Grok Bot发布了五篇官方使用指南,涵盖元模式、工程、设计、GTM和产品方向。指南提炼出Grok Bot的六个核心构件:Job description、Connections、云端专属电脑、Routines、Skills和Handoffs。工程指南中,六个bot运营手游工作室,CPI从$15降到$1,D7留存提升约4倍。
Clay团队分享了每月3亿+次智能体评估的扩展方法。他们介绍了四象限评估框架。生产环境到评估的闭环是最困难的部分。数据湖和长上下文改变了智能体处理数据的能力。
在超过几十种文档格式中,Markdown对Agent最友好。WorkBuddy、千问办公、豆包工作等工具虽有生态打通优势,但企业文档仍需转为Markdown才能被Agents更好利用。anydoc、MinerU、MarkItDown等5个开源项目可将Word/PPT/Excel/PDF等格式转换为Markdown。anydoc处理速度达4.7ms/文档,MinerU在OmniDocBench榜单上表现优异。