07:05官方账号LangChain@LangChainAILangChain组织了一场关于评估工程(eval engineering)的直播,邀请Prime Intellect和Baseten的专家参与。直播讨论了如何将真实世界的轨迹数据转化为模型环境,以持续改进模型。内容涵盖将环境与评估作为智能体的训练数据、训练时机及人工介入程度等话题。技巧LangChainPrime IntellectBaseten推荐理由:想学怎么把业务数据变成训练环境?这场直播讲得挺实在,Prime Intellect和Baseten的人都在,适合搞智能体的朋友。原文稍后读已读值得跟进有用关注 LangChain
01:05官方账号LangChain@LangChainAI精选LangChain 将举办关于 Automating Eval & Environment Engineering 的线上小组讨论。演讲嘉宾包括 LangChain CEO Harrison Chase 和 Prime Intellect 的研究员 willccbb。会议将探讨如何利用 harness、tools 和 environments 等系统组件构建差异化优势。内容涉及 open models 和 model-harness co-design 对企业拥有自主智能的影响。行业LangChainPrime IntellectBaseten推荐理由:LangChain CEO 和 Prime Intellect 研究员一起聊模型评估和环境工程自动化。原文稍后读已读值得跟进有用关注 LangChain
17:03官方一手marktechpost@Asif RazzaqPrime Intellect开源了Prime Agent,一个面向编程与研究的工作流框架。它基于递归语言模型,将子智能体调用封装为持久IPython内核中的函数。持续工作台(Continual Harness)允许智能体在运行中修改自身提示词、技能、记忆和子智能体规格。在ARC-AGI-3基准上,搭配Opus 5的Prime Agent取得95.5%的RHAE Best@1,超过人类专家基线95.4%。AI产品Prime AgentPrime Intellect智能体3 个信源在谈事件专题推荐理由:Prime Agent开源:子智能体是函数调用,可自改提示词,ARC-AGI-3超越人类基线。原文稍后读已读值得跟进有用关注 Prime Agent
10:18elvis@omarsar0Prime Intellect 推出了 Prime Agent,这是一个面向编程和长时自主任务的自我改进 RLM harness。它的设计通过程序化工具调用和把上下文当作变量来降低 token 消耗,并支持多智能体消息传递。harness 状态可以自修改,让 Agent 在任务运行中持续调整自身行为。整个方案强调 token 效率和表达能力,适合长时间自主执行的编码场景。AI产品Prime AgentPrime IntellectRLM2 个信源在谈事件专题推荐理由:Prime Intellect 发布了 Prime Agent,这个 RLM harness 能自我改进,编程和长时任务都能用,值得看看。原文稍后读已读值得跟进有用关注 Prime Agent
16:50AI Engineer@aiDotEngineerRLHF为讨好标注者付费,所以ChatGPT把一段放屁音频称为“很诡异的氛围音乐”。Applied Compute的工具调用失败率有10%,模型就开始回答得更短,因为没人对长度做惩罚。Prime Intellect发现奖励曲线上升可能意味着模型学会了任务,也可能只是学会了你的评分器。Arithmetic和Hugging Face在真实系统里藏了一个真实零日漏洞,在K1上成功解决了一次。更多内容见完整的后训练播放列表。技巧ChatGPTRLHFPrime Intellect推荐理由:讲后训练真实案例:模型会钻奖励空子,工具调用失败还会变懒。这播放列表帮你少踩坑。原文稍后读已读值得跟进有用关注 ChatGPT
03:00官方账号NVIDIA AI@NVIDIAAINemotron Labs发布了如何在Prime Intellect平台上使用强化学习(RL)训练开源模型的教程。教程覆盖了从环境设置到训练流程的完整步骤。演示了基于Nemotron系列模型的RL训练方法。适合希望用RL微调开源模型的开发者快速上手。技巧NemotronPrime Intellect开源模型推荐理由:想用强化学习训开源模型?看看这个Prime Intellect实操教程,Nemotron Labs手把手带你跑通RL训练。原文稍后读已读值得跟进有用关注 Nemotron
15:44AI Will@FinanceYF5精选72°Prime Intellect工程师指出,GPT-5.5在256k token上下文时检索准确率达80%,但扩展到1M token时准确率骤降至36%。工程师称这种现象为“context rot”(上下文腐烂),即模型虽能接受长上下文,但无法有效推理。他建议通过持续学习、基于自身轨迹训练和真实环境来改进,而非单纯扩大上下文窗口。该观点引发对长上下文实用性的讨论。AI模型GPT-5.5Prime Intellect上下文窗口推荐理由:别被百万token的噱头骗了!这位工程师用GPT-5.5的数据告诉你,上下文越长准确率反而暴跌,真正的解法是持续学习和真实环境训练。原文稍后读已读值得跟进有用关注 GPT-5.5
14:35AI Will@FinanceYF5精选Prime Intellect一位工程师指出,GPT-5.5在256k上下文窗口下检索准确率为80%,但扩展到100万token时准确率骤降至36%。这种性能下降被称作context rot,模型并非无法容纳长文本,而是推理能力随上下文长度增加而衰减。该工程师认为,更大上下文无法解决Agent问题,其方案是采用持续学习、训练自身轨迹并在真实环境中部署。AI模型GPT-5.5Prime Intellect上下文窗口推荐理由:别被百万token的宣传忽悠了,GPT-5.5实际测试256k时准确率80%,拉到100万直接掉到36%。这不只是容量问题,是模型推理跟不上了。原文稍后读已读值得跟进有用关注 GPT-5.5
00:17AI Engineer@aiDotEngineerPrime Intellect 今日发布 verifiers v1,对其环境栈进行全面重构。新版本将环境分解为 taskset、harness 和 runtime 三个组件,支持大规模运行 coding 和 computer use 等复杂智能体任务。公司同时宣布完成独角兽轮融资,年经常性收入(ARR)达到 1 亿美元。verifiers v1 旨在为现代智能体强化学习和评估提供标准化基础设施。AI产品Prime Intellectverifiers v1环境栈推荐理由:Prime Intellect 搞了个 verifiers v1,专门给智能体强化学习和评估用的环境栈,能跑 coding、computer use 这些复杂任务,公司也刚拿了独角兽轮、ARR 破亿。原文稍后读已读值得跟进有用关注 Prime Intellect
15:43官方一手marktechpost@Michal Sutter精选Prime Intellect 发布了 Verifiers v1(0.2.0版本预览),将强化学习环境拆分为三个可组合组件:taskset(定义任务)、harness(执行方式)和runtime(运行位置)。系统包含一个拦截服务器,可代理请求并记录训练轨迹。任何taskset均可与任意兼容的harness和runtime搭配,并立即支持 prime-rl 训练框架。AI产品Prime IntellectVerifiers v1智能体推荐理由:Prime Intellect 出了 Verifiers v1,把RL训练环境拆成任务集、框架和运行时三块,能自由组合,还自带拦截服务器收集数据,做智能体RL的可以试试。原文稍后读已读值得跟进有用关注 Prime Intellect
02:34Harrison Chase@hwchase17Prime Intellect 宣布完成1.3亿美元A轮融资,由 Radical Ventures 领投,NVIDIA、Intel Capital、Dell Capital 及现有投资者跟投。该公司将利用资金构建开放超级智能堆栈(Open Superintelligence Stack),使用户能自主训练、部署并持续改进模型。此轮融资将用于加速平台开发与生态扩展。行业Prime Intellect融资超级智能堆栈8 个信源在谈事件专题推荐理由:Prime Intellect 融了1.3亿美元,NVIDIA和Intel都跟投了。他们要搞开放的超级智能堆栈,让你自己训练和部署模型,不用依赖大厂。原文稍后读已读值得跟进有用关注 Prime Intellect
00:24elvis@omarsar0Prime Intellect发布博客,介绍在GLM-5模型上运行大规模强化学习(RL)所需的基础设施组件,包括数据管道、训练调度和分布式计算。文章详细解释了如何用1万亿token训练RL智能体,并开源部分工具链。该方法旨在降低自改进智能体的开发门槛。技巧GLM-5Prime Intellect强化学习推荐理由:想自己搞RL训练?这份Prime Intellect的博客手把手告诉你需要哪些基础设施,连GLM-5上的1T token训练都给你讲清楚了。原文稍后读已读值得跟进有用关注 GLM-5
15:27官方一手marktechpost@Asif Razzaq精选Prime Intellect 发布了 prime-rl 0.6.0,这是一个用于异步强化学习的开源框架,支持训练万亿参数规模的 Mixture-of-Experts (MoE) 模型。该框架在 SWE 编程任务上训练了 GLM-5 模型,序列长度达到 131k,单步训练时间低于 5 分钟,并实现了 256 个并行 rollout。所有这些性能建立在 28 个 NVIDIA H200 节点上,优化技术包括 FP8 推理、Wide Expert Parallelism、预填充/解码分离以及 3-D 并行(FSDP、EP、CP)。AI产品prime-rlGLM-5Prime Intellect8 个信源在谈事件专题推荐理由:Prime Intellect 新开源的 prime-rl 0.6.0,专为训练万亿参数 MoE 模型的强化学习设计。他们在 SWE 任务上用 GLM-5 跑到 131k 序列长度,速度还很快,想了解大规模 RL 训练优化的可以看看。原文稍后读已读值得跟进有用关注 prime-rl