模型多源确认精选

InstructGPT 作者离开 OpenAI,推出不做聊天的决策模型 Jev

InstructGPT 的共同作者、RLHF 的主要参与者,如今却认为:ChatGPT 的成功让全行业“丢掉了所有其他模型形态”,只剩自回归聊天这一条路! TypeSafe CEO @Complet...

精选理由

InstructGPT 作者搞了个不聊天的模型 Jev,只给程序输出带概率的判断,挺反共识。

InstructGPT 联合作者、RLHF 参与者 Diogo 离开 OpenAI 创立 TypeSafe,推出不做对话的 System One 模型 Jev,并在 Latent.Space 播客谈了 140 多分钟。Jev 不生成文本,只输出嵌入程序流、带校准概率的小型判断,官方文档明确它不是 Claude Code / Cursor 背后 LLM 的替代品。其训练方法 RLCD 的目标函数是 program in the loop,要求预测 0.8 的事件真的在约 80% 的情况下发生,概率由此变成软件可设阈值、可升级人工的接口。Diogo 批评 RLHF 的偏好优化导致模式坍缩、RLVR 加剧参差智能,并称 TypeSafe 定位为 data lab,数据全靠合成,就算有 10 亿美元也不做预训练。

原文 · shao__meng

InstructGPT 的共同作者、RLHF 的主要参与者,如今却认为:ChatGPT 的成功让全行业“丢掉了所有其他模型形态”,只剩自回归聊天这一条路! TypeSafe CEO @Complet...

InstructGPT 的共同作者、RLHF 的主要参与者,如今却认为:ChatGPT 的成功让全行业“丢掉了所有其他模型形态”,只剩自回归聊天这一条路! TypeSafe CEO @CompleteSkeptic 参加 @latentspacepod 播客,与 @swyx 进行了 140 多分钟深度讨论,讲述了他为什么离开 OpenAI 创立 TypeSafe AI,推出不聊天、不写文本、专为代码消费而生的 “System One 模型” Jev,用新训练范式 RLCD 追求“intelligence per dollar”,直指当前 AI 最刺眼的悖论:模型能解千禧年数学难题,却自动化不了最普通的日常工作! youtube.com/watch?v=cFx9Z3… System One Model: 让代码成为消费者 借 Kahneman 的双系统框架,Jev 定位为 System 1 模型:不生成文本、不写代码、不对话,快速给出嵌入程序流的、带校准概率的小型判断,他称之为“聪明的 if 语句”。官方文档明确:Jev 不做 Claude Code / Cursor 背后 LLM 的替代品,是要承担智能体和软件内部的结构化决策。 RLCD: 第三个北极星 RLCD (Reinforcement Learning for Calibrated Decisions,校准决策强化学习) 是未发表的核心方法。关键不是算法是目标函数,RLHF 的北极星是“指令遵循”,RLVR 是“可验证难题”,RLCD 是“program in the loop”:在 System One 任务上给出认识论上诚实的概率。校准意味着预测 0.8 的事件真的在约 80% 的情况下发生,概率由此变成软件可调用的接口,可设阈值、可决定何时升级人工。 Diogo 对 RLHF 的批判相当技术化:偏好优化导致模式坍缩 (如同 GAN 丢弃少数模式、日趋保守),且“校准对字符串的概率分布是彻底的毒药”,这就是文本模型做不好决策的原因。有趣的是,他以此回应 LeCun 的 “LLM 必然因误差累积而失败” 论:“数学上显然,但经验上不成立”,因为保守化、坍缩后的模型恰恰避开了理论预测的误差累积。RLVR 则 “加剧了参差智能”,解题更强却更难嵌入其他软件。 两个昂贵的反共识决策 · 拒绝公开基准:“极易被博弈”;当年“每个实验室都有团队在收集长得像 MMLU 的数据”,那只是“带额外步骤的基准测试”。替代方案是“凭氛围与信任,直到放进真实工作流里评估”。内部 eval 则把“不自欺”当作最高优先级。这个立场曾让融资处处碰壁,他拒绝妥协:“奖励坏演员的事我不干。” · API 层不做拒绝:拒绝在消费级聊天里合理,但对软件依赖是类型错误。他区分“安全对齐”(听实验室的话)与“能力对齐”(听用户的话),并直言前者“是指令遵循的反面”。类比数据库:智能不应审查自己的使用方式;在技术层“把拇指压上秤会割裂智能”,每一次强制过拟合都在侵蚀通用性。 数据实验室,不是模型实验室:10 亿美元也不预训练 “你优化什么,就得到什么,而且最重要的部分根本不是 ML。”他视 scaling laws 为“指数级资源换次线性收益”的坏投资,除非收益极其宝贵。TypeSafe 自我定位为 data lab 而非 model lab,数据全部合成,由“有品味的人”像艺术家一样找到认知核心的参差点并“手术式”修补,他正在“无限量招聘数据人才”。为留在 intelligence/$ 的帕累托前沿,他们“做尽恶心的事”,自称“模型的弗兰肯斯坦”。模型命名 Jev 正是 Jevons 悖论:智能越便宜,总消耗反而越大,他的赌注是廉价智能将引发软件业的“淘金热”,重回“早期互联网的能量”。 对软件与编码智能体的意义 · 方法论:把工作流拆解为大量“小而可测的决策”,每个失败变成永久的测试用例,“软件不会像 prompt 那样因上下文腐烂而遗忘”。他称之为 "ML without the ML"。 · Inverse SaaS-pocalypse: AI 将“像 regex 一样不起眼地”消失进软件内部,成为每个程序员可调用的语义判断原语。 · 编码智能体:他后续发表 "Tyranny of the KV Cache" 一文,主张 "Cache Rules Everything",上下文缓存经济决定智能体架构 (压缩工具调用、共享状态、sub-agents),并在单一模型架构上展望多智能体未来。 · 落地用例:意图路由、置信度分流、rubric 评分、实体消解(暗数据)、代码 lint、分析回放,甚至有人在 Jev 之上构建编程语言(他最爱的用例)。 Latent.Space @latentspacepod Jev and the System One Model: RLCD, intelligence/$, reliable AI, & the end of chat-first AI latent.space/p/jev @typesafeai CEO @CompleteSkeptic explains why AI can solve extraordinarily hard problems yet still fail to automate basic work, why Jev is built for reliable decisions inside software instead of chat, why TypeSafe rejects public benchmarks and refusals at the API layer, why data and the right task matter more than brute-force compute, how System One Models could reshape coding agents and software, and why even with $1 billion he wouldn’t pre-train a model from scratch. Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 385 📊 1 ⚡