大语言模型奖励专业知识:领域知识是高效使用LLM的关键

2026 08 05 HackerNews

精选理由

别看陶哲轩和ChatGPT聊雅可比猜想的对话,领域知识才是用好LLM的钥匙。学学他怎么提问,比堆提示词管用。

AI 摘要

作者Sean Goedecke指出,LLM让每个人都成了通才,但领域专业知识才是高效使用模型的关键。以数学家陶哲轩与ChatGPT讨论雅可比猜想反例为例,他的提示词简短精准,只抓要点。模型回答有误时,陶哲轩不说“你错了”,而是说“这比我预想的复杂”。领域知识让用户能从模型输出中提取相关想法、识别错误,编程中同样如此。瓶颈在人而非模型,因为信息已在模型中,需要聪明人提取。

原文 · SuperTechFans

2026 08 05 HackerNews

2026-08-05 Hacker News Top Stories # 大语言模型使通才任务普及,但领域专业知识仍是高效利用模型的关键瓶颈。 博客中AI生成图片会让人怀疑内容真实性,作者呼吁个人博客避免使用。 Xbox宕机导致光盘游戏也无法游玩,凸显数字时代“拥有”物理媒体的虚幻。 《柔雨将至》讲述智能房屋在核战后徒劳运行,反思科技与人类命运的脆弱。 项目通过PCA定义肤色色彩空间,帮助开发者生成多样化肤色,但存在局限性。 FFmpeg 9.0发布,新增动画WebP解码、GPU执行等更新并修复多项问题。 项目实现在单AMD MI300X上运行DeepSeek V4 Flash,性能达830 tok/s。 《柔雨将至》中自动化房屋在核废墟中徒劳运转,最终被大火摧毁。 美国在伊朗战争中几乎耗尽远程精确导弹库存,影响对其他国家的威慑能力。 苹果升级诉讼,指控更多前员工向OpenAI窃取机密数据,OpenAI否认指控。 1. 大语言模型奖励专业知识 (LLMs reward expertise) # https://www.seangoedecke.com/llms-reward-expertise/ 在 2010 年代,如果你有技术短板(比如不会写 CSS),只能依赖有经验的同事或祈祷网上有现成答案。如今,通过将任务交给大语言模型,每个人都能写出还算过得去的 CSS,LLM 让所有人都成了通才。 因此很多人认为使用 LLM 不需要技巧——只要直接提问就能获得博士级数学、尚可的代码或 LinkedIn 风格的文字。但这是错误的:提示词最重要的技巧恰恰是你所提问领域的专业知识。 以数学家陶哲轩与 ChatGPT 关于雅可比猜想反例的对话为例。他的提示词简短精准,不逐条回应模型,只抓要点;模型输出也更简洁,因为陶哲轩通过展示专业度让模型进入"与数学家对话"模式而非"向业余者解释"模式;当模型回答有误时,他不直接反驳,而是说"这比我预想的复杂";他几乎从不采纳模型关于下一步的建议,而是自己提出跳跃性思路。 关键在于他真正理解数学——能从模型的多段回复中提取相关想法,提出替代方案,识别"看起来不对劲"的地方。这种"领域知识让你更善用 LLM"的理念同样适用于编程:如果你对代码库有良好理解,就能比不熟悉时更有效地驱动 LLM。 领域知识的价值表明,即使模型越来越强大,人类专业知识仍将持续有用。对许多任务而言,瓶颈是人而非模型,因为困难在于向模型精确传达人类想要的解决方案类型——信息"已在模型中",但需要非常聪明的人才能将其提取出来。 HN 热度 1319 points | 评论 548 comments | 作者:MaxMussio | 1 day ago # https://news.ycombinator.com/item?id=49161518 缺乏专业术语的初学者难以准确描述需求,容易陷入与 AI 的无休止功能讨论中。 具备探索精神的初学者可以通过 LLM 自学 Linux 和编程,甚至构建实际应用。 真正的动手者喜欢学习事物运作原理,而其他人可能害怕或不愿学习。 AI 降低了学习门槛,只需跟随指令即可,但深度理解可能不足。 向 AI 询问词汇和概念可以跨越术语障碍,但前提是知道要这样做。 多数人缺乏批判性思维和提问的文化习惯,这是 AI 无法替代的。 过去低门槛探索是谷歌搜索加按步骤操作,现在 AI 让初始查询更轻松。 桌面 Linux 有授权和学习的文化,这可能被 AI 吸收,而网页开发文化可能不同。 术语“rice”指自定义装饰,“fully riced with cats”指桌面被猫咪主题深度定制。 2. AI 生成的图片让我不愿阅读你的博客 (AI-Generated Images Discourage Me from Reading Your Blog) # https://nelson.cloud/ai-generated-images-discourage-me-from-reading-your-blog/ 作者在个人博客中表达了对 AI 生成图片的日益厌恶,尤其是在独立博客里看到这类图片时,会不禁怀疑文章内容是否也由 AI 生成。他认为个人博客出现 AI 图片令人失望,而企业博客出现尚可理解。作者表示,宁愿看到粗糙的微软画图作品,也不愿看到 AI 图片。他坦言自己的博客或许有很多可吐槽之处,但至少能确定是真实人类的思考,而非大语言模型的输出。最后,他呼吁个人博客作者避免使用 AI 生成图片。该文还附有 Hacker News 上的讨论链接。 HN 热度 726 points | 评论 432 comments | 作者:meysamazad | 13 hours ago # https://news.ycombinator.com/item?id=49167113 AI 生成的图像如果用于帮助说明内容,则没问题;但如果作为虚假的价值信号(假装付出了大量努力),则是一种欺骗和侮辱。 装饰和装饰品传统上用于信号额外努力,AI 模仿廉价,观众需要区分真假,这些动态对理解 AI 相关情绪至关重要。 在博客中,真实图像表示作者投入了大量时间、内容准确;AI 图像则代表低质量、高数量、无用心,文本可能也是 AI 复制粘贴。 像牙医网站使用廉价美丽的库存照片看起来廉价,AI 图像类似,甚至更糟。 AI 图像看起来过度调校、奇怪,审美上不好看;如果博客用 AI 图像,读者会直接离开。 工具在改进,可以通过更好的提示词、草图等生成更自然的图像,但当前很多人能识别并反感,且“假发谬误”缺乏实际例子。 “AI Slop”指低质量、低努力、明显使用 AI 工具的工作,类似使用相同滤镜或流行主题,不值得表扬。 审美偏好是主观的,但主流意见认为 AI 艺术不好,许多平台在过滤 AI 内容,公众对 AI 图像有普遍反感。 有人反驳说审美没有对错,但另一方认为有些东西就是烂,不需要为所有偏好辩护。 3. Xbox 宕机,玩家无法游玩自己拥有的光盘版游戏 (Xbox goes down. You can’t play games you own on disc) # https://birchtree.me/blog/xbox-goes-down-you-cant-play-games-you-own-on-disc/ Xbox 大规模宕机,导致玩家无法游玩自己拥有的光盘版游戏。文章引用 Jay Peters 的报道,指出此次宕机不仅影响数字游戏,连光盘游戏也被阻止运行。作者借此反思物理媒体的现状:如今的游戏光盘并非真正的“拥有”,游戏仍需安装并依赖网络验证,与过去 Game Boy 卡带即插即玩的体验截然不同。相比之下,PC 平台虽然也是数字版,但玩家有更多方式保持对游戏的访问,这也是作者转向 PC 的原因。 HN 热度 573 points | 评论 615 comments | 作者:surprisetalk | 12 hours ago # https://news.ycombinator.com/item?id=49167448 微软软件体验糟糕,bug 多、测试不足,登录流程繁琐,验证码循环导致无法正常游玩。 微软的产品长期半成品,从 80 年代至今未改善,问题根深蒂固。 离开微软生态多年后回归,因 Minecraft 账户流程极其糟糕,令人失望。 大型企业客户从微软产品切换到 AWS,体验明显改善,微软的 IT 环境复杂低效。 建议直接盗版 Minecraft,Java 版易盗版,另一版本广告多、有封禁风险。 旧账户被废弃后,计划无账户玩,质疑合法购买后服务器关闭是否算侵权。 法律上公司会限制使用方式,即使已购买也可能被禁止,道德上应按自己认为正确的方式行动。 没有足够财力请律师,无法对抗微软的法律威胁。 需要账户才能玩多人游戏,最终选择 Minecraft Education 版。 朋友组可以在离线模式下玩,无需正版验证。 让其他家长也盗版不现实,无法实现多人游戏。 服务器配置允许盗版和非盗版玩家共存,只需关闭账户验证。 转用 Mac 和 Linux 后,再接触 Windows 感觉 20 年毫无进步。 Windows 之所以持续存在,是因为游戏、IT 部门等复杂生态系统,而非自身优势。 新西兰科技行业多用.NET 和 Azure,同事不理解 AWS/Jenkins,存在技术壁垒。 微软家庭控制(家长控制)设计混乱,主要目的是榨取用户金钱。 早期 Minecraft alpha 版在 Linux 上运行良好,如今问题重重。 4. 《柔雨将至》 (Ray Bradbury’s “There Will Come Soft Rains” is set today (2026-08-04)) # https://short-stories.co/@raybradbury/there-will-come-soft-rains-6k8vr4xxlnmj 在未来的 2026 年 8 月 4 日,加州艾伦代尔市的一座智能房屋仍在自动运行:它按时准备早餐、打扫卫生、播报天气,但主人早已在核战争中消失。房屋是废墟城市中唯一幸存的建筑,西墙上印着主人一家被瞬间烧灼的剪影。一只垂死的狗闯入后死去,被房屋自动处理。下午,房屋自动播放音乐、准备茶点,但无人享用。夜晚,房屋的语音系统为已故的女主人朗诵萨拉·蒂斯代尔的诗歌《柔雨将至》,诗中描绘自然在人类灭绝后依然生机勃勃的景象。午夜,一棵断树砸碎厨房窗户,引发火灾。房屋启动所有灭火系统,但最终因燃料耗尽而失控。在混乱中,房屋的各个功能模块仍在疯狂运转:烤面包机不断制作早餐、语音系统重复报时和朗诵诗歌。最后,房屋倒塌,只剩一面墙上的语音反复播报:“今天是 2026 年 8 月 5 日……”故事通过自动化房屋的徒劳挣扎,反思科技与人类命运的脆弱,以及自然对文明消亡的漠然。 HN 热度 494 points | 评论 6 comments | 作者:askvictor | 14 hours ago # https://news.ycombinator.com/item?id=49166491 中期文学受到战争(尤其是核毁灭)恐惧的深刻影响。 恐惧核战争对美国精英有用,因为可以转化为对共产主义的恐惧。 目前对核战争的恐惧程度不如以前。 核武器的与传统战争和气候变化的威胁更加相关。 现代核武器的数量和威力比过去减少,但战略不稳定性在增加。 核战争的风险与以前相比不一定更低。 各国对核武器的态度和战略正在变化。 战争和政府腐败造成的死亡不能简单归咎于制度本身。 许多人对核战争的恐惧是基于过去的记忆和经验。 核战争可能的发生依赖于不稳定的国际局势和决策错误。 5. 展示 HN:一种生成多样化肤色的简单算法与色彩空间 (Show HN: Simple algorithm and color space to generate diverse skin tones) # https://toneyalexander.github.io/inclusive-color-space/ 该项目旨在定义一个“足够好”的皮肤色调颜色空间,帮助开发者构建更具包容性的色彩工具(如角色创建器、数字艺术)。作者通过手动标记大量 RGB 颜色,利用主成分分析(PCA)将数据变换到更易处理的形状,并用数学方程将一个球体映射到该空间中,从而生成一组连续的、可覆盖广泛人类肤色的颜色范围。 页面提供了一个基于该颜色空间的交互式取色器,以及 Python 和 JavaScript 示例代码,方便直接使用这些数学公式。作者强调这些结果是“够用”的起点,而非权威标准,并坦诚讨论了局限性:肤色受血流、黑色素、散射等生物因素影响,且健康条件可能导致非典型肤色;个人主观偏差、屏幕和光线差异也会影响效果。最后,作者提醒技术处于社会背景中,浅肤色常被优先,而深肤色被边缘化,呼吁关注种族与肤色歧视问题。 HN 热度 448 points | 评论 87 comments | 作者:automatoney | 9 hours ago # https://news.ycombinator.com/item?id=49170165 皮肤颜色可以通过黑色素和血红蛋白浓度参数化,本质上是二维的,可用于反演像素颜色以识别色团浓度。 皮肤颜色模型基于比尔-朗伯定律,将皮肤近似为两个半透明层,忽略次表面散射,但大致正确。 东亚人种未晒黑时的“偏黄”肤色可能与皮下脂肪相对丰富有关,但胶原纤维散射也会产生偏黄色调。 除黑色素和血红蛋白外,胆红素升高(如疾病)或高铁血红蛋白水平异常(如蓝皮人)也会影响肤色。 皮肤具有半透明性,颜色在表面形成渐变,如脸颊和额头偏红,下巴和脖子偏蓝。 肤色发黄不一定源于肝肾损伤,吉尔伯特综合征(良性遗传代谢异常)或胡萝卜素摄入过多也可导致。 6. FFmpeg 9.0 ‘Lei’ 发布 (FFmpeg 9.0) # https://github.com/FFmpeg/FFmpeg/blob/n9.0/RELEASE_NOTES FFmpeg 项目发布 9.0 版本,代号“Lei”。该版本距离上一版 8.1 约四个月。完整更新日志位于项目根目录,Git 历史可访问 git.ffmpeg.org。如有问题,可通过 #ffmpeg IRC 频道(irc.libera.chat)或邮件列表联系。 HN 热度 423 points | 评论 94 comments | 作者:gyan | 15 hours ago # https://news.ycombinator.com/item?id=49166202 动画 WebP 解码功能很实用,之前浏览器支持但 FFmpeg 不支持导致很多桌面应用无法播放 等待动画 WebP 功能很久了,之前需要借助在线工具转换格式,现在可以直接用 FFmpeg 处理 ONNX Runtime DNN 后端支持 GPU 执行,可能带来新的编解码应用,但具体例子还不清楚 硬件进步使得低成本设备也能高效运行视觉模型,比如用 QSV 解码、CPU 缩放、iGPU 推理 ONNX 是少数能实现硬件加速卷积的方式之一,有人可能想移除它但实际很有用 Playdate 视频编码器非常小众,可能仅次于 LucasArts 的编解码器 Playdate 屏幕是 1-bit LCD 而非电子墨水屏,电子墨水刷新率不适合游戏设备 有人买了 Playdate 但很快闲置,因为没找到多少真正喜欢的游戏 电子墨水屏刷新速度慢,但现代设备如 Boox 阅读器已能流畅运行 Firefox 动画 WebP 支持今天就用上了,省去了一些 hack 代码,FFmpeg 真是支撑世界的基石 LCEVC 轨道复用支持令人兴奋,但似乎只有少数人关注 好奇 FFmpeg 是否用 LLM 辅助移植编解码器到不同架构,以及效果如何 Claude 帮助 FFmpeg 找到了缺失的后端移植,但团队通常更偏好手工优化的汇编代码 使用 LLM 做差距分析和填充样板代码没问题,但还需人工审查和优化 对于老旧或特殊硬件,即使 LLM 生成的代码不够完美,也比完全没有支持要好 7. DeepSeek V4 Flash 在单个 AMD MI300X 上 (DeepSeek V4 Flash on a Single AMD MI300X) # https://github.com/ryanzhou/deepseek-v4-flash-mi300x DeepSeek V4 Flash 在 AMD MI300X 上的生产级部署 项目概述 这是一个开源仓库,提供在 单个 AMD MI300X GPU 上生产运行 deepseek-ai/DeepSeek-V4-Flash-0731 模型的完整配置和补丁方案,包含 Docker Compose 栈、SHA-256 校验文件覆盖、上游差异补丁及调优表格。 性能数据 单流解码速度:168.6 tok/s(中位数) 预填充速度:约 7.9–8.5K tok/s 8 并发流:总计 542 tok/s,每流中位数 90.3 tok/s 64 流突发:总计 830 tok/s,无内存溢出、无引擎错误 上下文长度:验证支持 256K(架构支持 1M) 模型权重占用 HBM:156.67 GiB,无需额外量化或权重卸载 为什么选择 MI300X MI300X 拥有 192 GB HBM3 和 5.3 TB/s 内存带宽,容量是 H100 SXM5 的 2.4 倍,价格约为一半。整个 304B 参数模型可完全放入 HBM,无需 PCIe 权重流式传输或分层卸载,单卡即可处理 2–8 个典型并发流及最多 64 流突发。 技术挑战与解决方案 MI300X(CDNA3)实现的是 AMD/Graphcore 的 fnuz 变体 E4M3 FP8 格式,而 MI325X 及更新产品使用 OCP 标准 FP8,内核若不区分会导致两倍的缩放域误差。官方 vLLM 配方主要针对 NVIDIA 和更新 AMD 硬件,本仓库补充了 FP8 格式修正、高并发 MoE 路由修复、因果投机验证、CPU-KV 同步修复及未调优核形状等方案。 仓库内容 compose.yaml :生产栈配置(vLLM ROCm + Caddy),带摘要固定 patches/ :生产环境覆盖文件及与上游基线的差异补丁 tuning/ :gfx942 架构的 AITER A8W8 块缩放调优表 混合 KV 策略 :20 GB fp8_ds_mla GPU 缓存 + 96 GiB CPU 卸载层 部署要求 :1 块 MI300X、约 235 GiB RAM(CPU KV 层)、约 500 GB 磁盘 HN 热度 362 points | 评论 87 comments | 作者:zhoutong | 14 hours ago # https://news.ycombinator.com/item?id=49166386 MI300X 不能单独购买,整机含 8 个 MI300X 约 25 万欧元,但可通过云提供商按需租用,如 AMD 开发者云约 1.99 美元/小时。 自托管 DeepSeek V4 Flash 对只有 1-2 块 GPU 的小团队可行,能保证隐私且避免量化导致的质量下降。 830 tok/s 是突发聚合速度,持续约 500 tok/s,服务于 8 个并发用户时每用户约 90 tok/s。 自托管经济性:按 830 tok/s 算,1 小时产出约 3M 输出 token,按 DeepSeek 价格仅值 0.54 美元,需 3 倍以上速度才有利润。 缓存 token 成本极低,代理工作负载中缓存占比极高(如 98.5%),自托管时缓存命中更久,成本与 DeepSeek API 定价接近。 其他推理提供商缓存 token 定价高 10 倍,自托管可获舒适利润空间。 DeepSeek 也可能通过收集用户数据获得额外价值,数据可用于预训练或后训练。 推理实际成本并不高,前沿实验室可能已从 token 销售中盈利,覆盖研发成本。 8. 会有轻柔的雨(1950) (There Will Come Soft Rains (1950) pdf # 第一篇《细雨将至》讲述了一座全自动化房屋在 2026 年 8 月 4 日这一天按部就班地运转:语音时钟报时、厨房自动烹饪早餐、机器人老鼠打扫房间、花园喷头洒水、晚间朗诵诗歌。然而这座位于加州艾伦代尔的房子是核战废墟中唯一幸存的建筑,屋主一家早已在原子弹爆炸中化为墙上的五道焦黑剪影。一只濒死的野狗误入屋内,最终死在客厅并被清理。当晚厨房突发火灾,房屋拼命自救却无力回天,最终在大火中坍塌。次日黎明,废墟中只剩一面断墙,墙上的电子语音仍在机械地重复着:今天是 2026 年 8 月 5 日。 第二篇《行人》设定在 2053 年的一个冬夜,作家伦纳德·米德每晚习惯在空无一人的街头散步,而全城三百万居民都闭门不出,沉迷于电视。一辆由电脑控制的警车拦住了他,用冰冷的金属嗓音反复盘问他的职业、住址和外出目的。当得知米德没有电视、没有妻子、以走路为乐时,系统判定这种行为属于"退行性倾向",将他押往精神病研究中心。警车驶过米德灯火通明的家,最终载着这位最后的行人消失在寂静的夜色中。 HN 热度 340 points | 评论 376 comments | 作者:pmg101 | 1 day ago # https://news.ycombinator.com/item?id=49162653 冷战核恐惧深刻影响了中世纪的科幻小说,如《柔雨将至》和《巴比伦之水》等作品。 认为对战争的恐惧“过时”的说法反映了富裕第一世界遗忘了战争常态,全球军事开支上升表明新冲突不可避免。 人类正在梦游般走向第三次世界大战,却无人真正关心。 据专家判断,当前或许是人类最接近核毁灭的时刻,但核恐惧已不再主导日常意识和公众讨论。 《原子科学家公报》的末日时钟近年更多反映气候变化和 AI 风险,而非核战争。 核恐惧在冷战时期被美国精英利用以煽动反共情绪,苏联解体后这种文化推力减弱。 末日时钟主要衡量全球性灾难,而非仅核战争。 全球性核毁灭的风险可能比过去六七十年更低,当前末日时钟更多关注气候变化、常规战争和虚假信息传播。 美俄之间《新削减战略武器条约》到期后无有效核控协议,三国均在积极现代化核武库。 9. 美国在伊朗战争中使用了“几乎所有”远程精确导弹 (U.S. used ‘virtually all’ of its long-range precision missiles during Iran war) # https://www.cnbc.com/2026/08/04/us-has-used-virtually-all-of-its-long-range-precision-missiles-report.html 美国在伊朗战争中几乎耗尽了其远程精确导弹库存,包括陆军战术导弹系统(ATACMS)和精确打击导弹(PrSM)。这些武器对乌克兰战争也至关重要。分析人士担忧,库存下降可能限制美国威慑俄罗斯和中国等对手的能力。尽管特朗普声称美国拥有远超所需的弹药,且国防企业正以创纪录速度生产,但内部消息人士警告,持续冲突可能导致库存降至危险水平。此外,防御性武器如爱国者拦截弹和战斧巡航导弹的库存也大幅减少。 HN 热度 335 points | 评论 601 comments | 作者:tcp_handshaker | 13 hours ago # https://news.ycombinator.com/item?id=49166860 标题有误导性:ATACMS 和 PrSM 库存本就不高且生产时间短,并非美国远程精确打击主力,空军仍有大量防区外武器和制导炸弹。 若坚持只打防区外战争,耗尽这些武器将成大问题,因为无地面部队介入意愿,将无法取胜。 问题是领导层不愿进入伊朗领空,害怕飞行员被俘,因此不能靠常规空袭,只能消耗昂贵的防区外导弹。 消耗弹药可能是有意倒逼军工扩大产能,有利于 Anduril 这样强调制造规模的公司。 远程导弹本用于压制防空、为后续常规弹药开路;但因特朗普缺乏国会和公众授权,只能用昂贵武器降低伤亡,且重建库存耗时,影响其他冲突。 对于 ATACMS 是否用于防空压制存在分歧:有人认为 SEAD 属空军/海军任务,不是陆军优先事项;也有人认为联合作战下 ATACMS 和 PrSM 肯定用于打击防空系统。 特朗普被指无法考虑行动的次生效应,其支持者所谓“稳定天才”只会以经济灾难和民族屈辱收场。 消耗美国武器库存、迫使美国停止援乌、推高油价,均符合俄罗斯利益;特朗普还减少对俄制裁并收取委内瑞拉石油款项。 但也有观点指出,俄罗斯依赖伊朗无人机,伊朗战争会影响其无人机供应。 实际作战中,美军未能充分削弱伊朗导弹系统,无法安全投掷重力炸弹,被迫将战机撤至约旦和以色列,面临撤出或承受损失的困境;这种情况也可能出现在美中冲突中。 10. 苹果称更多前员工可能向 OpenAI 泄露机密数据 (Apple says more ex-employees may have taken confidential data to OpenAI) # https://techcrunch.com/2026/08/04/apple-says-more-ex-employees-may-have-taken-confidential-data-to-openai/ 苹果公司在与 OpenAI 的商业机密诉讼中升级了法律行动,寻求法院发布初步禁令,阻止 OpenAI 利用苹果技术开发 AI 设备或产品。苹果在最新文件中指出,调查发现除已起诉的两名前员工(资深系统工程师刘畅和首席硬件官谭永毅)外,还有 11 名前苹果员工可能涉及窃密,包括有人曾在面试 OpenAI 前与被告会面讨论苹果未发布产品信息,还有人截取机密文档截图。苹果要求法院允许加速证据开示。OpenAI 公开回应称苹果的禁令请求“基于虚假信息且完全没必要”,强调自身没有也不想获取苹果商业机密,并指出苹果此前曾因混淆相似姓氏而发错邮件、未如实说明与法律顾问的沟通等失误。 HN 热度 325 points | 评论 249 comments | 作者:thewebguyd | 8 hours ago # https://news.ycombinator.com/item?id=49170479 苹果前员工涉嫌截图文档等行为,不仅仅是记忆中的信息,而是实际窃取机密数据。 有人怀疑 OpenAI 鼓励员工犯罪,并试图在 Hacker News 上操纵舆论。 Sam Altman 是硅谷最被讨厌的公众人物之一。 法律文件显示员工利用认证漏洞访问第三方云存储库,下载了 37 份高度敏感的技术文档。 第三方云存储可能是 Box、Atlassian 或基于 AWS/GCP 的自建系统。 OpenAI 硬件项目是 Sam Altman 的虚荣项目,想模仿 Steve Jobs,可能像 Humane Pin 一样失败。 Steve Jobs 虽有缺陷,但做出了好产品;而 Altman 有更严重的问题(针对妹妹的指控)。 苹果员工追随 OpenAI 可能是因为苹果薪资低,而 OpenAI 有高 IPO 潜力。 穿公司 logo 衣服在办公室显得尴尬。 双翻领衬衫是 2000 年代硅谷的时尚风格。 Hacker News 精彩评论及翻译 # LLMs reward expertise # https://news.ycombinator.com/item?id=49163331 I did a test a few months ago. A friend of mine wanted to develop what i understood to be a simple single page web app. But since she didn’t have any software engineering experience she asked me to help. Around that time everyone was talking about how literally anyone can develop software with LLMs i asked her if she could give it a try first, and if I could watch the attempt. I was fully expecting that writing the code will pose no problem for the AI. But i was curious if the AI will realise that my friend is a novice and needs extra help with things like: copy pasting the code into a text file and saving it with an html extension, helping her host the file online so she can share it with others, buying a domain for it, etc. I assumed they will get there eventually, but i also assumed that it will take a lot of stumbling around and misunderstandings. But i was completely wrong. They didn’t even get to that point. Because my friend didn’t have the vocabulary to ask the AI to write code. They were just going around in circles where the AI was brainstorming with her about possible features and getting thints more and more complicated. We terminated the experiment after one and a half hours and many many messages exchanged between her and the LLM. Whereas to me who knows the terminology would have probably just taken a single exchange of messages to get the result she described to me. I would have prompted with something like “Please write to me an html page which does X, Y, Z.” But since she didn’t know the right terminology she got into a vortex of feature discusion, and she didn’t find a way to tip the AI into “just do it, write it now” mode. In other words in that case the LLM would have rewarded even just a little bit of expertise, but without it there was a confusion about goals between the human and the machine. krisoft 几个月前我做了一个测试。我有个朋友想开发一个在我看来很简单的单页网页应用,但她没有任何软件工程经验,就找我帮忙。当时大家都在说,任何一个人都能用LLM开发软件,于是我问她能不能先自己试试,让我在旁边看着。 我原本以为,写代码对AI来说完全不是问题。但我好奇的是,AI会不会意识到我朋友是个新手,需要额外帮助,比如:把代码复制粘贴到文本文件里,保存成html扩展名;帮她托管文件以便分享给他人;以及购买域名等等。我猜他们最终能搞定,但过程中肯定会经历很多磕磕绊绊和误解。 但我完全猜错了。他们甚至都没走到那一步。因为我朋友不知道该怎么跟AI说要写代码所需的关键词。他们一直在兜圈子,AI跟她头脑风暴各种功能,把需求越搞越复杂。我旁观了一个半小时,她跟LLM来回发了好多条消息,最后我们终止了实验。 而对我来说,只要懂术语,可能只需要一条消息就能得到她描述的那个结果。我会直接提示:“请写一个实现X、Y、Z功能的HTML页面。”但她不知道正确术语,就陷入了功能讨论的漩涡,找不到办法让AI切换到“别废话,直接写”的模式。换句话说,在这个案例中,LLM哪怕奖励一点点专业知识就能高效工作,但缺乏专业知识时,人和机器之间就陷入了目标混乱。 Xbox goes down. You can’t play games you own on di… # https://news.ycombinator.com/item?id=49169001 I wanted to show my gf the halo 1 campaign, so I downloaded the 30GB Masterchief Collection via steam. When I launched it, I was greeted with a black box. After 1 Minute it was a microsoft login screen that looked eerily like a browser inside the game. Since I couldn’t do anything else, the game was stuck at a sub 720p resolution. I said fine Ill just create an account. Yea so mail, firstname, lastname, birthday, country, email and email verification code later I had to do captcha which is clicking and holding down a button. “Help us against the bots” it said. I unironically spent 5 minutes clicking that button, then being stuck in a loop with “please try again” while my gf just sat there watching me. Well I turned off MCC and gave up. I don’t want to know what life is like having xbox hardware mawadev 我想给女朋友展示一下《光环1》的战役,于是通过Steam下载了30GB的《士官长合集》。启动游戏后,屏幕先是一片黑,过了一分钟才出现一个微软登录界面,看起来诡异得像游戏里嵌了个浏览器。我什么也做不了,游戏还被锁定在不到720p的分辨率。算了,我心想,那就注册个账号吧。于是填了邮箱、名、姓、生日、国家、邮箱验证码,最后还得做一个按住按钮的验证码。上面写着“帮助我们对抗机器人”。我老老实实花了一分钟按那个按钮,结果陷入“请重试”的死循环,女朋友就坐在旁边看着我。 好吧,我关掉了《士官长合集》,放弃了。 我都不敢想用Xbox硬件会是怎样的体验。 Apple is getting this wrong # https://news.ycombinator.com/item?id=49164936 Is it normal for a company this big to make a public blog post like this with almost no introduction to what they’re on about? I would expect them to start out with something like Apple is suing us for yada yada yada, but instead it reads like the diary of a hurt teenager. efnx 像这样一家大公司,发表一篇几乎没介绍自己到底在说什么的公开博客文章,这正常吗? 我本以为他们会先写点类似“苹果正在起诉我们,因为blah blah blah”的话,但这读起来却像一个受伤青少年的日记。 Show HN: Run an 80B Qwen in 4.3 GB of RAM on a Mac… # https://news.ycombinator.com/item?id=49164268 I know everyone wants to crap all over these setups that are impractical, but this is how progress happens. People will keep plugging away at this and figure out how to avoid wearing the hard drive, how to make it run faster, custom hardware buses etc. Keep going! I personally can’t wait for the day when a 1t param model runs off a $200 SSD instead of a $50k rack of Nvidia chips. dghlsakjg 我知道大家都会吐槽这些不实用的配置,但进步就是这样发生的。 人们会不断钻研,想办法解决如何避免佩戴硬盘、如何让它运行更快、定制硬件总线等问题。 继续加油!我个人已经迫不及待想看到那一天:一个1万亿参数的模型能在200美元的SSD上运行,而不是靠5万美元的Nvidia芯片机架。 Xbox goes down. You can’t play games you own on di… # https://news.ycombinator.com/item?id=49169079 This is my experience with all Microsoft software. The worst thought out, buggy, untested pile of crap. There’s something seriously wrong in Redmond. At least with linux, you can search on the web and find a forum post telling you the magic incantation. With Microsoft, you will be forced to consume some second-rate engineer’s unmanaged, barely workable, edge case until it might or might not work. Office on the web is a horror show this way. epistasis 这就是我对所有微软软件的体验:构思最差、漏洞百出、未经测试的一堆垃圾。 雷德蒙德绝对出了大问题。 至少用Linux,你可以在网上搜索,找到论坛帖子告诉你神奇的咒语。而用微软,你只能被迫忍受某个二流工程师编写的、无人维护、几乎无法正常运行的边缘案例,直到它可能生效,也可能不生效。 Office网页版在这方面简直就是一场噩梦。 More German than many Germans # https://news.ycombinator.com/item?id=49152482 A very nice read and pretty much my experience. I have been here for a quarter of my life now, I do not think I can live anywhere else now. People may not like me being here because of my skin color or whatever but I do not mind. I keep to myself and follow all the “rules” I can. In fact, I like most of the rules, rules are good because they ensure order, fairness and equality. Will a little bit of empathy be nicer, sure, but I cannot complain. Speaking of which, a lot of German natives complain and some are even leaving the country (around 100k left last year), but honestly I have visited / lived in nine countries, and people have no idea how good they have it here. I came here with a bag, twenty euros in my pocket and a job offer, a dozen years later I have pretty much all basic comforts and stability one can dream of, my kids have a bright future waiting for them, all this is not possible in many countries. rockyj 非常棒的阅读体验,几乎就是我的亲身经历。我生命中的四分之一时光都在这里度过,现在我觉得自己已经无法在其他地方生活了。有些人可能因为我的肤色或其他原因而不喜欢我在这里,但我不介意。我独来独往,遵守所有我能做到的“规则”。事实上,我喜欢大部分规则,规则是好的,因为它们确保了秩序、公平和平等。 多一点同理心当然更好,但我没什么可抱怨的。说到这个,很多德国本地人却在抱怨,甚至有些人正在离开这个国家(去年大约有10万人离开),但说实话,我去过/住过九个不同的国家,人们根本不知道自己在这里过得有多好。我当初只带着一个包、兜里揣着20欧元和一份工作offer来到这里,十几年后,我几乎拥有了一个人能梦想的所有基本舒适与稳定,我的孩子们未来光明,而这些在世界上许多国家都是不可能实现的。 Why some people mow a lawn better than others # https://news.ycombinator.com/item?id=49173038 This is a very different problem than actual efficiency when mowing a lawn or vacuuming a rub. Turning takes more work and time, and you miss a part of the ‘square’ when you are turning (the arc of the curve is not a straight line). In addition, vacuums especially have an area at the edge of the machine that is not cleaned as well, which is why you want a bit of overlap in your lines. Plus, when mowing a lawn, you often want to leave a nice pattern, so you cant just go for pure efficiency. cortesoft 这与割草或吸尘时的实际效率截然不同。转弯需要更多精力和时间,而且在转弯时你会错过“正方形”的一部分(弧线并非直线)。此外,尤其是吸尘器,机器边缘区域清洁效果较差,因此你需要让清扫路线稍有重叠。 另外,割草时你通常想留下漂亮的图案,所以不能只追求纯粹效率。 All of Winona Police Department’s Flock cameras cu… # https://news.ycombinator.com/item?id=49172861 I believe “money good” is YC’s only guiding principle. HN is a nice resource, but let’s not have any illusions about the morals of the owners. chuckadams 我认为"金钱至上"是YC唯一的指导原则。HN是个不错的资源,但我们不要对拥有者的道德抱有幻想。 Apple says more ex-employees may have taken confid… # https://news.ycombinator.com/item?id=49171927 Apple is cutthroat in business too. Tony Fadell, the inventor of the iPod and co-inventor of the iPhone, and later Nest founder, commented this in Stratechery about the lawsuit when filed: “This is Apple’s typical tactic to scare Apple employees — either former or current. I heard this lawsuit was driven by the Apple board. Steve threatened to file a lawsuit against Nest for poaching 80-100 Apple employees. He called me, screamed for a while with lots of accusations. Then I said, “Steve, it’s Apple’s job to retain its talent, not mine.” He stopped his rant and then we went on to talk about our families and vacation plans. We kept hiring…” jdross 苹果在商业上同样冷酷无情。 iPod的发明者、iPhone的共同发明者、后来Nest的创始人托尼·法德尔在诉讼提起时于Stratechery上评论道: “这是苹果恐吓苹果员工——无论是前员工还是现员工——的典型手段。我听说这起诉讼是由苹果董事会推动的。 史蒂夫曾威胁要起诉Nest,因为我们挖走了80到100名苹果员工。他给我打电话,大吼大叫了一阵,满是指责。然后我说:‘史蒂夫,留住人才是苹果的事,不是我的事。’他停止了咆哮,然后我们转而聊起了彼此的家庭和度假计划。我们继续招人……” Xbox goes down. You can’t play games you own on di… # https://news.ycombinator.com/item?id=49167629 Gaming is heading in the same direction that TV, movies and music are. It’s a shame. I can invite my friends over, boot up my GameCube to play some Mario Kart Double Dash. As long as the console and disc are okay, I can (hopefully) do that until I pass away. These days? Not so much. I’ll never be able to be sure I can play GTA VI in twenty years. It just sucks not owning anything anymore. I know why they do it, it’s a massive profit difference.[1] On the PC end of things, it’s not as bleak. Services like GoG let you download the standalone installer, DRM free. I try to get any single player games I can from GoG, you should too. Support the corps that give you ownership. Buy those Blu-rays of your favorite films. Either to support physical media or to ensure you will have it until data degrades. 1: https://youtube.com/watch?v=sESfDf0My84 cautiouscat 游戏正朝着电视、电影和音乐相同的方向发展。真是可惜。我可以邀请朋友来家里,打开我的GameCube玩《马里奥赛车 双重冲击》。只要主机和光盘没问题,我(希望)能一直玩到老死。 现在呢?没那么简单了。我永远无法保证二十年后还能玩到《GTA VI》。什么都再也无法真正拥有,这感觉糟透了。我知道他们为什么这么做,利润差距实在太大了。[1] 在PC端,情况还没那么糟。像GoG这样的服务允许你下载独立安装程序,没有DRM限制。我尽量从GoG购买所有能买到的单人游戏,你也应该试试。 支持那些让你真正拥有产品的公司。去买你最爱电影的正版蓝光碟吧——要么是为了支持实体介质,要么是为了确保你能一直拥有它,直到数据自然降解的那一天。 1: https://youtube.com/watch?v=sESfDf0My84 LLMs reward expertise # https://news.ycombinator.com/item?id=49162323 The amplifying mirror analogy works best here. LLMs are ultimately a reflection of your own interactions with its weights, the tone you use, the structure with which you construct your prompt, aspects of an issue you tend to focus on, your breadth of vocabulary and world knowledge and whatnot. People who (carefully) use it as an extension of their own mind and senses will very likely thrive, and those who use it as a replacement for their minds and their senses will struggle. One of the Claude skills I made Claude itself generate was the ’learning a concept across tiers’ skill – from ELI5 level to a PhD level, and it triggers whenever I ask it a very general question on a complex topic that isn’t my bread-and-butter. The fact that I’m able to choose explanation level from a super smart LLM (that’s available 24x7) that can explain any topic under the sun would’ve been mind-bogglingly sci-fi-ish just 4 years ago in 2022. abixb 放大镜的比喻在这里最为贴切。LLM本质上是你与自身权重互动的映射——你使用的语气、构建提示词的结构、你倾向于关注问题的哪些方面、你的词汇量与知识广度等等。 那些(谨慎地)将其作为自身思维与感官延伸的人,很可能会蓬勃发展;而那些将其作为思维与感官替代品的人,则会举步维艰。 我让Claude自行生成的一项技能是“跨层级理解概念”——从五岁孩童能懂的水平到博士级别,每当我提出某个我不擅长的复杂领域中的宽泛问题时,它就会被触发。我能够从一个超级智能的LLM(且全天候可用)那里选择任意议题的解释层级——就在四年前的2022年,这还绝对属于令人难以置信的科幻情节。 All of Winona Police Department’s Flock cameras cu… # https://news.ycombinator.com/item?id=49172620 Police use the technology to investigate crimes such as hit-and-runs and to locate missing persons. > No suspects have been identified. Yeah, that tracks. Camera data is owned by the police department and permanently deleted after 30 days. I assume this means that the police department deletes one local copy? jeremyberemy 警察利用该技术调查肇事逃逸等犯罪案件,并定位失踪人员。>尚未锁定任何嫌疑人。 确实,这样说得通。 摄像头数据归警察局所有,30天后永久删除。 我猜测这意味着警察局删除了一个本地副本? Apple is getting this wrong # https://news.ycombinator.com/item?id=49164840 Setting aside the presented evidence, it feels weird for somewhat emotionally charged complaining like this to go on an official company blog. Companies are generally pretty tight-lipped about active litigation outside court documents, right? This just seems a bit amateurish, down to the title. Is public opinion about this case so important to them? gr_norm 撇开已呈现的证据不谈,这种情绪化的抱怨出现在公司官方博客上感觉很奇怪。公司通常对除法庭文件外的未决诉讼都闭口不谈,对吧?这种做法从标题到内容都显得有些业余。这个案件的舆论导向对他们来说就这么重要吗? Waymo in Dallas # https://news.ycombinator.com/item?id=49174272 I live very close to LAX, and we have hundreds of Waymos in our area. At first i was a little weary, and kinda weirded out by all of them. They have become completely normal, and cause WAY fewer traffic incidents than human drivers. They are very predictable, and will always let you pull in front of them when changing lanes (unlike a lot of other LA drivers). I have seen a few incidents where they seem ‘stuck’, and it was a bit annoying and kind of funny, but again, it does not happen nearly as often as for human drivers. I also like taking them. It is nice to just get in and relax and not have to talk to anyone or worry about who is going to pick you up. You can control the temperature and music from your phone, you can drop the pin exactly where you want to be dropped off and picked up, and the ride is smooth and comfortable. We can debate all the knock on effects of Waymos, but the user experience is pretty great. cortesoft 我住在离洛杉矶国际机场很近的地方,我们这边有好几百辆Waymo无人车。一开始我还有点心里发毛,看到它们总觉得怪怪的。 现在它们已经完全成了常态,而且引发交通事故的概率比人类司机低得多。它们非常守规矩,你变道的时候它们一定会让你插进来(不像很多其他洛杉矶司机)。 我也见过几次它们好像"卡住"了的情况,虽然有点烦人但也挺好笑,不过话说回来,这种状况发生的频率比人类司机可低多了。 我也挺喜欢坐它们的。上车就能放松,不用跟任何人说话,也不用担心谁来接你。温度、音乐都能在手机上调节,上下车的地点也能精确设定,而且行驶过程又平稳又舒适。 我们可以讨论Waymo的各种连锁影响,但就用户体验而言,确实相当出色。 U.S. used ‘virtually all’ of its long-range precis… # https://news.ycombinator.com/item?id=49173886 For the most-dominant military power in the world to “whoopsy” run out of weapons because of a low-stakes engagement isn’t readily believable. Wow, yeah, you’d need to have morons at the top of the chain of command and subordinates afraid to speak out in order for something like that to happen. Nothing like the US government today at all. justin66 世界上最强大的军事力量,竟然因为一场低风险冲突就“哎呀”一声把武器打光了,这实在让人难以相信。 哇,是啊,那得是指挥链顶端全是蠢货、下属又不敢发声,才会发生这种事吧。跟今天的美国政府可一点都不像呢。 Xbox goes down. You can’t play games you own on di… # https://news.ycombinator.com/item?id=49169265 It is strange to me that people are re-discovering this today, in 2026. Microsoft has always been half-baked, even in the 80s and 90s. Heck, my parents basically raised me (20+ years ago) by running a business fixing problems with Microsoft products for their clients. keiferski 真奇怪,到了2026年人们才重新发现这一点。微软从来都是半吊子,哪怕在80年代和90年代也是如此。甚至,我父母20多年前基本就是靠为客户解决微软产品的问题来维持生计的。 AI-Generated Images Discourage Me from Reading You… # https://news.ycombinator.com/item?id=49167897 AI-generated images discourage me from interacting with any entity AT ALL. Bar / restaurant posters, events, shops, anything. Because it makes the brand appear lazy. And in a weird way “anti-human”. I don’t have a better word than that. wateralien AI生成的图像让我完全不想与任何实体互动。酒吧、餐厅的海报、活动、商店,任何东西都如此。因为这会让品牌显得很懒惰,而且以一种奇怪的方式显得“反人类”。我找不到比这更合适的词了。

大语言模型奖励专业知识:领域知识是高效使用LLM的关键 · AI 热点