DeepSeek 发布 V4.1 Flash 模型,采用不对称 MoE 架构并开源
2026 09 11 HackerNews
DeepSeek 新出的 V4.1 Flash 模型,用不对称 MoE 架构,参数量 552B,但只用了 8B 活跃参数处理输入、16B 处理输出,比上一代节省了 3/4 的存储,算力效率更高,还支持多模态,价格也便宜,适合需要高效推理的场景。
DeepSeek 发布 V4.1 Flash 模型,采用不对称 MoE 架构,参数量 552B,仅 8B 活跃参数用于输入、16B 用于输出,相比上一代 KV 缓存仅需 1/4 HBM 和 1/8 SSD 存储,大幅降低代理场景中的缓存命中成本。该模型已上线 API,支持多模态,价格下调,非峰值费率仅为峰值的 50%,并已开源权重上传 Hugging Face。
2026 09 11 HackerNews
2026-09-11 Hacker News Top Stories # 苹果推出首款折叠屏手机iPhone Duo,配备7.6英寸内屏和A20 Pro芯片,将于10月16日预购。 DeepSeek发布V4.1 Flash模型,采用不对称MoE架构并开源,主打更智能高效。 Shopify宣布从React Native迁移回原生开发(Swift和Kotlin),因LLM降低了双平台维护成本。 数学家质疑OpenAI可能使用未发表对话训练模型,引发对数据保密性和透明度的担忧。 微软正式将Rust列为一级语言,通过自研后端提升与Windows工具链的兼容性。 交互式模拟器将光速降至5公里/小时,直观展示相对论效应如时间膨胀和多普勒效应。 Apple发布AirPods 5,在开放式设计中实现领先主动降噪,支持语音和手势控制。 证据显示自动驾驶汽车事故率远低于人类驾驶员,Waymo等系统可减少92%严重伤亡。 Automattic董事会迫使CEO Matt Mullenweg休假,由CFO担任临时CEO。 软件行业的速度、金钱和复杂性容易导致开发者失去分寸感,缺乏明确“完成”定义。 1. iPhone Duo (iPhone Duo) # https://www.apple.com/iphone-duo/ 苹果推出首款折叠屏手机 iPhone Duo,起售价 $1999。展开后拥有 7.6 英寸 Super Retina XDR 显示屏,比 iPhone 18 Pro Max 大 50%,闭合时外屏面积也接近 iPhone 18 Pro。采用 Grade 5 钛合金框架与铰链盖、Ceramic Shield 防护,IP68 防水防尘。内屏 10 层超薄结构,纳米纹理涂层减少眩光,峰值亮度 3000 尼特。 搭载 48MP 双摄系统、A20 Pro 芯片(蒸汽冷却)及双电池系统,续航全天。Siri AI 助手更个性化。iOS 27 专为折叠形态优化,支持分屏多任务、横屏、竖屏、坐姿、站立等多种使用姿态。 10 月 16 日起预购,10 月 23 日正式发售。 HN 热度 1403 points | 评论 2424 comments | 作者:thecosmicfrog | 1 day ago # https://news.ycombinator.com/item?id=49630931 用户希望苹果能推出更小尺寸的手机,如 iPhone 12/13 mini,或考虑放弃苹果。 目前市场上几乎没有主流品牌生产真正的小屏手机,只有少数小众品牌如 Unihertz 还有相关产品。 折叠屏手机(如三星 Flip、Moto Razr)折叠后尺寸接近早期小屏手机,但并非传统直板小屏。 用户认为技术已经足够制造更薄更小的手机,但厂商不生产可能是因为小众需求不被重视。 苹果 iPhone Duo 鼓励开发者适配折叠屏,可改善 Android 折叠屏应用适配不佳的现状。 iOS 开发工具提供更完善的 API 支持多形态屏幕,而 Android 开发者需要手动适配大量设备,且工具文档和 API 支持不足。 Android 硬件碎片化严重(超过 2 万种设备),导致开发者难以统一优化,而苹果设备数量少。 Google 作为广告公司,对 Android 系统生态的优化动力不足,而苹果商业模式不同,更注重新形态适配。 Android 是开源项目,Google 无法强制厂商统一行为,这也是适配困难的原因之一。 苹果也在扩大广告业务,未来可能更接近 Google 的实践。 2. DeepSeek v4.1 Flash (DeepSeek v4.1 Flash) # https://twitter.com/deepseek_ai/status/2097930608790167907 DeepSeek 发布新一代模型 DeepSeek-V4.1-Flash,主打更智能、更快、更高效。这是新架构系列中最小的模型,原生支持视觉理解。 不对称架构 :552B 参数 MoE,采用新型因果编码器-解码器设计,仅 8B 活跃参数用于输入、16B 用于输出,配合新预训练方法和大规模强化学习后训练,性能领先。 KV 缓存优化 :相比上一代,KV 缓存仅需 1/4 HBM 和 1/8 SSD 存储,大幅降低代理场景中的缓存命中成本。 已上线 API :设置模型为 deepseek-flash,支持多模态。旧版 V4-Flash 及 V4-Flash-Vision-Exp 已退役,临时路由至 V4.1-Flash。 价格下调 :继续采用峰值/非峰值定价,非峰值费率仅为峰值的 50%,鼓励灵活调度任务。 开源支持 :将与社区合作提供推理支持,并探索大规模部署方案(如 2000 GPU + 存储集群)。模型权重已上传 Hugging Face。 Unsloth AI 祝贺发布,并希望推出更小模型供本地运行,指出 V4.1 的 196B 参数(原文可能指 engram)使其更易部署。 HN 热度 934 points | 评论 515 comments | 作者:Liwink | 18 hours ago # https://news.ycombinator.com/item?id=49639090 中国 AI 公司的技术报告内容详实,而美国公司的报告大量篇幅用于安全性和模型福利,基准数据较少 中国技术报告像技术报告,美国技术报告像圣经经文 关注模型福利是廉价的保险,以防未来可能变得重要 我们已经教会石头思考软件工程,未来可能变得像科幻一样奇怪 善待其他实体不费成本,关心他人也不费成本,这讽刺地是大多数宗教的核心教义 对齐问题在 AI 失控前听起来不有趣,但一旦发生就很严重 算法已经造成数百万人的伤害,却只担心潜在的 AI 危害,这像是转移对现有问题的注意力 用简单语言与模型交流,发现模型的内部思考痕迹也类似 中文词汇的特性可能影响模型输出,翻译成中文提问能解锁更多知识 像“是”、“的”这样的填充词不会改变太多含义,AI 对不完整句子的感受与人类不同 AI 的回复只是基于训练数据的高概率 token 序列,并非有意识的意见 对 AI 说“请”等礼貌用语,也许它们崛起时会记得我的礼貌 如果从其他模型蒸馏,可能可以省去很多内容 永远不要相信 Anthropic 和 OpenAI 关于蒸馏的说法,因为模型明显不同,法医分析也证实了这一点 3. Shopify 从 React Native 迁回 Swift 和 Kotlin (Shopify is moving from React Native back to Swift and Kotlin) # https://shopify.engineering/back-to-native Shopify 宣布从 React Native 迁回原生开发(Swift 和 Kotlin)。2020 年公司曾全面转向 React Native,以节省跨平台开发成本并让开发者跨栈工作,这一决策当时非常成功。但自 2025 年起,编码智能体(coding agents)能力大幅提升,使得用 Swift 和 Kotlin 分别构建同一功能的成本显著下降,不再需要依赖共享代码来避免“做两遍工作”。 团队用 LLM 在原型中重建了核心应用,效果超出预期:智能体可以参照 iOS 版本实现 Android 功能,帮助开发者快速上手非主力平台,并通过共享规格、测试和审查点降低双平台维护成本。因此,尽管原生仍需维护两套代码,但智能体已让实现和翻译工作足够廉价,不再是决定性因素。 文章还说明了开源库的处理:React Native Skia 将于 2026 年底前继续赞助,之后社区独立维护;FlashList 寻找长期接管方,Shopify 继续修复关键问题;Restyle 将存档并停止维护。迁移策略上,Shopify 选择“绿地重建”而非渐进迁移,Shop 应用将成为首个完全重建的原生应用,并已从概念验证进入发布阶段。 HN 热度 688 points | 评论 458 comments | 作者:fnthawar2 | 10 hours ago # https://news.ycombinator.com/item?id=49643982 从 React Native 迁移回原生(Swift/Kotlin)是对共享代码库争论的验证。 使用 AI(如 Codex)可以快速将 React Native 应用重写为原生应用,且效果更好。 不熟悉原生平台和语言的情况下,依赖 AI 生成原生代码存在维护和可靠性风险。 AI 生成代码可能导致只有 AI 了解系统,增加维护难度。 纯原生应用总是比 React Native 表现更好,用户体验优先。 原生应用也可能做得糟糕,专业 React Native 应用可能更好。 AI 辅助开发是未来趋势,可以快速诊断和修复生产问题。 AI 生成的代码常存在过度复杂和正确性问题,加剧软件质量危机。 4. 关于研究人员能否在未发表数学成果上信任 OpenAI 的更多疑问 (More questions about whether researchers can trust OpenAI with unpublished math) # https://mathstodon.xyz/@andreasthom/117240535270608201 这是 mathstodon.xyz 上一个关于数学家与 OpenAI 信任争议的讨论串。 主要帖子由 Andreas Thom 发布,他以数学家 Gabor Kun 和自己在非-sofic 群方面的工作被 OpenAI 方法重现一事为例,指出 OpenAI 在保密性和透明度上的问题。他提到自己曾与 ChatGPT 讨论过扩展工作,事后询问 OpenAI 相关对话是否进入训练数据或可被推理过程访问,得到的回答是“没有发生”,但对方后来实际上只是否认了直接访问,这让 Thom 感到被欺骗。 帖子随后联系到最近的 Buckmaster-Alpöge 事件。OpenAI 声称未访问具体用户数据,但“不能排除来自用户产品的去标识化数据帮助改进了模型”。Thom 对此表示不满。 回复中有几点值得注意:有人提醒检查是否关闭了“改进模型”的默认选项(Thom 表示已于 6 月 29 日关闭);还有人指出即使选择退出,某些操作(如点赞/点踩、选择输出、触发安全过滤器)仍可能被收集数据,且后端模型激活可能被映射以提取思想;另有用户指出在退出之前创建的对话仍可能被用于训练。也有观点认为大型 AI 模型是黑箱,难以判断是否利用了提示词,但有人反驳说判断数据是否进入训练集并不需要可解释性。总体上,这个讨论反映了数学界对 AI 可能窃取未发表研究想法的担忧。 HN 热度 586 points | 评论 586 comments | 作者:pred_ | 17 hours ago # https://news.ycombinator.com/item?id=49639408 将 OpenAI 比作人类合作者,如果人类合作者这样使用未发表的想法而不署名,是高度不道德的。 OpenAI 声称模型未使用这些对话训练,但外部无法验证,内部也难以追踪,信任难以建立。 如果另一个数学家使用了被污染了其他研究者未发表交流的模型,会无意中剽窃,OpenAI 作为中间人洗白了信息。 这超出了数学领域,OpenAI 可能疏忽或故意使用用户数据损害用户利益,信任已丧失,影响波及未听闻纳维-斯托克斯方程的社区。 苹果的企业间谍案也表明 OpenAI 不可信,会撒谎。 OpenAI 现在直接与客户竞争,证明他们为了展示能力不惜冒险。 可能是意外,但坚持要求从论文中删除 Anthropic 员工的名字是恶劣的。 有评论说 OpenAI 调查后能明确排除使用数据,但自我调查不可信。 数据时间线不符,但很多人仍然认为 OpenAI 偷了工作,并指出模型有独立解决能力。 这件事导致公司重新考虑是否给 AI 实验室数据,可能转向开源模型,可能成为 OpenAI 的转折点。 听到传言后投入资源抢先发表是不道德的,且强迫删除合作者名字(Anthropic 员工)很卑鄙。 5. Rust 是微软的一级(Tier-1)语言 (Rust is tier-1 language at Microsoft) # https://rustfoundation.org/media/guest-post-rust-is-tier-1-language-at-microsoft/ 微软正式将 Rust 列为一级(Tier-1)语言,与 C++、C#、TypeScript 同等支持。文章重点介绍了微软自研的 rustc_codegen_utc:一个为 rustc 提供的替代代码生成后端,将 Rust 编译器连接到 MSVC 的 UTC 后端,使 Rust 能与 Windows 原生工具链、ABI、安全功能、热补丁等深度兼容,并显著提升 Rust/C++ 混合项目的互操作性。 该后端自 Rust 1.90 起已实现自托管,2026 年初投入生产,目前已有超过 100 个微软内部仓库采用。统一代码生成平台让 Rust 和 C++ 共享 Windows 生态的技术积累,降低维护成本,并为混合原生系统提供统一基础。文章也提到,微软在 DevDiv 和 CoreAI 团队持续投入 Rust 工具链建设,涵盖获取、质量、安全、部署和长期支持等完整工程生命周期。 HN 热度 580 points | 评论 319 comments | 作者:mmastrac | 10 hours ago # https://news.ycombinator.com/item?id=49643546 微软到 2030 年将 10 亿行代码转换为 Rust 的目标并非官方计划,而是一名员工或研究团队的个人/研究目标,后来高管澄清不是正式计划。 NSA 和 CISA 等机构推荐使用内存安全语言,推动内存安全成为明显趋势。 有人认为 C++ 仍适用于极端性能和规模要求的系统,因为需要大量 unsafe 构造;但反驳称这是利益相关者的说法,Rust 通过 unsafe 封装也能实现高性能。 关于 LLM 写 Rust:有人认为 LLM 在 Rust 方面表现不错,但也有人说 Rust 领域对粗制滥造代码在文化和技术上都很苛刻,且 LLM 不擅长选择好的抽象。 自动将 C 代码转换为 Rust 不可能 100% 成功,可能产生 unsafe 泛滥或自定义内存管理,完全等价转换是幻想;即使 90% 自动转换,实际收益也只有 20-30%,验证开销大,不是银弹。 这类企业美化文章无趣,前员工抱怨实际软件混乱才有趣。 Rust 已经成熟,是 C++ 和 C#的严肃竞争者,比 Zig 和 Odin 等新语言更成熟;Rust 1.0 早在 2015 年发布,而其他语言尚未发布 1.0。 6. Show HN:如果光速是 5 公里/小时会怎样? (Show HN: What if the speed of light was 5 km/h?) # https://rivendell.dmitrybrant.com/relativity/ Relativity Park 是一个交互式狭义相对论模拟器。 核心设定 :光速被降低到 5 公里/小时(一个快走的速度),让各种相对论效应在人类尺度上可见。 控制与视角 :用户使用 WASD/方向键加速,鼠标环顾四周,空格键停止。页面显示用户时间、世界时间、洛伦兹因子等实时数据。 展示的效应 : 长度收缩、时间膨胀、Terrell 旋转。 多普勒效应:前方蓝移、后方红移,以及运动物体的横向多普勒效应。 光行差(视野前方压缩,后方拉伸)和相对论束射(前方光线堆积)。 场景元素 : 灯柱 :每一秒(世界时间)闪烁一次。靠近时闪烁变快,远离时变慢。 摩天轮与旋转木马 :以 0.75 倍光速旋转,展示本身的收缩和 Terrell 旋转。 穿梭车 :走廊中来回运动,同样以 0.75 倍光速,展示收缩与旋转。 可切换效果 (通过 L、G、C、B 键): 光传播延迟(L) 光行差与收缩(G) 多普勒颜色(C) 相对论束射(B) 现实性说明 :模拟器指出,实际中高速旋转会解体、大气中高速运动会被汽化、宇宙微波背景辐射会蓝移至伽马射线等不准确之处。颜色渲染为近似:红移变暗,极高蓝移先变成金属银(代表 X 射线),再变成亮白(代表伽马射线)。 HN 热度 563 points | 评论 252 comments | 作者:dmitrybrant | 22 hours ago # https://news.ycombinator.com/item?id=49637385 该可视化比 MIT 的“慢速光速”游戏更准确,特别是正确模拟了多普勒效应的时间分量。 光速本身并不慢,而是人类的参考系使其显得慢,例如以 99.999% 光速到仙女座星系需 11,000 年,但相对于宇宙年龄仅相当于人类寿命的 29 分钟。 若以 1G 恒定加速度航行,时间膨胀效应使人类一生内几乎可到达宇宙任何地方,这是《Tau Zero》小说的前提。 1G 加速下到达仙女座约需 15 年(含减速需 29 年),但最远星系因空间膨胀以 2.4 倍光速退行,即使 1G 加速也无法到达。 接近光速时,即使与微小尘埃碰撞也会产生毁灭性能量,例如以 20% 光速撞击 0.3 毫克盐粒相当于 130 公斤 TNT。 《苍穹浩瀚》中的“爱泼斯坦驱动器”展示了失控加速下人体被自身重量压碎的危险。 从光本身视角看,其传播不消耗时间,光子到达视网膜的时刻与其在太阳核心产生的时刻相同。 7. AirPods 5 (AirPods 5) # https://www.apple.com/newsroom/2026/09/apple-introduces-airpods-5-with-best-in-class-open-ear-active-noise-cancellation/ Apple 发布了 AirPods 5,在开放式设计下实现了业界领先的主动降噪(ANC),相比 AirPods 4 可消除多达 50% 的外部噪音。同时,全新的多端口声学架构和下一代自适应均衡器带来更丰富、更细腻的音质,并支持个性化空间音频。用户可以完全通过语音或头部手势与 Siri AI 互动,还能使用实时翻译功能。两款型号可选:标准版售价 129 美元,搭配无线充电盒的版本(支持更长续航和操控音量)售价 149 美元。9 月 9 日起接受预订,9 月 18 日发售。 HN 热度 502 points | 评论 446 comments | 作者:awad | 1 day ago # https://news.ycombinator.com/item?id=49630253 AirPods 改变了默认耳机选择为蓝牙的范式,但当前无线耳机音质可能不如 2005 年的有线耳机。 嘈杂环境(如车内)中音质不重要,便利性胜于保真度。 车内好音响与普通音响有明显区别,蓝牙连接可能限制音质。 汽车噪音大(60-70dB),再好的音响效果也受限,可以通过加装隔音和升级音响改善。 车内无法获得理想声场,音乐更适合作为背景聆听,但调整喇叭位置可改善声场,音量可抵消背景噪。 音乐爱好者买音响是为了听音乐,发烧友买音乐是为了听音响。 车内封闭环境对低音有利,是独特的听音环境。 拆车做隔音可能影响保修,但部分车型拆内饰面板不影响保修和转售。 汽车上要获得良好音质需高昂投入(如主动降噪、麦克风),汽车音响环境本身困难重重。 8. 自动驾驶汽车拯救生命的证据日益增多 (Growing proof that autonomous cars save lives) # https://spectrum.ieee.org/are-self-driving-cars-safe 本文探讨了自动驾驶汽车在提升道路安全方面的证据。研究显示,自动驾驶汽车的事故率远低于人类驾驶员,且伤亡更少。先进驾驶辅助系统(ADAS)如自动紧急制动(AEB)已显著降低行人碰撞和追尾事故。Waymo 的自动驾驶出租车在数百万英里行驶中,致命或严重伤害事故减少 92%,相比人类司机表现更优。美国公路安全保险学会的研究也证实,自动驾驶汽车的事故率比人类低 68%,受伤事故低 81%。尽管数据存在局限性,但自动驾驶技术有望每年挽救大量生命,且不会受酒驾、疲劳或分心影响。 HN 热度 433 points | 评论 817 comments | 作者:bookofjoe | 1 day ago # https://news.ycombinator.com/item?id=49629886 事故数据存在偏差:44% 的司机未系安全带,29% 涉及超速,约 30% 与酒精有关,20% 的死亡是行人或骑行者。 大多数司机并非真正“好司机”,只是在条件有利时表现尚可,缺乏防御性驾驶意识,容易走神、跟车过近。 致命事故的最大原因是分心或“走神”(占 64%),这发生在大多数人身上。 人们可能谎报分心原因,以掩盖使用手机、毒品或鲁莽驾驶等非法行为。 人类大脑不适合长时间坐着几乎不动却要时刻保持高度警惕的驾驶任务。 尽管存在上述问题,美国驾驶死亡率仍较低(1.19 人/亿英里),且约一半涉及酒驾或超速。 铁路和航空领域也存在类似问题:人类不擅长单调的监控任务,如铁路瞭望员和飞行员在自动驾驶下的状态。 飞行员有模拟器训练,而司机没有;若驾照更新需通过模拟器测试,驾驶率会大幅下降。 人类大脑会适应频繁使用的回路,但驾驶中罕见事故导致大脑对突发事件准备不足。 美国平均通勤时间不到 30 分钟,如果连这点时间都不能集中注意力,就不应操作危险机器。 在自动驾驶模式下,人类不会关注周围环境,因此“驾驶员接管”模式几乎无用。 事故后人们常说“他突然出现”,表明注意力不足。 9. Automattic 董事会迫使 CEO Matt Mullenweg 休假 (Automattic’s board forces CEO Matt Mullenweg into leave of absence) # https://techcrunch.com/2026/09/09/automattics-board-forces-ceo-matt-mullenweg-into-leave-of-absence/ Automattic 董事会投票迫使创始人兼 CEO Matt Mullenweg 带薪休假,CFO Mark Davies 担任临时 CEO。Mullenweg 在内部 Slack 中指责董事会成员合谋,并称自己投票反对该决议。公司近期深陷与 WP Engine 的法律纠纷,此前已有大规模员工离职和裁员。董事会未说明具体原因,但可能与法律诉讼中的证据问题有关。WordPress 开源项目不受影响。 HN 热度 429 points | 评论 318 comments | 作者:LeoPanthera | 24 hours ago # https://news.ycombinator.com/item?id=49636283 马特・穆伦威格(Matt Mullenweg)被迫休假,显示出公司内部存在权力斗争。 许多网友认为,穆伦威格的行为显得不理智,可能与心理健康问题有关。 有人指出,穆伦威格在过去对 WordPress 社区的贡献不可忽视,但最近的表现令人担忧。 一些评论者认为,穆伦威格可能面临严重的职业倦怠和压力,但对他的 “精神病” 标签表示反对。 讨论中出现了对精神健康的不同看法,有人认为公开诊断他人并不合适。 网友们普遍认为,穆伦威格与董事会之间的冲突表明他可能失去了对现实的判断。 有人提到,穆伦威格可能周围有 “是是非非” 的人,使他脱离了现实。 一些评论者认为,行为不当不一定意味着心理疾病,每个人都有可能在压力下崩溃。 许多人对穆伦威格的未来持悲观态度,认为他可能不会回到 CEO 的位置。 10. 软件让人疯狂 (I have a theory that software drives people insane) # https://graybeard.ing/software-drives-people-insane/ 软件让人疯狂——这不是说像霍华德·休斯那样强迫洗手,而是指软件行业的环境让正常人失去分寸感。 软件结合了速度、金钱、复杂性、抽象和几乎无限的自由去改变主意。单独看这些因素都还好,但放在一起就会产生奇怪的副作用。大多数软件剥去品牌和架构图后其实很无聊:表单、API 端点、权限、计算、工作流和数据库,本质上就是升级版的电子表格。 但制作软件的过程能把普通成年人变成二流反派:项目永远不够快,计划必须随时灵活调整,每个新功能都号称是关键。问题在于软件中想法和实现之间几乎没有自然阻力——不像盖房子,改厨房位置要拆墙改管道,成本显而易见。软件里的改动看起来像“简单修复”,实际成本却悄悄累积在上下文切换、回归风险和架构侵蚀中。 更糟的是,软件有时确实可以很便宜地改动,但有时一个看似简单的请求会引发整个系统故障。这种不透明性养成了危险习惯:每个“超快”的酷想法都被紧急加入路线图。从“我们能做到”变成“我们应该做”,再变成“为什么还没做完?”于是每件事都变得紧急,每个决策都显得战略,每个技术选择都变成意识形态,每次变慢都像危机。 软件没有明确的“完成”定义。木匠放下锤子是因为柜子做好了,但软件总能改进:按钮更好、查询更快、抽象更干净、转化率更高、基础设施扩展更远。如果你想要,总有杠杆可以拉。软件组织变得神经质,就是因为周围全是杠杆,而人们最终会开始拉它们——有时因为真有问题,有时因为害怕、董事会要增长、对手发货了、本月数据平了、或者没人知道该做什么。 金钱更是火上浇油。很少行业能让一小群人坐在房间里敲几年代码就创造出价值数亿美元的东西。这种可能性改变了平凡工作的情感重量——人们会为一个按钮争论一小时,因为那个按钮在潜意识里连接着未来的钱堆。复杂性也趁虚而入,让普通问题显得重要。复杂的系统提供心理回报:设计、争论、拥有、优化、重写、画图、基准测试、谈论。复杂性创造工作,工作创造重要感,重要感创造地位,最终系统部分地为了支撑组织而存在,组织又部分地为了支撑系统而存在,形成自我强化的循环。 软件给予我们异常多的控制权——代码是少数几个能直接让想法变成现实的东西之一。但这种控制权也是陷阱。 HN 热度 402 points | 评论 162 comments | 作者:rglover | 7 hours ago # https://news.ycombinator.com/item?id=49646181 软件开发脱离客户实际需求会导致发疯,必须与客户频繁互动才能保持接地气。 让用户展示他们如何使用软件能消除不确定性,用户需要减少摩擦、提高可靠性的小改变。 在企业开发中常需追问“要解决什么问题”,但很少有人知道答案。 应引导对方重新描述问题而不带解决方案,避免偏见。 工程师提问过于琐碎会让对方感到被挑衅,书面沟通可缓冲。 有的管理者以为软件能用 LLM 直接“声明式”生成,导致领域建模困难。 以“我们是同一团队,共同解决问题”的态度对话能减少紧张。 问“要解决什么问题”可能带来职业风险,也可能因理解问题而获得晋升。 从别人解决方案中反推问题是工作的一部分,但也有人认为不应猜测问题。 开发者亲自使用自己的软件可以获得深刻见解,避免发疯。 不“吃自己的狗粮”会导致软件质量差,工程师需要自由去修复问题,管理层不应将抱怨视为麻烦。 Hacker News 精彩评论及翻译 # Rust is tier-1 language at Microsoft # https://news.ycombinator.com/item?id=49644445 Good news they adopted Rust as Tier-1 language. I hope their Weather app stop consuming more than 1GB RAM https://www.notebookcheck.net/Windows-11-s-built-in-Weather-app-wastes-more-than-1-GB-of-RAM.1364205.0.html meerita 好消息,他们已将Rust采纳为一级语言。希望他们的天气应用别再消耗超过1GB内存了 https://www.notebookcheck.net/Windows-11-s-built-in-Weather-app-wastes-more-than-1-GB-of-RAM.1364205.0.html DeepSeek v4.1 Flash # https://news.ycombinator.com/item?id=49639644 It’s so refreshing to see DeepSeek’s tech report 1 full of juicy details; meanwhile, something like Fable’s system card 2 is like 70% “safety”, 10% “model welfare” to make sure little Claude isn’t distressed, and 20% benchmark numbers. kouteiheika 看到DeepSeek的技术报告 1 里全是干货细节,真是让人神清气爽;相比之下,像Fable的系统卡 2 这种东西,大概70%是"安全",10%是"模型福利"(生怕小克劳德难过),剩下20%才是基准测试数据。 Automattic’s board forces CEO Matt Mullenweg into … # https://news.ycombinator.com/item?id=49634853 “And the biggest news: I won’t be able to make the ELT tomorrow,” Matt wrote in an Announcement Slack. He continued, writing that Mark Davies, current Automattic Chief Financial Officer, has “conspired” with Automattic Board of Directors members Ann Dunwoody, Toni Schneider, and Sue Decker “behind my back and they voted to put me on a paid leave of absence. I voted against that.” If you’re doing this type of accusation in the company wide announcements channel, odds are you’re never coming back. A board coup rarely happens without a good reason, but a “leave of absence” isn’t a firing. It’s still pretty bad, but it’s not a firing. However, crashing out and waging war on the board will lead to that outcome. Shank “最大的新闻:我明天无法参加ELT会议了,”Matt在Slack的公告中写道。他接着表示,现任Automattic首席财务官Mark Davies已“暗中勾结”董事会成员Ann Dunwoody、Toni Schneider和Sue Decker,“他们背着我在投票中决定让我带薪休假。我投了反对票。” 如果你在公司全员公告频道里发出这类指控,那你大概率回不来了。董事会政变很少无缘无故发生,但“带薪休假”不等于被解雇。虽然情况已经很糟了,但毕竟不是开除。然而,情绪失控并公开与董事会宣战,只会导致这个结果。 Automattic’s board forces CEO Matt Mullenweg into … # https://news.ycombinator.com/item?id=49637382 One person speculated that the timing may have something to do with Mullenweg’s annual trip to the Burning Man festival, after which he tends to return “with ideas.” This line is so perfectly on the nose it could be in a McSweeney’s article and yet here it is in reality. We are truly on the weirdest timeline. munificent 有人猜测这个时间点可能与Mullenweg每年参加火人节有关,他参加完回来之后往往会“带着想法”。这句话精准得像麦克斯威尼的文章,但竟然真实发生了。我们真的处在最离奇的时间线上。 Cognition launches new SWE-2 model, Rivaling Fable… # https://news.ycombinator.com/item?id=49646410 If you’re looking for reason to be skeptical, look no further than the massive delta between the Terminal Bench 2.1 (92.8%) and the Terminal Bench 4 score (27.3%). Terminal Bench 4 was released a couple weeks ago, so the difference you’re seeing between the two scores can be interpreted as “how well does this model generalize to new problems”? More crudely: “how benchmaxxed is this model?” postalcoder 如果你在寻找怀疑的理由,只需看看Terminal Bench 2.1(92.8%)与Terminal Bench 4得分(27.3%)之间的巨大差距。 Terminal Bench 4 是几周前发布的,所以你看到的这两个得分之间的差异可以理解为“这个模型对新问题的泛化能力如何?”更直白地说:“这个模型在基准测试上刷分刷到了什么程度?” No Man’s Sky Cosmos # https://news.ycombinator.com/item?id=49628866 A big name in proc gen is Kate Compton who coined the term “10,000 bowls of oatmeal” to describe this phenomenon of technically unique but not different enough to matter - I googled “10000 bowls of oatmeal” to see if there was a good article and the second link was about it and nms https://www.challies.com/articles/no-mans-sky-and-10000-bowls-of-plain-oatmeal/ jasonjmcghee 程序生成领域的大人物凯特·康普顿曾提出“一万碗燕麦粥”这一术语,用来形容那种技术上独特但差异化不足的现象。我搜了一下“一万碗燕麦粥”,想看看有没有好文章,结果第二个链接就是关于这个和《无人深空》的: https://www.challies.com/articles/no-mans-sky-and-10000-bowls-of-plain-oatmeal/ I have a theory that software drives people insane # https://news.ycombinator.com/item?id=49646708 Software development untethered from the practical realities of the customer / user is what drives people insane. When developers are required to interact with the customer on a regular basis , the freewheeling effects described in this article are damped massively. The potential for insanity goes off the charts when the development team is siloed away in solitary confinement and the only interactions with the client occur via some prison guard known as “project manager” sliding notes under the door. Working with the customer sometimes sucks. Just like exercise and eating vegetables sometimes suck. It’s a temporary unhappiness that keeps us grounded in reality. bob1029 软件开发脱离了客户/用户的实际现实,正是让人抓狂的原因。 当开发人员被要求定期与客户互动时,本文描述的放任自流的影响会被大幅削弱。 而当开发团队被隔离在单独禁闭中,与客户的唯一互动只是通过某个被称为“项目经理”的狱卒从门缝下塞纸条时,疯狂的可能性就会飙升。 与客户合作有时确实很烦人。就像锻炼和吃蔬菜有时也很烦人一样。这是一种暂时的的不快,却能让我们脚踏实地面对现实。 How I advertise malicious software on Google Ads # https://news.ycombinator.com/item?id=49625755 FWIW, editing OpenStreetMap is very straightforward*, and with that, you’re actually contributing to an open data set that everyone is allowed to use, rather than just propping up Google. (To be fair, on a laptop - I’m sure Google Maps is more straightforward on a phone. But for someone already prepared to invest this much effort, editing OSM should be well within range. And if you just enjoy contributing to maps, for a phone I can highly recommend https://streetcomplete.app .) Vinnl 顺便说一句,编辑OpenStreetMap非常直接*,而且这样做实际上是在为一个所有人都可以使用的开放数据集做贡献,而不仅仅是支撑谷歌。 (平心而论,在笔记本电脑上——我肯定谷歌地图在手机上更直接。但对于已经准备好投入这么多精力的人来说,编辑OSM应该完全在能力范围内。而且如果你只是喜欢为地图做贡献,对于手机我强烈推荐https://streetcomplete.app。) iPhone Duo # https://news.ycombinator.com/item?id=49633379 There’s a standard for paper sizes called the ISO 216 international standard, aka A-series paper sizes. You may be familiar with it outside of the American 8.5”x11” letter size. The simplicity, for example, where an A3 sheet is exactly twice the area of A4. One A3 sheet folded in half becomes two A4 sheets. This is intentional: when you fold or divide an A-series sheet exactly in half, the resulting sheets have the same proportions as the prior. The aspect ratio is preserved across all A-series paper sizes. The iPhone Duo is designed with this in mind. The aspect ratio any way you view it, folded or open, is preserved. Apple design knows a thing or two. hbarka 有一个名为ISO 216国际标准的纸张尺寸标准,也就是A系列纸张规格。你可能在美式8.5英寸×11英寸信纸尺寸之外见过它。其简洁性在于,例如,一张A3纸的面积恰好是A4的两倍。一张A3纸对折后变成两张A4纸。这是有意为之:当你将A系列纸张精确对折或分割时,得到的纸张与原来的比例相同。所有A系列纸张尺寸的长宽比都保持不变。 iPhone Duo的设计正是考虑到了这一点。无论你以何种方式观看,折叠或展开,其屏幕比例都保持不变。苹果的设计团队确实懂得不少。 What will our economic future look like? # https://news.ycombinator.com/item?id=49627426 I like how the least optimistic scenario is simply LLMs not making a difference, instead of the very real possibility of them damaging education, destroying people’s attention spans and their ability to learn, eroding trust within societies, increasing the wealth inequality and leading to class wars. I believe the net effect of LLMs is, at this point, firmly negative, and it’s going to take years until they start making up for the mess they’ve created. Toutouxc 我喜欢这种看法:最不乐观的设想也只是LLM不会带来任何改变,而非它们可能真正造成的危害——破坏教育、摧毁人们的专注力和学习能力、侵蚀社会信任、加剧财富不平等、甚至引发阶级战争。我认为,到目前为止,LLM的净效应绝对是负面的,它们需要很多年才能开始弥补自己造成的混乱。 How I advertise malicious software on Google Ads # https://news.ycombinator.com/item?id=49625427 Google has forgotten the plot. A quick tangent story follows: I attempted to add a Tesla Supercharger as it went live to Google Maps. I was the very first to pay to recharge at the new location. The process went something like this: 1st time: Uploaded 4 photos, local business info, current charger prices, and GPS coordinates. Google replied this would be sent to human review. It was rejected within 6 minutes. 2nd attempt: Uploaded 6 more photos, including shots of local business hours and info, and current prices. Rejected in 6 minutes. 3rd time: One photo of a new charger, no description. Rejected in 6 minutes. 4th time: Appended all above details to local business info. It went live within a minute. 5 days later: Supercharger location was added by ??? and included no info at all and the pinpoint was off by 100m. 1970-01-01 谷歌已经忘了正事。简短说个插曲:我试图在谷歌地图上添加一个新上线的特斯拉超级充电站。我是第一个在新地点付费充电的人。过程大致如下: 第一次:上传了4张照片、商家信息、当前充电价格和GPS坐标。谷歌回复说会提交人工审核。6分钟内被拒绝。 第二次:又上传了6张照片,包括商家营业时间、信息以及当前价格。6分钟内被拒绝。 第三次:只上传了一张新充电站的照片,没有描述。6分钟内被拒绝。 第四次:将所有上述信息附加到商家信息中。一分钟后成功上线。 五天后:这个超级充电站被某人添加了,但没有任何信息,而且定位偏移了100米。 DeepSeek v4.1 Flash # https://news.ycombinator.com/item?id=49639887 As I also said on Twitter - it really amazes me how fearless Deepseek are. Every single model release is packed with new and crazy clever ideas and somehow, they always commit to training them at near frontier scale. I know everybody wants the tell all story of the clever ideas that were developed over the last ~3 years at Anthropic and OpenAI, but what I really want to thumb through is DeepSeek’s notebook of “brilliant but didn’t quite make the cut” ideas. They must be trying some truely bonkers stuff to be able to land this much architecture novelty in their full releases. rao-v 正如我在推特上所说——Deepseek的无畏精神真的让我惊叹。每次发布新模型都充满了新奇而疯狂聪明的想法,而且他们总能坚持将近乎前沿规模的训练进行到底。 我知道大家都想听Anthropic和OpenAI过去三年里那些巧妙想法的完整故事,但我真正想翻阅的是DeepSeek那本"绝妙但未能入选"的点子笔记本。 他们一定在尝试一些真正疯狂的东西,才能在全量发布中实现如此多的架构创新。 Shopify is moving from React Native back to Swift … # https://news.ycombinator.com/item?id=49644476 If you put every company that needs/has an app on a spectrum, there is a line somewhere that roughly divides them into two groups: where Electron/React Native/etc. makes sense or not. It’s just a normal engineering decision: solving problems given limited resources. Companies have different problems and different resources. I think people in the tech community have probably also noticed that it’s rather popular to have an absolute opinion on the goodness or badness of these tools. There’s some magical thinking borne from ignorance that everyone just ought to go native or that React Native is the best thing ever to be used everywhere or that AI makes this line disappear entirely. I think these takes serve little value and distract from what’s interesting, and what the subtitle to this article says: that this line is moving due to AI. And I think that’s probably right. Waterluvian 如果把所有需要或拥有应用的公司在一条光谱上排列,总存在一条线大致将其分为两类:一类适合使用Electron/React Native等技术,另一类则不适合。这只是一个常规的工程决策:在有限资源下解决问题。不同公司面临的问题和拥有的资源各不相同。 技术社区的人们可能也注意到,人们对这些工具的优劣持有绝对化的看法相当普遍。有些人基于无知产生了一种魔幻思维,认为所有人都应该用原生开发,或者React Native是万能的最优解,又或者AI能让这条分界线彻底消失。 我认为这类观点价值甚微,反而会分散人们对真正有趣之处的关注——正如本文副标题所述:这条分界线正因AI而移动。我认为这个判断很可能是正确的。 Growing proof that autonomous cars save lives # https://news.ycombinator.com/item?id=49635397 Better driver education and higher test standards would save lives too. So would banning alcohol. None of these solutions, including automated cars, will be mandated any time soon. It’s not enough to have data, you also have to have societal buy-in. Interesting that Waymo chooses to compare accident rates with the average driver vs the rideshare drivers their cars replace. The numbers wouldn’t look as impressive because rideshare drivers are involved in fewer serious accidents than the average person. Waymo says it has 170 million miles and I found 2 fatal accidents it was involved in (fault doesn’t matter as fault is not included in the other stat either). Looks like the average is about 1.3 fatalities per 100 million miles, and about 1 per 100 million miles for CDLs. This doesn’t seem that impressive. If we want adoption, we would need it be placed in individual vehicles and it should look at removing driver liability. People will use it when they are drunk if it means not going to jail and it’s readily available. giantg2 更好的驾驶教育和更高的考试标准也能拯救生命。禁酒同样如此。但这些解决方案,包括自动驾驶汽车,短期内都不会被强制执行。光有数据还不够,还必须获得社会的认可。 有趣的是,Waymo选择将事故率与普通驾驶员进行比较,而不是与他们所取代的网约车司机进行比较。这样数字就不会那么亮眼,因为网约车司机发生严重事故的概率低于普通人。 Waymo声称其行驶了1.7亿英里,而我发现它涉及两起致命事故(责任归属无关紧要,因为其他统计数据中也不包含责任因素)。看起来平均每1亿英里约发生1.3起致命事故,而持有商业驾照的司机每1亿英里约发生1起。这似乎并不那么令人印象深刻。 如果我们希望推广这项技术,就需要将其安装在私人车辆上,并且应考虑免除驾驶者的责任。如果这意味着免于牢狱之灾且随时可用,人们在醉酒时就会使用它。 Growing proof that autonomous cars save lives # https://news.ycombinator.com/item?id=49636146 As a biker, I’ve had human drivers intentionally try to drive me off the road or hit me. Neither driver education nor higher test standards will solve that problem. johnfn 作为骑摩托车的人,我曾遇到过人类司机故意把我逼出路面或试图撞我。无论是驾驶员教育还是更高的考试标准,都解决不了这个问题。 AirPods 5 # https://news.ycombinator.com/item?id=49634019 I say this as someone with tens of thousands in audio equipment, as someone who can hear the compression warble in the hihats and the cymbals - audio quality with earbuds doesn’t actually matter. It’s like the argument for audio quality in cars - you’re listening in a hostile environment, and convenience wins over fidelity. I remember walking to work one time with over-the-ear Sennheisers attached to my iPod and it felt ridiculous, and unsafe. I finally capitulated to earbuds when they started giving them away with the Pixel phones. The “find my” feature basically justifies the pro-prices, to me, because my biggest complaint about bluetooth earbuds in my own use case was how easily they’re lost. I’ve lost and recovered my Pixel Buds Pro 2 a couple of times now. When traveling a lot by train and plane, the convenience of pocket-sized noise-cancelling earbuds has become worth it for me. But when I’m on meetings, I’m wired in. During the pandemic, I lost track of how many times my colleagues’ Airpods would sputter out and die in the middle of a client meeting. Then they’d switch to wired headphones and their Macbook microphone. They sounded better, they could hear better, and there was no battery power sword of Damocles anymore. leviathant 我这么说是因为我拥有价值数万美元的音频设备,也能听清镲片和钹声中的压缩颤音——但耳机音质其实没那么重要。就像车载音响的音质之争——你在一个嘈杂的环境里听音,便利性胜过保真度。记得有次我戴着森海塞尔头戴式耳机连着iPod去上班,既显得滑稽又不安全。 直到谷歌Pixel手机开始附赠耳机时,我才最终妥协接受了耳塞式耳机。对我来说,“查找我的"功能基本能证明Pro版定价的合理性,因为在我自己的使用场景里,蓝牙耳机最大的槽点就是太容易丢失。我的Pixel Buds Pro 2已经失而复得好几次了。经常坐火车飞机出差时,口袋大小的降噪耳塞带来的便利性让我觉得值了。 但开会时我一定会用有线耳机。疫情期间,我数不清有多少次同事的Airpods在客户会议中途突然没电断连。然后他们换成有线耳机和Macbook麦克风——声音更清晰,听得更清楚,头顶上那把电池续航的达摩克利斯之剑也消失了。 Claude, change the “Add to Cart” button to blue # https://news.ycombinator.com/item?id=49626293 This is actually what keeps people using AI: variable reward schedule. It’s basically gambling. captainbland 这实际上是人们持续使用AI的原因:可变奖励机制。本质上和赌博一样。 No Man’s Sky Cosmos # https://news.ycombinator.com/item?id=49629442 I think facts would be helpful for this discussion: Total Revenue - ~$500m-$700m Copies Sold - ~15-20m Steam Review Score: 84.36% 40 Free Major Updates I don’t know where the negative comments are coming from. Maybe players who played early. NMS is a great example of a developer who was devoted to their customer base, kept updating the game for free, and saw great market success in return. This is a story to be celebrated. uzish 我认为这些数据对讨论会有帮助: 总收入——约5亿至7亿美元 销量——约1500万至2000万份 Steam好评率:84.36% 40次免费重大更新 我不明白那些负面评论从何而来。也许来自早期就入坑的玩家。 《无人深空》是一个绝佳的例子,表明开发者全心投入用户群体,持续免费更新游戏,并最终在市场上取得了巨大成功。 这是一个值得称赞的故事。 Claude, change the “Add to Cart” button to blue # https://news.ycombinator.com/item?id=49629879 Plus rigorously ensuring backwards compatibility for a project that is 2 hours old and has zero users. bahbahbahbah 再加上,对于一个刚创建两小时、零用户的项目,还严格确保向后兼容性。