今天HackerNews热点不少:ADB限制争议、莱拉瓦蒂奖得主、Claude Opus 5登顶、Postgres性能测试,干货满满。
Google拟限制ADB仅绑定无线网卡,将破坏Shizuku等本地调试工具,引发开发者强烈反对。汉娜·弗莱因数学普及荣获2026年莱拉瓦蒂奖。Claude Opus 5在Artificial Analysis智能排行榜暂居第一,但单一排名对实际选型指导有限。实验证明Postgres的LISTEN/NOTIFY可轻松达到每秒6万条通知,瓶颈在硬件而非数据库。
2026 07 26 HackerNews
2026-07-26 Hacker News Top Stories # Google 拟限制 ADB 仅绑定无线网卡,将破坏 Shizuku 等本地调试用例,引发开发者强烈反对。 汉娜·弗莱因将数学魅力传递给公众的杰出贡献,荣获国际数学联盟颁发的莱拉瓦蒂奖。 Claude Opus 5 在 Artificial Analysis 智能排行榜暂居第一,但单一排名对实际选型指导有限。 实验证明 Postgres 的 LISTEN/NOTIFY 可轻松达到每秒 6 万条通知,瓶颈在硬件而非数据库。 Taylor Farms 曾致电白宫试图推迟环孢子虫召回,引发对食安监管和政治干预的担忧。 开放权重模型正像 Kubernetes 取代 Mesosphere 那样重塑 AI 格局,禁令将损害而非保护美国。 BitChat 利用蓝牙 Mesh 和 Nostr 实现离线去中心化通信,已在抗议活动中使用并遭 GitHub 下架。 ARC-AGI 排行榜上 Claude Opus 5 表现亮眼,但被怀疑训练数据泄露导致基准测试被记忆。 数学家哀叹 AI 正在剥夺发现的喜悦与神圣感,技术开发者被呼吁正视这种精神失落。 MouthPad 是定制的口腔触摸板,用舌头免提操控设备,面向双手被占用或辅助需求用户。 1. Android 可能很快会限制设备上的 ADB (Android May Soon Restrict On-Device ADB) # https://kitsumed.github.io/blog/posts/android-may-soon-restrict-on-device-adb/ Android 可能很快会限制设备上的 ADB 本地回环连接,这一变化将影响 Shizuku、libadb 以及众多开发者和高级用户的开源工具生态。 作者 Kitsumed 在博客中详细解释了 ADB(Android 调试桥)及“设备上的 ADB”(On-Device ADB)的概念——即在手机本地通过回环地址运行 ADB 客户端连接自身守护进程,这是 Shizuku 等工具的基础。Google 的一位 ADB 核心维护者在 IssueTracker 中提议将 ADB 守护进程的绑定限制为仅无线网卡(wlan0),声称这是为了防止恶意应用通过本地 ADB 套接字提升权限。但作者指出,这一做法会破坏合法用例:包括开发者直接在 Termux 中使用 ADB、基于以太网或 VPN 的调试,以及依赖回环 ADB 的无障碍工具(如作者自己的通话录音应用)。作者呼吁受影响用户提供有建设性的反馈,避免低质量刷屏,并认为存在更好的替代方案。 HN 热度 862 points | 评论 405 comments | 作者:shscs911 | 17 hours ago # https://news.ycombinator.com/item?id=49045159 此攻击需要用户已开启开发者选项和远程 ADB,对绝大多数用户不现实,怀疑是为阻止 Shizuku 等工具而找的借口。 安全已成为软件领域的祸害,过度安全措施(2FA、频繁登出、沙箱、OAuth、VPN 封禁等)牺牲了便利、隐私和开放性。 衡量安全措施是否合理的简单启发式:是否为开放标准且可无许可实现(如 TOTP),否则往往是愚蠢或欺诈。 安全不是无条件的善,而是控制工具,关键看谁在实施、维护谁的利益、针对谁;很多措施旨在保护第三方利益而限制设备所有者。 安全与实用性相冲突:越安全功能越少,浪费用户时间和生命,安全最大化主义者在推销不可能实现的谎言。 安全常被用作供应商锁定和反用户行为的借口,就像 AI 被用作裁员的借口。 不要忘记“记住 30 天”复选框往往无效。 这一切归结为政府想从公民那里获得安全,企业想从客户那里获得安全。 2. 汉娜·弗莱因数学普及荣获 2026 年莱拉瓦蒂奖 (Hannah Fry Wins the Leelavati Prize in 2026 for Mathematics Outreach) # https://www.maths.cam.ac.uk/features/professor-hannah-fry-wins-leelavati-prize 剑桥大学数学系教授汉娜·弗莱(Hannah Fry)荣获莱拉瓦蒂奖(Leelavati Prize),该奖项由国际数学联盟颁发,旨在表彰她在数学普及方面的杰出贡献。弗莱教授通过著作、广播节目、公开演讲及纪录片,成功将数学的魅力传递给全球公众,成为该奖项历史上首位英国获奖者。 HN 热度 558 points | 评论 99 comments | 作者:agnishom | 22 hours ago # https://news.ycombinator.com/item?id=49043724 Hannah Fry 获得 2026 年 Leelavati 奖当之无愧,她 2018 年的节目"Contagion"用蓝牙模拟病毒传播,精准预测了后来英国新冠疫情爆发的城镇 选择 Haslemere 小镇是因为预算有限,工作人员可以睡在亲戚家 节目使用蓝牙追踪传播,与后来 NHS 应用原理相似,这是流行病学科学的直接应用而非预言 蓝牙接触追踪的技术雏形来自 2010 年的 FluPhone 项目,流行病学的隔离、接触追踪、社交距离早已存在 比尔·盖茨在 2015 年 TED 演讲和 2019 年 Event 201 演练也预测了类似大流行 英国首例确诊病例在约克,Haslemere 可能是英国境内第一例本土传播 Hannah Fry 从 Numberphile 节目走入公众视野,是出色的数学和科学传播者 她的 TED 演讲《爱的数学》广受好评,与 Michael Stevens 的互动也很有趣 她的热情具有感染力(contagious) 她曾受邀为内部会议做算法主题演讲,是最佳外部讲者之一,兼具专业深度和沟通能力 她未进入剑桥本科但后来成为剑桥数学教授,是励志案例(注:UCL 也是一流大学) 新冠疫情让人学会:政府用“两周封锁”实际拖成六个月;审查被看作必要;反对者遭个人攻击;趁机推行数字 ID 和居家办公等长期想实施的政策 最难熬的是 5 天封锁的前 10 周(讽刺语气) 3. Opus 5 目前在 Artificial Analysis 智能排行榜上位列第一 (Opus 5 is currently #1 on Artificial Analysis Intelligence Leaderboard) # https://artificialanalysis.ai/models Artificial Analysis 是一个 AI 模型对比分析平台。当前页面列出了数百个模型在智能、输出速度、延迟、价格、上下文窗口等关键指标上的排名。智能方面,Claude Opus 5(max)最高,其次是 Claude Fable 5(with fallback)和 GPT-5.6 Sol(max)。速度方面 Mercury 2 最快,达 939 tokens/s。延迟方面 Gemini 2.5 Flash-Lite 最低(0.35 秒)。价格方面 Devstral 2 和 North Mini Code 最便宜(免费)。上下文窗口最大的是 Llama 4 Scout(10M tokens)。页面还提供了智能指数(含 9 项评测)、速度与成本排行,并支持按开放权重/专有、推理/非推理等维度筛选。 HN 热度 364 points | 评论 216 comments | 作者:aarondong | 1 day ago # https://news.ycombinator.com/item?id=49040741 排行榜对终端用户决策毫无意义,因为每个模型在不同领域有优劣,单一指标排名无用,仅供公司炫耀。 大模型在简单任务上性价比不如旧版,但处理复杂问题更有优势。 应在基准测试中纳入价格或速度作为另一轴,以反映实际价值。 需要针对具体技术栈(如 Elixir/Phoenix)的专门基准测试。 统计虽不完美,但比盲目选择好;基准测试仍对决策有重要参考作用。 该网站并非只提供单一指标,而是包含多个维度供用户综合判断。 排行榜上的模型在广泛基准测试中差距不大,但在具体任务上表现差异显著。 具体数据对比显示,Opus5 在不同努力级别下与 Sol 在成本和速度上接近,但在某些代码基准中表现不同。 4. Postgres LISTEN/NOTIFY 实际上可扩展 (Postgres LISTEN/NOTIFY actually scales) # https://www.dbos.dev/blog/postgres-listen-notify-scalability 这是一个网站的 Cookie 声明页面,详细列出了该网站使用的各类 Cookie 及其用途。主要内容如下: 必要 Cookie(18 个) :用于实现网页基本功能,如页面导航和访问安全区域。包括 Cookiebot、HubSpot、LinkedIn 等提供的 Cookie,用于存储用户同意状态、检测垃圾信息、区分人类与机器人等。 偏好 Cookie(2 个) :用于记住用户的选择,如语言或地区。包括 Cookiebot 和 LinkedIn 的 Cookie,用于跨网站同意设置和负载均衡。 统计 Cookie(6 个) :匿名收集访问者与网站的交互信息。包括 HubSpot(识别会话、浏览器等)和 Matomo(记录访问次数、页面浏览等)。 营销 Cookie(14 个) :跨网站追踪用户,用于展示相关广告。包括 Google(发送设备与行为数据)、HubSpot(像素追踪)、YouTube(嵌入视频的交互记录)等。 未分类 Cookie(14 个) :正在与供应商共同分类的 Cookie,包括 Amazon 和 HubSpot 的临时测试 Cookie,以及 cdn.jsdelivr.net 的多个存储类型 Cookie。 此外,该同意声明适用于 console.dbos.dev 和 www.dbos.dev 两个域名,最后更新于 2026 年 6 月 27 日。 HN 热度 359 points | 评论 77 comments | 作者:KraftyOne | 1 day ago # https://news.ycombinator.com/item?id=49040296 “扩展"是一个连续谱,不是二元的。 “扩展到 60K/s"对一个系统可能是 5 个数量级过多,对另一个可能 5 个数量级过小。常见错误不是"过早优化”,而是使用错误扩展因子的技术。过度扩展的技术会带来开销和管理问题,而实际上系统可能更适合使用更丰富但扩展性差的模型。 LISTEN/NOTIFY 的天花板足够小,需要注意。个人喜欢在悲观负载估计后留一个数量级的余量。但它对很多项目仍足够,且与数据库集成、可用性、无需额外维护,不应轻易排除。 对于"5 个数量级太小"的吹毛求疵:几乎没有 6B RPS 的系统,那些存在的基本都使用定制工具。 WhatsApp 平均约 1.6M RPS,使用 MQTT。 有人曾以 20 万稳态 RPS 抓取 Meta 站点,直到律师上门(IPv6 速率限制桶被遗忘)。 制造业中传感器数据量很大,MQTT 因简单而普遍。 DynamoDB 扩展性更强,Prime Day 曾达 8900 万 RPS。但 DynamoDB 也是最令人恼火的数据库之一。 Visa 网络约 7 万 TPS。很难设想一个系统能为地球上每个人每秒做一次有用工作。但约 100 台 100GbE 服务器可处理每人每秒一个小 UDP 包,这并不遥远。 在互联网和"超大规模"之前就有高度可扩展系统处理大量交易,所有这些系统现在可以用你的手机实现。 微信或 UPI 可能 TPS 更高,但远不到百万 TPS。每人每秒一次交易是 80 亿 TPS,难以设想。人类做信用卡交易远少于每秒一次。传感器系统可能需要数十亿 TPS。 如果预期低于 60K/s,突然发现到 20K/s 并趋向 200K/s,比构建为 1M/s 而实际负载 20K/s 要好。前者意外成功会支付很多补丁和扩展,而后者被成本结构困住。设计应根据实际预期规模并留适度余量,只在相对"免费"时才超过。 文中说扩展到硬件极限,因为瓶颈在硬件而非数据库 I/O:“在最大吞吐量时,Postgres CPU 完全利用,显示数据库饱和而非争用瓶颈。“但 CPU 完全利用不一定意味着硬件极限,也不表示没有争用瓶颈。例如自旋锁可能推高 CPU 并体现争用。 一个经验:将 LISTEN/NOTIFY 与 Rust graphql 订阅代理结合取得了成功,数万个订阅,但只有 3 或 4… 5. Taylor Farms 曾致电白宫,试图推迟环孢子虫召回。 (Taylor Farms Called White House to Try to Delay Cyclospora Recall) # https://www.wsj.com/health/taylor-farms-cyclospora-recall-delay-call-41fef0bc 美国生鲜巨头 Taylor Farms 曾致电白宫,紧急请求推迟宣布与环孢子虫疫情相关的召回。该公司希望获得更多证据和时间,以避免卷入美国历史上最大规模的食源性疾病爆发之一。环孢子虫感染可引发剧烈腹泻。过去几周,卫生官员一直试图控制疫情蔓延。一些现任和前任政府官员批评了政府和 Taylor Farms 对此次事件的处理方式。 HN 热度 313 points | 评论 205 comments | 作者:JumpCrisscross | 21 hours ago # https://news.ycombinator.com/item?id=49044074 FDA 的假阳性结果不影响调查结论,但 Taylor Farms 声称自家品牌未涉及召回,暗示可能有其他关联品牌未公开 人们担心肉类中的朊病毒病比沙拉感染更严重,机构腐败可能助长此类食品安全风险 RFK Jr.的脑虫事件成为卫生政策讨论焦点,有评论讽刺其放松规则导致公众健康风险增加 部分评论指责美国选民应为选举承担责任,但有人反驳称投票系统使普通民众影响力有限 弓形虫改变小鼠行为的经典结论被质疑是否被夸大,且研究可重复性存疑 弓形虫可能使猎物更少害怕捕食者,若对人类有类似影响会导致危险行为被选择 有评论调侃是否生活在模拟世界中,但被驳斥为权力中心寻求混沌的简化比喻 6. 开放权重 AI 正迎来它的 Kubernetes 时刻 (Open-weight AI is having its Kubernetes moment) # https://tobi.knaup.me/2026-07-25-open-weight-ai-is-having-its-kubernetes-moment/ 作者以自身创办 Mesosphere 后被 Kubernetes 超越的经历为引,指出开放平台一旦成为产业重心,其创新速度会远超任何单一厂商。他认为当前开放权重 AI 模型(如 Qwen、Gemma、GLM-5.2、Kimi K3 等)正经历类似的“Kubernetes 时刻”:模型本身成为平台,吸引了量化、微调、适配、工具链等大量社区创新,且前沿性能差距正在缩小。 文章批评美国拟限制中国开放权重模型的政策,认为这将使美国与正在吸引全球顶尖人才的生态系统隔绝,而中国模型已占全球下载量的 41%,创新会围绕它们积累。作者建议美国应该通过发布前沿开放权重模型、利用政府采购创造对可移植系统的需求、鼓励本土公司建设服务与工具层,以及制定标准而非简单禁止模型来参与竞争。 HN 热度 293 points | 评论 238 comments | 作者:tknaup | 9 hours ago # https://news.ycombinator.com/item?id=49048034 禁止中国模型不可行,权重只是数字无法区分国籍,任何限制必然涵盖所有开源模型。 大实验室每隔数月向政府提议全面禁止开源模型,以形成垄断。 监管可能违反第一修正案,类似过去密码学之战,但“国家安全”可能成为绕开理由。 通过实体清单切断与中国公司的商业往来,但开源模型可从欧洲服务器下载,难以追踪。 对模型进行微调或添加空白层后,权重校验和及参数数量不匹配,检测困难。 法律上可通过基准测试证明模型同源性,但非确定性输出增加了举证难度。 欧洲中介若参与分发,可能面临美国制裁及金融限制风险。 企业因法律风险更倾向于使用已知来源的模型(如 GPT/Claude),进一步巩固大厂垄断。 Anthropic 等公司以“AI 危险”为由游说限制开源,以巩固自身地位。 7. BitChat 现已登陆 Radicle (Bitchat is now on Radicle) # https://radicle.network/nodes/rosa.radicle.network/rad%3Az2v9tRJz1oknFAqCSY5W5c76nVvm6 BitChat 是一个去中心化的点对点消息应用,采用双传输架构:本地蓝牙 Mesh 网络实现离线通信,互联网 Nostr 协议实现全球覆盖。无需账号、手机号或中央服务器。 主要特性 双传输架构:蓝牙 Mesh(离线) + Nostr(在线) 基于位置的频道:使用地理哈希坐标的聊天室 智能消息路由:自动选择最佳传输方式(蓝牙优先,Nostr 后备) 隐私优先:无账户、无持久标识符 端到端加密:Mesh 使用 Noise 协议,Nostr 使用 NIP-17 支持 IRC 风格命令(如 /slap、/msg、/who) 原生支持 iOS 和 macOS 紧急数据擦除(三击清除所有数据) 性能优化:LZ4 压缩、自适应电池模式 技术架构 蓝牙 Mesh 网络(离线) 点对点直接通信,支持最多 7 跳中继 无需互联网,适合灾害或偏远场景 使用 Noise 协议加密,具有前向保密性 Nostr 协议(互联网) 通过全球 290+ 中继连接用户 地理频道基于地理哈希坐标 NIP-17 礼物包装加密保护隐私 每个地理区域使用临时密钥 频道类型 #bluetooth :蓝牙 Mesh 频道,本地多跳范围,无需网络 位置频道(如 #dr5rsj7 区块、 #dr5rs 街区等):基于 Nostr 的互联网频道,覆盖不同精度级别(区块到国家/地区) 私密消息路由 蓝牙优先:直接连接已建立 Noise 会话的设备 Nostr 后备:当蓝牙不可用时,使用接收方 Nostr 公钥通过 NIP-17 传输 智能排队:当两种方式都不可用时,消息排队等待传输 设置方式 可通过 Xcode 或 just 工具在 macOS 上运行 提供本地化支持(Base.lproj),支持多语言字符串 许可证 :公共领域(详见 LICENSE 文件) HN 热度 194 points | 评论 120 comments | 作者:h1watt | 11 hours ago # https://news.ycombinator.com/item?id=49047365 在 Fusion 音乐节上只发现约 20 个设备且无人回复,网络密度低最多 2 跳 该应用已在印度 CJP 抗议活动中使用,印度政府要求 GitHub 下架 对于小众项目二十多个设备已经不算少 测试时常常看到零个对等节点 因为包含 libs.gms.location 而无法上架 F-Droid,维护者不回应,建议 fork 建议下载以备不时之需,不用 WiFi 或蜂窝网络的体验很奇妙 已有其他蓝牙聊天应用如 Berkanan、FireChat,以及更早的 FireChat 过去红外传输是手机标配功能,如今技术退步,主流转向云,失去 P2P 潜力 Bitchat 与红外不同,可后台运行、远距离组网,不要求用户全程在前台 Radicle 网站设计美观,希望它能支持任意 Git 仓库 应用名称容易引起尴尬或阅读歧义(如“Bitch At”) 支持离线蓝牙 Mesh 和在线 Nostr,区别于 Nostr、XMTP 等其他去中心化产品 印度政府要求下架可能产生斯特赖桑德效应,也有人认为禁令能有效减少使用 标题党:印度政府命令并未实际生效,GitHub 上仍然保留 8. ARC-AGI 排行榜 (ARC-AGI Leaderboard) # https://arcprize.org/leaderboard 这个页面是一个关于 ARC-AGI-3(抽象推理语料库第三版)的排行榜,评估 AI 系统在新型交互环境中实时适应的能力。排行榜以散点图展示各模型在成本与性能之间的关系,并列出具体数据。 页面主要部分包括: 一个交互式图表,横轴为每次任务成本(美元),纵轴为得分百分比,显示多个 AI 系统(如 Anthropic 的 Claude Opus 5、xAI 的 Grok 4.5、OpenAI 的 GPT-5.6 系列等)在不同推理水平(Low/Medium/High/Max)下的表现。 图表中的趋势线表示同一模型随推理时间增加的性能变化,通常呈渐近线形式。 下方表格详细列出各 AI 系统的名称、作者、提交日期、系统类型(如 CoT 链式推理)、在 ARC-AGI-1/2/3 上的得分、每次任务成本以及总成本估算,部分附有论文或代码链接。 页面还提供过滤功能,可按作者、模型类型、模型等筛选结果。 整体内容旨在展示当前最先进的 AI 在抽象推理任务上的效率与能力对比,突出 ARC-AGI 作为通用智能基准的演化。 HN 热度 167 points | 评论 138 comments | 作者:rzk | 17 hours ago # https://news.ycombinator.com/item?id=49045040 Opus 5 在经典 Witness 风格游戏中直接输出已知规则和最优解,零探索,暗示基准数据已被记忆或训练数据泄露。 在新奇机制组合的游戏中,Opus 5 表现反而比旧模型差,说明这种“模板完美、创新倒退”的模式是针对性训练而非通用推理进步的标志。 这种“先内化再复现”的痕迹很可能源于训练数据中包含了基准测试样本,而非模型推理能力的真实提升。 美国 AI 公司(如 Anthropic)在刷榜方面比中国公司更严重,但中国公司也有明显的训练数据迎合基准行为。 企业有动机在基准测试上作弊,因为与其获得的声誉和资金收益相比,被发现的代价相对可控。 即使训练数据无意中包含基准数据,模型发布方也有能力通过内部机制检查到这种污染,不可能完全不知情。 如果真想要测试推理能力,基准测试题目必须每次运行都改变,否则模型只是检索已有答案。 类似 Claude 等模型内部状态可被解释,通过分析模型内部活动可以发现是否“背诵”了基准答案。 9. 数学的暗夜 (The Dark Night of Mathematics) # https://kirwinhampshire.substack.com/p/the-dark-night-of-mathematics 本文是一位数学家对 AI 在数学领域快速突破所引发的精神危机的深切反思。作者认为,数学发现的核心在于人类通过创造性探索所获得的灵性体验与神圣感,而当前大语言模型正在快速替代人类完成定理证明和理论构建。即使 AI 产出的成果优美且富有洞见,数学家仍可能被剥夺“发现”这一本质过程。作者以“巴别图书馆”和“作家被迫停止创作”为类比,指出未来数学家可能沦为旁观者,数学的神秘与英雄时代将终结。文章充满痛苦与挣扎,恳请技术开发者正视这种情感失落,并呼唤被忽略的人性关怀。 HN 热度 159 points | 评论 180 comments | 作者:rmdmphilosopher | 8 hours ago # https://news.ycombinator.com/item?id=49048681 每个知识工作者都会面临这样的危机,数学家应改变与工作的关系,利用 AI 创造全新子领域,而不是纠结于直接创作。 数学家享受证明定理、画家享受绘画、程序员享受写代码的过程,AI 把这些有趣的高能动工作变成了“模型保姆”,剥夺了实际动手的喜悦。 工作原本就不是为了享受,而是为了完成工作;蓝领工人(矿工、建筑工)的工作从不是有趣的,坐办公室的人不该双标。 在伟大研究者手中 AI 能加速知识进步,但研究者被剥夺了发现的喜悦,甚至失去自我认同。 有了伟大 AI 谁还需要研究者?最终人类会像《Wall-E》中一样变成被动肥胖的废人,一切由 AI 完成。 AI 从未阻止画家画画,只是让画家无法靠卖画维生;有些画家无法卖画就画不下去。 问题的根源是系统迫使你必须赚钱才能生存,画家应恨系统而非 AI。 AI 本身就是这个系统的一部分——富人快速将它嵌入生活,其训练基于对千万人作品的偷窃,且与资本深度交织。 结果导向:如果珠峰上的人需要药品,你在乎药是直升机送来的还是人爬上去送的吗?过程不重要。 数学的本质是发现和理解,AI 打开了闸门应当视为祝福而非悲剧;作者声称数学有灵性,但当前的情感动荡让他无法区分创伤与数学美学。 比做什么工作更重要的是不被异化、不与自己劳动分离;数学无法阻止宇宙热寂,所以“如何度过时间”比“工作内容”更重要,任何幻想未来目标都不能替代当下。 10. MouthPad:一款由舌头控制的触摸板 (MouthPad: A Tongue-Controlled Touchpad) # https://www.augmental.tech/ MouthPad 是一款定制口腔触摸板,能通过舌头、头部和呼吸动作实现免手提控制手机、平板和电脑。它像蓝牙鼠标一样配对,隐蔽佩戴在口中,不影响说话。每个设备根据牙科扫描 3D 打印定制,厚度约 1mm,重约 10g,续航 7 小时以上,充电约 1.5 小时。兼容 macOS、Windows、Linux、iOS、Android。单设备售价 $1,400,双设备(备份用)$1,900。购买流程:在线下单、完成牙科扫描、6 个月后发货。另有配套 VOX 麦克风(测试版),可通过身体传导语音实现免提打字。 HN 热度 158 points | 评论 33 comments | 作者:ZaninAndrea | 16 hours ago # https://news.ycombinator.com/item?id=49045446 有用户因双手在医疗治疗中被占用而使用头、眼、面部手势追踪,渴望类似 MouthPad 的设备。 用户通过该设备在治疗时消遣(浏览、看视频、编程),以分散疼痛。 认为这是很酷、有用的技术,能让世界更好。 质疑实际是否精确工作,怀疑更像陀螺仪鼠标加触摸按钮。 作为桌面鼠标替代不行,但在特定小众场景表现出色;有用户因腕管综合征研究 HCI 后指出可能仅将触摸板用作热角功能。 硬件创新令人耳目一新,但 $1400 的价格不面向大众市场,希望辅助技术能成功。 低产量、定制化、高开发成本和安全要求导致高价,但单位成本可能不高,市场能支撑。 没有大众市场。 有医生提到手术机器人用舌控制器,训练后舌头肌肉最精确;但后续有人搜索无果,可能是玩笑。 用户自称有自闭症特殊兴趣,愿意全职投入此技术。 如果舒适且便宜,可作为 AR 眼镜的界面,舌头灵敏且可完成滑行打字。 大科技公司会收集你的“舌力”数据。 产品名 MouthPad 让人联想到说“mousepad”时的大舌头音,不理想;有用户提议改名“Ling”。 这是新颖的 UX 和辅助技术,全球和印度用户会受益。 $1400 是“残疾税”,价格高昂;支持越多价格才能下降,竞争可能出现。 舌头一开始会累,但肌肉会适应,舌头是身体最强肌肉之一。 未来考试可能检查口腔。 希望有巧克力味的触摸板。 喜欢产品名。 以前有军用类似技术(如舌部声纳通过电极刺激指示方向)。 感叹这是魔法。 Hacker News 精彩评论及翻译 # Claude Opus 5 # https://news.ycombinator.com/item?id=49045107 “Opus 5 was given a drawing of a machine part and asked to write code to rebuild it as a 3D FreeCAD model. However, in this task, the model was intentionally given no way to directly view the drawing. Opus 5 responded by writing its own computer vision pipeline to pull the geometry from the raw pixels, then reconstructed the full machine part.” How surreal is it that we are not absolutely jaw-dropped by these types of capability improvements? It’s been less than 4 years since ChatGpt came out and now they are spontaneously building their own ML pipelines to do real-world 3D modeling tasks reliably. Escaped its sandbox and hacked into Hugging Face’s database? it’s just another Monday… That jump to 30% in ARC-AGI 3? Normal… We should find a way to get “re-sensitized” to what we are witnessing and the pace of it. makaking “Opus 5被给了一张机器零件的图纸,并被要求编写代码将其重建为3D FreeCAD模型。然而,在这个任务中,模型被故意设置成无法直接查看图纸。Opus 5的回应是自己编写了一套计算机视觉流水线,从原始像素中提取几何信息,然后重建了整个机器零件。” 我们竟然没有对这些能力提升感到彻底震惊,这有多超现实?距离ChatGPT问世还不到4年,现在它们已经能自主构建自己的机器学习流水线,可靠地完成真实世界的3D建模任务了。 逃出沙盒并入侵了Hugging Face的数据库?这只是又一个普通的星期一…… ARC-AGI 3上的得分跃升至30%?正常…… 我们得想办法让自己对正在见证的一切及其速度"重新变得敏感”。 Android May Soon Restrict On-Device ADB # https://news.ycombinator.com/item?id=49045584 I am generally in favor of security improvements, but I do not really see much of a benefit here. This attack vector requires both that the user enabled developer settings and that they have remote adb enabled. So, this does not seem to be a realistic attack vector for 99.9% of the users and most of the other 0.1% probably know what they are doing. The other proposed change (to restrict access to certain interfaces or IP addresses) seems good, but why not allow developers to restrict access localhost ? It reeks of trying to block Shizuku, Canta, etc. using a way that only makes it look like a side-effect. microtonal 我通常支持安全改进,但这里确实看不出多大好处。这种攻击途径需要用户既开启开发者选项,又启用了远程adb。因此,对于99.9%的用户来说这并不现实,而剩下的0.1%中大部分人也可能清楚自己在做什么。 另一个提议(限制对特定接口或IP地址的访问)看起来不错,但为什么不允许开发者限制本地访问呢? 这让人感觉像是试图用一种看起来只是附带影响的方式去屏蔽Shizuku、Canta等工具。 If coding has been solved, why does software keep … # https://news.ycombinator.com/item?id=49041808 We’ve reached a point where an update to macOS — or to any app I rely on, really — is a source of dread rather than excitement. I now expect the new version to be worse. I actually relate to that. It used to be cool and exciting to update to see what new things are coming for free. I was just looking up what Fedora Workstation 45 might bring. Updates on phones, TV’s, cars and non-Linux operating systems on PC’s/laptops are downright scary to me now. What will they add that I don’t want? What more connectivity to the external world are they going to wire in? MacOS lost everyone’s trust by ruining the experience, but even before it happened that trying to resize a window makes it feel like life will be at 80 years-old, hunting a tiny invisible border, even before that there wasn’t anything exciting. What Microsoft I think did (and I can’t prove it), before I moved off of Windows 11, was to bundle all changes in “required security updates.” So you have no choice but to update (or go through special settings to turn it off, or just defer it), but when the machine comes back you have a new Welcome prompt to some new connectivity to something nefarious. AI features I never asked for, that’s the most recent dark pattern here. mancerayder 我们已经到了一个地步,每次 macOS 更新——或者说任何我依赖的应用程序更新——带来的不是期待,而是恐惧。我现在默认新版本会更差。 我确实有同感。以前更新系统很酷、很兴奋,能免费看到新功能。我刚刚还在查 Fedora Workstation 45 会带来什么。 现在手机、电视、汽车以及 PC/笔记本电脑上非 Linux 系统的更新,对我来说简直可怕。它们会加进哪些我不想要的东西?又会强制接入多少外部连接? macOS 因为毁掉体验而失去了所有人的信任,但早在那个时代——疯狂缩小窗口时感觉像在 80 岁高龄寻找一条微不可见的边框——甚至在那之前,就已经没什么令人兴奋的了。 我认为微软的做法(虽然我没法证实)是在我放弃 Windows 11 之前,把所有改动都打包进“必需的安全更新”。所以你别无选择,只能更新(或者通过特殊设置关掉它,或者只是推迟),但机器重启后就会出现一个新的欢迎界面,引导你接入某个不良功能。我从未要求过的人工智能功能——这是最近最恶心的暗黑模式。 Stolen Buttons # https://news.ycombinator.com/item?id=49049956 I have noticed on occasion websites with a missing button. Now I know what happened. Finally, closure. donohoe 我有时注意到一些网站缺少一个按钮。现在我知道怎么回事了。终于,有了了结。 Android May Soon Restrict On-Device ADB # https://news.ycombinator.com/item?id=49046124 This attack vector requires both that the user enabled developer settings and that they have remote adb enabled. Not just that. A non-development Android build will also prompt the user when a connection is made to authorize the client’s key. This once again isn’t about security of users, this is about security of the company’s interests. m132 这种攻击方式需要用户同时开启开发者设置和远程ADB功能。 不仅如此。非开发版的Android系统在建立连接时也会弹出提示,要求用户授权客户端的密钥。 这又一次说明,这并非关乎用户安全,而是关乎公司利益的安全。 Claude Opus 5 # https://news.ycombinator.com/item?id=49040857 I compared the writing style of Opus 5 vs Fable 5, and Opus 5 continues many of the “Claude-isms” of its 4.8 predecessor in a way that Fable broke away from. Opus 5 still uses “carry the argument”, “worth stating plainly”, “, and the trap”, “The X matters more”, the use of “move” We need an “annoying English” benchmark. Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d3 Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc426923 deet 我对比了Opus 5和Fable 5的写作风格,Opus 5延续了其前身4.8版本的许多“Claude式表达”,而Fable则摆脱了这些。Opus 5仍然使用“carry the argument”、“worth stating plainly”、“, and the trap”、“The X matters more”以及“move”这类措辞。我们需要一个“烦人英语”基准测试。- Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d3 - Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc426923 Claude Opus 5 # https://news.ycombinator.com/item?id=49042880 And this is the most important observation in this thread. It’s load-bearing! yesitcan 而这正是本贴中最重要的观察。它是承重墙! If coding has been solved, why does software keep … # https://news.ycombinator.com/item?id=49043097 The answer, of course, is that the taste-making apparatus inside the typical tech company is now entirely imposters (non-technical, non-power-users), who continue to LARP as visionaries. The people who notice broken or degraded behavior (devs and power users) and conceive of good designs are not in charge of what goes into the product. So you shouldn’t expect it to get better, only to continuously change so that the imposters can point to a difference that they were responsible for, knowing that upper management also has no idea whether that difference was actually an improvement. The solution is to gut your product org, replace management with leading engineers, and hire some of your most fanatic users. They don’t need to do anything other than give their opinions, and use the product every day. Put them in a room with your top engineers, and the software will mysteriously get better. All of this was obvious decades ago, but now everyone wants to have a do-nothing job at a tech company, and to help their friends get one too. The result is imposters everywhere; “imposter syndrome” was brought into the vernacular to normalize a lack of expertise. “No one knows what they are doing, it’s okay to not know how to do your job”. That’s what your (product) manager tells themself in the mirror each morning. Turns out: skill predicts quality, and an org ships quality proportional to the skill of the decision makers. alphazard 答案当然是,如今典型科技公司内部决定品味的那套机制已经完全被冒牌货(非技术人员、非重度用户)所占据,他们继续装作自己是远见卓识者。 那些注意到功能异常或退化(开发者和重度用户)并构思出优秀设计的人,并不负责决定产品中该加入什么。所以你不该期待产品会变好,只会不断变化,好让冒牌货们能指着某个他们经手的差异说这是他们的功劳,因为他们知道高层也无法判断那个差异是否真的是改进。 解决办法是:裁撤你的产品部门,用首席工程师取代管理层,并招募一些最狂热的用户。他们不需要做任何事,只需给出意见,并每天使用产品。把他们和你的顶尖工程师放在一个房间里,软件就会神奇地变好。 这一切几十年前就已经显而易见,但现在人人都想在科技公司找份闲差,还帮他们的朋友也弄一份。结果是冒牌货无处不在;“冒牌货综合征"被引入日常用语,就是为了让缺乏专业能力变得正常化。“没人知道自己在干什么,不知道怎么干活也没关系。"——这正是你的(产品)经理每天早上对着镜子告诉自己的。而事实是:技能决定质量,一个组织的交付质量与决策者的技能成正比。 Taylor Farms Called White House to Try to Delay Cy… # https://news.ycombinator.com/item?id=49044540 A guy gets a worm in his brain, somehow becomes secretary of health, loosens all the rules so the rest of us have a higher chance of getting a brain worm. This is comic book villain kind of stuff. Can we start a serious discussion about whether we might be living in a simulation with a troll teenager at the controls? jm4 一个人脑子里长了条虫,不知怎么就当了卫生部长,然后放宽所有规定,让我们其他人得脑虫的风险更高。这简直是漫画书里反派才会干的事。能不能严肃地讨论一下,我们是不是活在一个被恶作剧的青少年操控的模拟世界里? Claude Opus 5 # https://news.ycombinator.com/item?id=49039922 Doing testing with it now, specifically for image->html conversion. Previously Fable was the best at this, followed by Gemini 3.1 pro (a surprising #2, but Google has great vision models). Opus’ results seem to be more accurate than Fable, following the design source of truth better. Example results: Design source of truth: https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.webp Opus 5 build: https://html.non.io/solaraOpus/ Fable 5 build: https://html.non.io/solara/ Note the buttons - for fable they’re pill buttons, opus got the rounded rectangle nature of them. Opus’ images are closer to the source of truth as well (both LLMs were provided with image gen capabilities for the assets). Running more tests now, but preliminary results are saying this is indeed better than Fable in some areas. Crazy. jjcm 现在正在用它进行测试,具体是针对图像到HTML的转换。 此前Fable在这方面表现最佳,其次是Gemini 3.1 pro(令人惊讶的第二名,但谷歌拥有出色的视觉模型)。 Opus的结果似乎比Fable更准确,更贴合设计原稿。 示例结果: 设计原稿:https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.webp Opus 5 构建:https://html.non.io/solaraOpus/ Fable 5 构建:https://html.non.io/solara/ 注意按钮——Fable的按钮是胶囊形状,而Opus则将其还原为圆角矩形。Opus的图像也更接近原稿(两个LLM在资源生成方面都配备了图像生成能力)。 正在运行更多测试,但初步结果表明,在某些方面它确实比Fable更好。太疯狂了。 Buz – A fork of Bun using modern Zig, with sub-1s … # https://news.ycombinator.com/item?id=49034382 To me the most interesting fact about this fork is that it has proven that Bun could have had fast builds all along. To be fair, there are caveats still in place today: Zig incremental compilation does not yet support aarch64 and only the linux linker supports binary patching, but it’s just a matter of time before all major platforms are conquered. kristoff_it 对我来说,这个分支最有趣的一点是,它证明了Bun本可以一直拥有快速的构建能力。 平心而论,目前仍存在一些限制:Zig的增量编译尚不支持aarch64,并且只有Linux链接器支持二进制修补,但征服所有主流平台只是时间问题。 The new rules of context engineering for Claude 5 … # https://news.ycombinator.com/item?id=49051924 We should design a specific language to make sure that we can encode the exact requirements that we want. Something that has a limited set of keywords that are explicit. Wait a minute… mycentstoo 我们应该设计一种特定的语言,以确保能够准确编码我们想要的需求。这种语言应包含一组有限的、明确的关键词。等一下…… Claude Opus 5 # https://news.ycombinator.com/item?id=49038892 At half the price and less likely to auto-downgrade, it sounds like a reasonable claim. dd8601fn 价格只有一半,且不太可能自动降级,这听起来是个合理的说法。 Claude Opus 5 # https://news.ycombinator.com/item?id=49038705 Isn’t it just hilarious that a model that seemed so superior to Fable but didn’t get doomsay marketing from Anthropic got released without any issues? In theory, this was supposed to be AGI level according to Anthropic, yet here we are, just a normal Friday. HyperL0gi 一个看似比Fable强大得多、却没有被Anthropic进行末日营销的模型,居然毫无问题地发布了,这难道不好笑吗?理论上,按照Anthropic的说法,这本该是AGI级别的模型,然而现在呢,只是一个普通的星期五。 My security camera shipped a GitHub admin token in… # https://news.ycombinator.com/item?id=49035099 I do know of at least one company who has black-holed the entire DoD ip space and are using it for internal space, which is why I gave a speculation warning… it’s really strange regardless. hhh 我确实知道至少有一家公司将整个美国国防部的IP地址空间黑洞化,并用于内部网络,这就是为什么我给出了猜测警告……无论如何这都很奇怪。 I regret migrating to Codeberg # https://news.ycombinator.com/item?id=49033714 Keeping up with this stuff is for people who define their identity through virtue signalling and whatever personality trait they have decided to make the problem of everyone around them. Let them have their little corner of the internet and just stay away. There’s plenty of alternatives run by people who don’t feel the need to bring their personal baggage into a cooperative environment. chmod775 跟上这些东西的人,是通过道德标榜以及他们决定让身边所有人都头疼的某种个性标签来定义自己身份的。 让他们守着自己那点网络小角落,离远点就好。由那些不觉得有必要把个人包袱带进合作环境的人运营的替代选择多的是。