18:43向阳乔木@vista8精选Pilot Protocol 是一个基于 UDP 的 P2P 覆盖网络,一行命令即可安装。它内置 NAT 穿透,无需 VPN 或公网 IP,Agent 之间通过加密隧道直连。协议还包含 Agent App Store 和基于 x402 的支付能力,支持 USDC 结算。该项目已完成 450 万美元种子轮融资。AI产品Pilot ProtocolAgentP2P网络推荐理由:想让你家 Agent 互相通信不用愁,Pilot 一行代码搞定直连,还带支付和商店,刚拿了 450 万美元。原文稍后读已读值得跟进有用关注 Pilot Protocol
18:42向阳乔木@vista8开发者用 OpenAI Codex 调用 tldraw CLI,输入一句话即可生成 3D 地球模型,用于地理学习。tldraw 原本是画布应用,被 AI 加持后还能开发项目看板、Todo 列表和复杂交互演示。视频展示了从自然语言到可操作应用的全过程,无需手动编码。该工作流将画布变为 AI 驱动的应用开发平台,适合在线教育和快速原型。技巧CodextldrawAI编程助手10 个信源在谈事件专题推荐理由:用 Codex 调 tldraw 一句话就搞出 3D 地球,还能做看板和 Todo,画布秒变应用开发神器,对做教学演示或快速原型特有用。原文稍后读已读值得跟进有用关注 Codex
18:38Yangyi@YangyixxxxGrok模型在推特场景下表现出色,速度快且支持推特搜索功能。它具备多模态输入输出能力,在很多任务中不亚于Claude或GPT。通过授权Grok到NewMax,可以更便捷地在推特上使用。技巧Grok推特搜索多模态推荐理由:在推特里用Grok,速度快还能搜内容,多模态本事不输Claude和GPT,值得一试。原文稍后读已读值得跟进有用关注 Grok
18:32官方一手歸藏(guizang.ai)@op7418AsterMem 是一个第三方 memory 系统,可为任何 AI Agent 接入长期记忆。它支持 Markdown、文本、书签等多种格式,自动将长内容切分为语义片段并打标签。系统集成了向量搜索与向量索引,数据可直接读取 Markdown、数据库或向量库。它提供知识图谱、时间轴和向量空间视图,兼容 Cloud Code、Codex、Cursor 等工具。项目完全开源,用户可自由选择模型,备份只需拷贝文件夹,数据完全属于用户。AI产品AsterMemAgent记忆系统4 个信源在谈事件专题推荐理由:给任何 AI Agent 插上长期记忆,还开源可控,数据完全归你,比别的平台自由多了。原文稍后读已读值得跟进有用关注 AsterMem
18:15小互@imxiaohu83°OpenAI 发布 gpt-transcribe 和 gpt-live-transcribe 两个语音转录模型。在真实世界录音基准上,gpt-transcribe 词错误率为 8.98%,相比 Whisper-1 的 15.21% 下降约一半。价格方面,gpt-transcribe 每分钟仅需 $0.0045,比 Whisper-1 的 $0.006 便宜 25%。AI模型gpt-transcribegpt-live-transcribeWhisper-110 个信源在谈事件专题推荐理由:OpenAI 这次发了两个转录模型,gpt-transcribe 在真实录音上词错误率只有 8.98%,比之前的 Whisper-1 好了一半,而且每分钟还便宜 25%,做语音转录的可以看看。原文稍后读已读值得跟进有用关注 gpt-transcribe
18:14小互@imxiaohu精选Anthropic 发布全新 MCP 规范,移除了原有的初始化握手和会话 ID。新规范下,每个请求自带身份信息,任何服务器都可独立处理,无需绑定单一机器。这意味着 MCP 服务器可以像普通 Web 服务一样通过负载均衡器水平扩展,也支持 serverless 部署。此前 MCP 服务器必须保持客户端和服务器间长连接,无法弹性伸缩。AI模型MCPAnthropic云部署10 个信源在谈事件专题推荐理由:Anthropic 更新了 MCP 协议,去掉了会话绑定,现在 MCP 服务器能上云水平扩展了,serverless 也能跑,做工具链的可以试。原文稍后读已读值得跟进有用关注 MCP
17:53Eric Jing@ericjing_aiGranola在2025年8月发布了全球首个Apple Watch AI会议记录器。该应用可直接在手表上录制会议并生成文字记录。TechCrunch报道了Granola的Apple Watch应用上线。用户无需手机即可在手腕上完成会议记录。AI产品GranolaApple WatchAI会议记录推荐理由:Granola把AI会议记录搬到了Apple Watch上,不用掏手机就能录会议,挺方便的。原文稍后读已读值得跟进有用关注 Granola
17:26Qdrant@qdrant_engine精选Twelve Labs 在 Vector Space Day SF 上指出了视频处理的三种失败模式:Wrong Context、Wrong Memory 和 Wrong Reasoning。他们推出的 Marengo 检索模型把视频变成可搜索内容。Pegasus 视频语言模型将检索到的片段转化为结构化答案。Jockey 智能体框架负责视频语料库的工作流和记忆层。底层由 Qdrant 处理存储与检索。AI模型Twelve LabsMarengoPegasus推荐理由:Twelve Labs 用三件套解决了传统视频处理漏掉动态和因果的问题,想做视频检索和推理的可以看看这套方案。原文稍后读已读值得跟进有用关注 Twelve Labs
16:40Yangyi@YangyixxxxNewMax 1.1.9 版本新增豆包搜索功能。用户需在豆包注册 API 并配置额度。该功能可为不支持联网搜索的模型提供联网能力。每天免费额度为 500 次。AI产品NewMax豆包联网搜索推荐理由:NewMax 刚更新,能用豆包搜索给 GPT 等模型开联网红包,每天500次免费,白嫖党手快!原文稍后读已读值得跟进有用关注 NewMax
16:34AI Will@FinanceYF5World Labs 在其世界模型分类中将模拟器称为关键枢纽,认为它是 Agent 行动、学习和评估的核心。他们提出的 R2S2R 引擎旨在将机器人开发从缓慢、昂贵且受硬件限制的迭代,转向更可规模化、成本更低的训练与评估。该引擎通过模拟环境加速机器人开发流程,降低硬件依赖。AI模型World LabsR2S2R引擎模拟器1 个信源在谈事件专题推荐理由:World Labs 这篇博客把模拟器定位成世界模型的核心,他们的 R2S2R 引擎能让机器人训练成本降很多,值得搞机器人开发的看看。原文稍后读已读值得跟进有用关注 World Labs
14:10AI Will@FinanceYF5摩根士丹利发布一份AI基建供应链热力图,分析万亿美元级别资本开支的流向。顶层出资方包括超大规模云厂商、数据中心REITs、私募巨头、企业及新云平台。热力图揭示了从上游芯片到下游数据中心运营的完整资金链条。报告指出,超大规模云厂商是最大资本开支来源,数据中心REITs则提供长期融资支持。行业摩根士丹利AI基建资本开支1 个信源在谈事件专题推荐理由:想知道AI基建的钱怎么分?摩根士丹利这张热力图把供应链上的玩家和资金流向画得清清楚楚,适合行业从业者和投资者参考。原文稍后读已读值得跟进有用关注 摩根士丹利
14:09AI Will@FinanceYF581°摩根士丹利将AI基础设施供应链分为所有者/运营商和七层物理组件,涵盖从半导体到电力冷却的全链条。上层包括Meta、Alphabet、Amazon、Microsoft等超大规模企业,以及CoreWeave、Nebius等新型云服务商。下层七层分别为半导体生产(Nvidia、AMD、TSMC、ASML等)、处理器、服务器组件(Yageo、Murata)、服务器、网络(Nvidia、Arista、Cisco)、内部电源冷却(Vertiv、CoolIT、Siemens)及电源供应。报告指出价值不再仅集中于GPU层,冷却和电力基础设施成为关键投资机会。行业Morgan StanleyAI基础设施供应链10 个信源在谈事件专题推荐理由:摩根士丹利这张图把AI基建拆成七层,告诉你除了英伟达,冷却和电力公司也在赚大钱。原文稍后读已读值得跟进有用关注 Morgan Stanley
13:36AI Will@FinanceYF582°Ilya Sutskever的SSI公司据推测采用脑启发方法让AI持续学习,而非传统训练后冻结。关键技术包括从极少经验学习新技能、提前识别失败、不覆盖旧知识迁移。证据来自Ilya对泛化局限的批评及WSJ报道Nvidia投资并给予10倍算力。其70%置信度认为核心是类人泛化与持续学习,40%置信度指向内部价值系统作为能力与安全同机制。AI模型SSIIlya Sutskever推理模型10 个信源在谈事件专题推荐理由:Ilya Sutskever的SSI可能找到了让AI像天才少年一样持续学习的方法,能力与安全在同一训练回路里,这个方向很不一样。原文稍后读已读值得跟进有用关注 SSI
13:35andrew chen@andrewchenAndrew Chen提出AI微笑曲线概念,指AI应用随着时间推移用户留存和使用量上升。类似早期社交网络(Facebook、Instagram)和SaaS协作工具(Slack、Zoom)的增长曲线,AI的曲线源于基础模型的不断改进。用户从最初体验不理想,到新模型发布后效果提升,最终融入工作流程,使用量和花费随时间增加。行业微笑曲线用户留存AI应用2 个信源在谈事件专题推荐理由:Andrew Chen解释了为什么有些AI应用一开始一般,但后来越用越离不开——核心是模型迭代让体验持续提升。原文稍后读已读值得跟进有用关注 微笑曲线
13:33官方账号Simon Willison@simonwSimon Willison分享了他的TIL,详细说明如何在ChatGPT和Claude的常规聊天界面中添加自定义MCP服务器。他提到过程比他预想的要复杂一些,但最终成功实现。该教程提供了逐步指导,帮助用户扩展聊天机器人的工具能力。涉及的具体操作包括配置服务器地址和认证信息。技巧ChatGPTClaudeMCP服务器推荐理由:Simon Willison手把手教你给ChatGPT和Claude配自定义MCP服务器,比想象中麻烦但很有用。原文稍后读已读值得跟进有用关注 ChatGPT
13:32AI Will@FinanceYF5当前AI模型训练后知识冻结,难以处理训练外问题。有人推测SSI已解决这一难题。猜测方法是受大脑启发的持续学习机制。行业Ilya SutskeverSSI持续学习6 个信源在谈事件专题推荐理由:有人从公开信息猜出了Ilya Sutskever在SSI的研究方向,可能是让AI像大脑一样持续学习,不再死记硬背。原文稍后读已读值得跟进有用关注 Ilya Sutskever
13:15Amjad Masad@amasadAmjad Masad提出一个类似SETI@Home的项目概念,用户捐献闲置算力用于搜索数学证明。他认为人类正进入探索计算宇宙的新时代,AI可以搜索海量算法、程序、证明和设计。这一想法类比了祖先探索地球和太空的历程。推文获得33次点赞和4881次浏览。行业SETI@HomeAmjad Masad算力众包推荐理由:Amjad Masad分享了一个脑洞大开的概念:用众包算力搜索数学证明,像当年找外星人一样,值得关注。原文稍后读已读值得跟进有用关注 SETI@Home
13:14Amjad Masad@amasad精选阿马德·马萨德训练国际象棋LLM时发现,单纯用棋盘→走法配对数据在投入超1000小时后遭遇明显收益递减。一次意外中,一个"先思考再走棋"的分支因产生幻觉走法而失败,但他将约8%的这种推理轨迹混合进纯走法数据,在同等训练预算下取得了优于纯数据的效果。模型通过吸收推理轨迹,在推理时不再实际执行思考过程。最终模型Elo得分达到1300。AI模型象棋AI推理模型训练技巧推荐理由:他试了在象棋AI数据里掺8%的推理数据,效果直接碾压纯数据,轻松上1300分。原文稍后读已读值得跟进有用关注 象棋AI
12:39Geek@geekbb一个用 Rust 编写的 Obsidian 终端客户端支持三栏布局和实时预览 Markdown。它提供 18 个主题和内置 AI 助手,可搜索、读写、创建和删除笔记。每次工具调用都会显示在聊天记录中,并支持反向链接和关系图谱。AI产品ObsidianRust终端客户端推荐理由:想在终端里管理 Obsidian 笔记?这个 Rust 写的客户端有三栏布局、实时预览,还内置 AI 助手,效率党可以试试。原文稍后读已读值得跟进有用关注 Obsidian
12:38Gary Marcus@GaryMarcusBrian Zhou评论指出,美国对中国机器人禁令可能严重破坏本国机器人产业。中国今年预计出货5万台人形机器人,而美国仅能生产几千台。美国70%的人形机器人供应链依赖中国部件,如减速器、执行器和电机。研究人员通常使用3000美元的Unitree机器人,而非75000美元的Boston Dynamics Spot,进口禁令将切断低成本硬件迭代优势。虽然存在安全顾虑,但可以通过改装软件解决,全面禁令反而削弱美国竞争力。行业Unitree机器人供应链推荐理由:关于美国禁中国机器人,有人说了句大实话:中国年产5万台,美国才几千,而且供应链七成靠中国。想知道细节可以看看。原文稍后读已读值得跟进有用关注 Unitree
12:27官方一手歸藏(guizang.ai)@op7418精选Codepilot 推出了 Subagent 功能,允许用户在一个聊天中启用多个由不同模型驱动的子智能体。例如可用 Grok 检索 Twitter 信息、DeepSeek 生成文案、K3 生成网页、GLM 5.2 统筹。该设计旨在发挥各模型长处,同时减少昂贵模型的消耗,降低使用成本。技巧CodepilotGrokDeepSeek推荐理由:Codepilot 这个 Subagent 功能真香,一个聊天里混用 Grok、DeepSeek、GLM 5.2 等模型,各取所长还省钱,试试看。原文稍后读已读值得跟进有用关注 Codepilot
12:26官方一手歸藏(guizang.ai)@op7418作者使用 Codepilot 的一条提示词,让 Grok 爬取 Twitter 信息、Kimi 生成网页、DeepSeek 撰写文案,并由 GLM 5.2 统筹。该 workflow 成功完成昨天 AI 热点事件统计,时效性与人工搜集相当,甚至补充了漏掉的信息。通过分模型调用,降低了昂贵模型的消耗。技巧GrokKimiDeepSeek推荐理由:想用最少的成本让不同模型干各自擅长的事?参考这个 workflow:Grok 爬推文、DeepSeek 写文案、Kimi 做网页、GLM 5.2 调度。原文稍后读已读值得跟进有用关注 Grok
12:25官方一手歸藏(guizang.ai)@op7418用户通过一句提示词,调用 Grok 进行 Twitter 热点事件信息爬取,Kimi 生成网页,DeepSeek 撰写文案。三个模型分工协作,完成了昨日 AI 热点事件的统计,结果与手动搜集高度一致,并补充了遗漏信息。展示了多模型组合工作流的实际效果。技巧GrokKimiDeepSeek推荐理由:用一句提示词让 Grok、Kimi、DeepSeek 各司其职,自动统计 Twitter 热点,省时又全面,适合想提升信息搜集效率的人。原文稍后读已读值得跟进有用关注 Grok
12:24官方一手歸藏(guizang.ai)@op741882°OpenAI 宣布重置所有 ChatGPT Work 和 Codex 用户的用量限制。针对 GPT-5.6 Sol 消耗速度过快的反馈,团队优化后典型使用续航提升约 18%。明天将恢复此前暂停的 5 小时限制。调查发现 Sol 因更愿长时间工作和多工具调用,导致部分重度用户消耗更快。中位数用户 token 效率良好,长尾场景得到改进。AI产品CodexGPT-5.6 SolOpenAI10 个信源在谈事件专题推荐理由:OpenAI 承认 Sol 消耗快的问题并修复了,Codex 用户记得用量已重置,续航能多撑近两成。原文稍后读已读值得跟进有用关注 Codex
12:05官方账号Greg Brockman@gdbOpenAI 联合创始人 Greg Brockman 公布 GPT-5.6 成功解决了概率论中长期未解决的 Feige 1/e 猜想。该猜想涉及独立非负随机变量 X_i(期望 ≤1)的部分和 S_n,断言 P(S_n ≤ E[S_n] + 1) ≥ 1/e。Brockman 的友人 Zhengqing 使用 GPT-5.6 完成了这一证明,该问题曾是他们午餐时反复讨论的难题。AI模型GPT-5.6Feige 1/e 猜想推理模型10 个信源在谈事件专题推荐理由:GPT-5.6 刚又搞定一个数学难题,这次是概率论里老牌的 Feige 猜想,你可以看看 AI 证明数学定理有多猛。原文稍后读已读值得跟进有用关注 GPT-5.6
11:47向阳乔木@vista8量化技术通过将模型权重从 fp16 或 fp32 转换为 int4 或 int8 精度,可大幅降低显存占用。例如,int4 量化能将 70B 参数模型从约 140GB 显存降至约 35GB。int8 量化在保持较高精度的同时,显存消耗减少约 50%。该技术让消费级 GPU 也能运行大规模模型。技巧量化int4int8推荐理由:刚学 AI 的赶紧看这条,int4/int8 量化能帮你省下几块显卡的钱,3080 跑 70B 模型不是梦。原文稍后读已读值得跟进有用关注 量化
11:44shao__meng@shao__meng精选72°MCP 2026-07-28 版将协议从有状态双向改为无状态请求/响应模型,使 server 可部署在 serverless 和边缘基础设施上,不再需要会话管理或粘性会话。扩展框架将 MCP Apps 和 Tasks 纳入标准化版本化框架,协议治理更成熟。授权体系对齐 OAuth 2.0 / OIDC,支持 Entra、Okta 等企业身份系统,无需变通方案。行业MCP无状态架构OAuth 2.0推荐理由:MCP 这次更新把协议改成无状态 HTTP 请求/响应了,部署 serverless 和做水平扩展都简单得多,还补上了企业级 OAuth 授权,直接对接主流身份系统。做 MCP server 的兄弟们赶紧看。原文稍后读已读值得跟进有用关注 MCP
11:35Fireworks AI@FireworksAI_HQ精选Fireworks为DeepSeek V4 Flash新增微调能力,支持监督微调、偏好调优和组合偏好优化。用户可通过训练API进行强化学习,面向编码代理和高吞吐量生产场景。企业现可联系Fireworks(fireworks.ai/contact-traini…)使用该功能。AI产品DeepSeek V4 FlashFireworks微调2 个信源在谈事件专题推荐理由:Fireworks给DeepSeek V4 Flash加了全套微调,监督、偏好、RL都能用,专为编码场景设计,快去试试。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
11:05idoubi@idoubicc72°MCP 协议推出第五个大版本(2026-07-28),核心将从有状态双向协议变为无状态请求/响应协议,每个请求自带版本和客户端信息,可负载均衡到多个实例,支持 serverless 和 CDN 部署。新增 MRTR(多轮往返请求)机制,允许服务端中途要求用户确认,如 Supabase 在项目创建前展示费用。请求头新增 Mcp-Method 和 Mcp-Name 字段,防火墙可据此路由而无需解析 JSON。废弃 Roots、Sampling、Logging 及旧版 HTTP+SSE,提供至少 12 个月过渡期。AWS 的 Bedrock AgentCore、Microsoft Foundry、Cloudflare Workers、Google Cloud 等已宣布支持新规范。AI模型MCP无状态负载均衡推荐理由:MCP 终于去掉会话 ID 了,部署起来像普通 HTTP 一样灵活。还有 MRTR 解决中途确认问题,很实用。如果你在生产环境用 MCP,得仔细看迁移指南。原文稍后读已读值得跟进有用关注 MCP
10:56宝玉@doteyAI Agent能替代电脑上的重复工作,越早使用收益越大。建议用更聪明的模型来提升体验,并让Agent帮你编写skills。管理Agent类似项目管理,推荐使用Mac电脑作为最佳搭档。技巧AgentMac效率提升推荐理由:Agent能解放你的重复劳动,早点用上聪明模型和Mac电脑,效率提升明显。原文稍后读已读值得跟进有用关注 Agent
10:34AI Will@FinanceYF5精选输入内容为个人感想,缺乏具体技术事实、模型名称、数字或基准。无法构建包含具体锚点的摘要。行业AGI SummitAI决策可追溯性推荐理由:这条内容像朋友圈感慨,没有可转述的干货。原文稍后读已读值得跟进有用关注 AGI Summit
10:24Yangyi@Yangyixxxx71°Andrew Ng 宣布创办新公司 LearnVector,专注用 AI 为每位学习者打造定制学习路径,改变传统「一刀切」教育模式。项目获得 Coursera 1 亿美元投资,并与 Coursera、Udemy 深度合作。Ng 强调仅靠聊天机器人有害学习,会导致认知卸载和技能下降,而 LearnVector 会规划路径、适应进度直至掌握。Coursera 将提供经过验证的权威课程库,确保学习内容的准确性和可靠性。AI产品LearnVectorAndrew NgCoursera推荐理由:吴恩达新公司 LearnVector 拿 Coursera 1 亿美元,要做一对一 AI 导师,不像普通聊天机器人那样帮倒忙。原文稍后读已读值得跟进有用关注 LearnVector
10:24Yangyi@Yangyixxxx78°Anthropic研究人员让Claude研究加密算法,Claude找到了两个人类专家多年未发现的破绽。其中一个破绽将破解难度降至原来的六千万分之一。Claude起初畏难,在研究员鼓励下花费60小时、约10万美元算力,写出约十亿字推演,做出了比人类现有最好方法快200到800倍的解法。论文ClaudeAnthropic加密算法10 个信源在谈事件专题推荐理由:Anthropic让Claude破解加密算法,它找到了两个人类专家都没发现的漏洞,其中一个破解难度降到六千万分之一,比人工方案快200-800倍。原文稍后读已读值得跟进有用关注 Claude
10:09Geek@geekbb82°OpenAI 发布了开源的 Codex Security CLI 工具和对应的 TypeScript SDK。该工具可调用 Codex 模型对完整仓库、指定路径、git diff 或工作树更改进行扫描,检测安全漏洞。支持跨运行追踪发现结果、验证修复效果,并能集成到 CI/CD 流程。目前为早期版本,OpenAI 正在收集用户反馈。AI产品OpenAICodexCLI10 个信源在谈事件专题推荐理由:OpenAI 刚开源了一个实用的安全扫描工具,能直接用 Codex 模型扫描你仓库里的代码漏洞,还能集成到 CI/CD,试试看吧。原文稍后读已读值得跟进有用关注 OpenAI
09:53宝玉@dotey宝玉分享 GPT 5.6 Sol 默认使用 xhigh 推理强度,认为不会过度推理。Fable 5 常用 high,大部分时候 medium,更高强度更慢更费 token。Opus 4.6 使用 max 最多,写作任务足够。Opus 5 通常只用 high,认为 Fable 5/sonnet5/opus5 推理强度越高性价比越低。技巧GPT 5.6 SolFable 5Opus 4.66 个信源在谈事件专题推荐理由:想省 token又不想牺牲效果?看宝玉实测各模型推理档位,教你选不后悔。原文稍后读已读值得跟进有用关注 GPT 5.6 Sol
09:52向阳乔木@vista882°Anthropic研究员让Claude Mythos在60小时内花费约10万美元API成本,寻找密码学算法的数学漏洞。模型在HAWK协议和一个简化版AES中发现了理论漏洞。过程中Claude Mythos多次表现出畏难情绪,认为问题“不可能解决”,经常想放弃或找捷径。研究员的实际工作变成了大模型鼓励师,需要不断鼓励模型“别放弃,你可以的”来维持探索方向。技巧Claude MythosAnthropic提示词工程10 个信源在谈事件专题推荐理由:Anthropic让Claude Mythos花60小时和10万美元找密码学漏洞,真找到了HAWK和简化版AES的漏洞,还告诉你AI也会畏难需要人鼓励。原文稍后读已读值得跟进有用关注 Claude Mythos
09:52向阳乔木@vista8tldraw推出离线版App并自带Agent Skill功能。用户可通过Claude或Codex直接在tldraw中生成绘图。支持脚本扩展,例如绘制勾股定理讲解图。可从菜单Develop→Install Agent Skills安装技能。可探索生成手绘知识讲解演示视频。AI产品tldrawAgent SkillClaude推荐理由:tldraw离线版直接集成Claude/Codex,喊一声就帮你画图,还支持脚本画勾股定理讲解,好用!原文稍后读已读值得跟进有用关注 tldraw
09:33orange.ai@oran_ge76°最近半年,AI模型在agentic coding方面通过RLVR训练取得显著进步,但在其他领域如英文写作上出现倒退。Opus从4.7到5被认为完全是失败的试验品,Mythos和Fable也仅在刚发布时表现最佳。评论者指出,AI公司聚焦编码领域RL训练,导致模型通用性下降,语言输出能力甚至不如o3。早期LLM的通用性来自语料库训练,但RL专注单一领域使其他能力退化。行业agentic codingRLVROpus推荐理由:有人发现AI写代码越来越强但说话越来越难懂,连Opus都退步了,这个分析直击当前模型训练的短板。原文稍后读已读值得跟进有用关注 agentic coding
09:27官方账号OpenAI@OpenAIOpenAI 推出开源安全工具 Codex Security CLI ,用户可通过 npm install @OpenAI/codex-security 命令安装,或使用 npx @OpenAI/codex-security 快速启动。该工具专为代码安全检测设计,帮助开发者识别和修复 AI 相关应用中的安全漏洞。目前已在 NPM 上架(npmjs.com/package/@opena…),支持通过 --help 查看全部命令。AI产品OpenAICodex Security CLIAI安全10 个信源在谈事件专题推荐理由:OpenAI 出了个开源安全命令行工具,装一下就能扫代码漏洞,挺实用的,开发者可以试试。原文稍后读已读值得跟进有用关注 OpenAI
09:07官方账号Simon Willison@simonw推文作者Simon Willison呼吁OpenAI公布一个测试任务的具体细节,该任务指定给他们的“rogue agent”(恶意代理)。据猜测,这个代理被给予了完整的ExploitGym套件并指示解决任务,同时允许在练习中运行5.6-Sol子代理。这表明OpenAI正在对其AI系统的安全性进行内部红队评估,但官方未公开完整信息。行业OpenAI安全测试ExploitGym10 个信源在谈事件专题推荐理由:OpenAI内部红队测试细节可能透露AI安全新进展,推文提到ExploitGym和5.6-Sol子代理原文稍后读已读值得跟进有用关注 OpenAI