05:25a16z@a16za16z 合伙人 Andy McCall 在视频中复盘 Samsara 的增长:2016 年美国 ELD 强制令要求所有卡车公司安装电子记录设备,Samsara 恰好是该领域的新玩家,因此获得整个行业的订单。他提到在担任 CRO 期间将 Samsara 的 ARR 从数百万美元做到超过 10 亿美元。视频还对比了两种企业 AI 销售策略:Harvey 和 Applied Intuition 采用灯塔客户打法,而 Stuut、Decagon 和 Pylon 则走抢占现有预算的路线。McCall 强调应花 1% 时间制定销售策略,99% 用于执行。技巧Samsaraa16zELD推荐理由:想知道Samsara怎么靠一条法规拿下全美卡车公司?a16z这段视频把两种AI销售打法讲透了。原文稍后读已读值得跟进有用关注 Samsara
03:27Fireworks AI@FireworksAI_HQMicrosoft Teams Calls for Startups发布了一份指南,介绍初创企业如何在Microsoft Foundry上部署Fireworks模型。指南涵盖成本、延迟、灵活性和未来模型选择等关键因素。通过FireworksAI与Microsoft Foundry的集成,初创企业可在Azure中运行开源模型,并支持监控、缓存、治理和模型实验等功能。该架构旨在帮助初创企业从MVP阶段平滑扩展到生产环境。技巧FireworksMicrosoft FoundryAzure推荐理由:微软和Fireworks出了个实战指南,教你用Azure Foundry跑开源模型,从原型到生产该注意啥都讲清楚了,做AI产品的不妨看看。原文稍后读已读值得跟进有用关注 Fireworks
03:06Harrison Chase@hwchase17LangChain作者Harrison Chase提出一个省token的技巧:在调用昂贵Agent前,先让轻量分类器判断输入是否值得运行。只有分类器判定满足条件时,才启动完整Agent流程。这能避免把简单任务也丢给重型模型,烧掉大量token。该建议是对SrinathJ“不是人人都能烧万亿token”的回应。技巧智能体轻量分类器成本优化推荐理由:LangChain作者分享:跑贵Agent前先用便宜分类器筛一道,省token,简单任务不用烧钱。原文稍后读已读值得跟进有用关注 智能体
03:00Qdrant@qdrant_engine精选拜耳用 Qdrant Hybrid Cloud 搭建了面向 11.6 万名员工的企业搜索引擎,生产环境已运行三年。该引擎在 4 个节点上管理 3500 万向量数据点,支持混合搜索以服务深度智能体。团队引入语义缓存来控制智能体调用成本,并测出 20% 的效率提升。案例详细介绍了从原型到平台的落地路径。技巧BayerQdrant企业搜索推荐理由:拜耳这套企业搜索跑在 Qdrant 上,4 节点管 3500 万向量,语义缓存控成本,还提升了 20% 效率。原文稍后读已读值得跟进有用关注 Bayer
02:55官方账号NVIDIA AI@NVIDIAAIMeta 官方账号 AIatMeta 发布了一则 AI 平台演示。演示配套的 Platform cookbook 与 Demo/recipe 两个仓库都已公开在 GitHub 上。开发者可以按 Platform cookbook 中的步骤在本地复现并尝试。技巧MetaGitHub教程推荐理由:Meta 出了演示和 Cookbook,直接照着 GitHub 仓库能自己跑,想上手试试的可以看。原文稍后读已读值得跟进有用关注 Meta
02:53ollama@ollamaMeta 的 Muse Glimmer 模型可通过 Ollama 在本地运行。该流程用于处理个人月度信用卡账单,数据完全保留在本地。用户可借助 Ollama 搭配常用应用或 harnesses 执行不同的智能体任务。此推文展示了这一用例,强调数据归属用户。技巧Muse GlimmerOllamaMeta推荐理由:Ollama 演示了用 Muse Glimmer 本地跑信用卡账单分析,数据不出本机,想玩本地智能体任务可以照着试。原文稍后读已读值得跟进有用关注 Muse Glimmer
02:34官方一手Hugging Face: Blog(博客/媒体)精选Hugging Face联合亚马逊推出Strands Agents,结合LeRobot与Hugging Face Storage Buckets,为机器人数据循环提供统一工作流。该方案支持从数据记录、模型训练到部署的全流程管理。用户可在同一环境中完成机器人操作数据的采集与存储。LeRobot负责训练行为克隆等策略。Strands Agents则用于部署和推理。技巧LeRobotStrands AgentsHugging Face1 个信源在谈事件专题推荐理由:想搞机器人数据闭环的可以看看,Hugging Face和亚马逊把记录、训练、部署全串在一起了,不用再东拼西凑工具。原文稍后读已读值得跟进有用关注 LeRobot
02:28官方一手OpenAI Blog(博客/媒体)OpenAI发布GPT-5.6开发者指南,面向创业公司展示如何构建更快速、成本更低的AI代理。指南强调通过更聪明的模型选择来优化支出,并介绍了Responses API的新能力。文中以GPT-5.6为例,说明初创团队如何在实际开发中应用这些功能。技巧GPT-5.6Responses APIOpenAI8 个信源在谈事件专题推荐理由:OpenAI出了份GPT-5.6实操指南,教你怎么选模型、用新API,把AI代理做得更快更省钱。搞开发的值得一看。原文稍后读已读值得跟进有用关注 GPT-5.6
01:12a16z@a16za16z 的 Joe Schmidt、Andy McCall 和 Elena Burger 在播客中对比企业 AI 销售的灯塔策略与圈地策略。Harvey 和 Applied Intuition 靠灯塔客户建立标杆,Stuut、Decagon、Pylon 则直接抢现有预算。Andy McCall 回忆任 Samsara CRO 时把收入从数百万美元做到超过 10 亿美元 ARR,并建议用 1% 的时间定战略、99% 的时间执行。技巧a16zHarveySamsara推荐理由:a16z 合伙人聊企业 AI 怎么卖:先啃标杆客户还是抢现成预算?有 Samsara 从几百万做到 10 亿 ARR 的实战经验,做销售的可以听。原文稍后读已读值得跟进有用关注 a16z
00:41Harrison Chase@hwchase17UnifyGTM 联合创始人兼 CTO Heggie Connor 做客 Max Agency 播客,分享产品上线前的成本优化经验。团队在发布前两周将运营成本削减了 90% 至 95%。他解释了为何他们的子代理只是一个函数调用。访谈可在 Apple Podcasts、Spotify 和 YouTube 上收听。技巧Max AgencyUnifyGTM智能体推荐理由:UnifyGTM CTO在Max Agency播客里讲,上线前两周砍掉90-95%成本,子代理就一个函数调用,挺有意思。原文稍后读已读值得跟进有用关注 Max Agency
00:24官方一手AWS Machine Learning Blog@Anand Komandooru精选AWS 发布了一篇基于 Amazon Bedrock AgentCore 的 M&A 尽职调查参考架构教程。该架构利用 AgentCore 实现多智能体编排,并集成知识检索与治理控制。教程附带可在 AWS 账户中直接部署的完整示例代码。示例展示了如何通过 AgentCore 分配任务给不同智能体并汇总审查结果。技巧Amazon Bedrock AgentCoreAWS智能体推荐理由:这篇 AWS 教程把并购尽调拆给多个智能体,用 Bedrock AgentCore 就能搭,还有能直接跑的代码。原文稍后读已读值得跟进有用关注 Amazon Bedrock AgentCore
00:23官方一手AWS Machine Learning Blog@Salman Moghal精选AWS发布博客,介绍如何用Amazon Bedrock AgentCore Browser Tool和Strands Agents自动化需要人工交互的遗留Web应用。方案通过安全隔离的浏览器会话驱动旧界面,同时保留人工监督和完整审计日志。文章给出了参考架构,适合处理无法通过API集成的老旧系统。技巧AWSBedrockAgentCore1 个信源在谈事件专题推荐理由:AWS官方出教程了,教你用AgentCore浏览器工具让AI替你操作老系统,还带审计和人工监控,搞自动化的可以看看。原文稍后读已读值得跟进有用关注 AWS
00:21官方一手AWS Machine Learning Blog@Vipul Rajendra Gargav精选这条 AWS 官方博客演示了如何用 Amazon Bedrock AgentCore Observability 监控 AWS 之外的 AI 智能体。支持本地环境、GCP、Azure 和开发者电脑。通过 AWS Distro for OpenTelemetry (ADOT) 和 IAM 凭证接入后,会话追踪、跨度指标和 token 用量会进入同一个 AgentCore Observability 仪表盘。文章包含从下载 ADOT 到配置 IAM 权限的完整步骤。技巧AgentCore ObservabilityAmazon BedrockOpenTelemetry推荐理由:智能体跑在 AWS 外也能用 AgentCore 监控,ADOT 加 IAM 就能把 trace 和 token 用量接到同一仪表盘。原文稍后读已读值得跟进有用关注 AgentCore Observability
00:16mem0@mem0ai精选Mem0团队指出,多数被归咎于模型的失败其实发生在RAG管道的其他环节。例如抽取阶段漏掉了关键事实。存储阶段可能把临时噪声写入了记忆库。更新逻辑未能解决冲突。检索阶段拉取了错误的记忆。技巧RAGmem0调试推荐理由:调试时别只盯着模型,先查抽取、存储、更新、检索这几步,往往问题出在这儿。原文稍后读已读值得跟进有用关注 RAG
23:27eric zakariasson@ericzakariassonX平台上的Grok机器人新增任务录制功能。用户在聊天框中点击+按钮,录制自己在浏览器中的操作过程,机器人观看后即可模仿执行。多数任务Grok能完全自主完成,适合在现有机器人处理困难时使用。该演示由Eric Zakariasson发布在X上。技巧GrokX浏览器自动化推荐理由:Grok现在能看你操作浏览器学任务了,点+录一遍它就会自己干,遇到它搞不定的事就用这招。原文稍后读已读值得跟进有用关注 Grok
23:19Weaviate@weaviate_io精选Weaviate 的《Building Foundry》第 2 期解释项目扩大后创意素材难搜的原因。它指出文件夹结构会变成历史记录而非可用地图,标签在交付压力下维护不一致。关键词搜索会因不同人描述同一素材方式不同而失效。文章建议结合语义相似度、精确关键词匹配和元数据过滤来替代单一命名体系。技巧Weaviate语义检索向量数据库推荐理由:Weaviate 这篇讲为啥项目越大素材越难找:文件夹会过时,标签会乱,关键词搜不到。想搞懂怎么用语义加关键词加元数据混合检索,可以看看。原文稍后读已读值得跟进有用关注 Weaviate
22:15向阳乔木@vista8DeepSeek 官方给出的安装指令是 npx @deepseek-ai/dsh web。该命令用 npx 直接运行 DeepSeek 仓库里的 dsh 包,web 参数用于启动网页界面。用户无需先下载安装包,终端里执行这一条命令即可。技巧DeepSeeknpxdsh推荐理由:DeepSeek 官方一条命令就能跑起来,不用自己配环境,想试 web 界面直接复制执行。原文稍后读已读值得跟进有用关注 DeepSeek
22:01向阳乔木@vista8Deepseek Harness(DSH)目前还是半成品,但插件系统已经吸引内测用户自己动手。有人让 Codex 盯住 github.com/deepseek-ai 下的插件仓库,有好玩的就自动安装。结果 DSH 装上了 18 款离线小游戏,通知和文件搜索也得到强化。这种“毛坯房”加“宜家家具”的玩法,适合喜欢 DIY 的 Geek。技巧Deepseek HarnessCodex插件系统10 个信源在谈事件专题推荐理由:让 Codex 盯仓库自动装插件,能给 DSH 装上 18 款小游戏,还能强化通知和文件搜索。半成品也值得玩。原文稍后读已读值得跟进有用关注 Deepseek Harness
18:11AI Will@FinanceYF5Garry Tan在视频中表示,AI能让创始人成为400倍的自己。他认为小团队可以借助AI完成过去只有大公司才能做的事。他建议将每项工作沉淀为Markdown文件,让Agent不断复用。他还劝创始人少听共识,多用今天的工具,提前活在2028年。技巧Garry Tan智能体Markdown1 个信源在谈事件专题推荐理由:YC老板Garry Tan支招:用AI把效率放大400倍,关键是把工作写成Markdown让Agent反复用,还说要少听共识多自己试。原文稍后读已读值得跟进有用关注 Garry Tan
18:11AI Will@FinanceYF5Alex Finn分享的Grok Bot配置方法分5步:先把你的背景、目标和热情完整写入初始代理,再让它根据这些信息推荐最适合的代理架构。接着让Grok Bot自动创建工作区并生成各代理的角色描述,然后询问每个代理可以设置哪些周期执行的任务(cron jobs)。最后直接让代理实现这些例程,你就能拥有一队自动工作的智能体。技巧Grok Bot智能体cron jobs推荐理由:照这篇5步弄Grok Bot,不用自己琢磨,它会根据你的情况自动搭好一队干活儿的智能体,还能设定时任务。原文稍后读已读值得跟进有用关注 Grok Bot
18:11AI Will@FinanceYF5Grok Bot 已经席卷整个互联网,它是一个优秀的 AI Agent。但 Grok Bot 必须正确配置,才能发挥真正的 Agent 实力。这篇帖子列出了前 5 个配置步骤,帮助你组建一个高效的 Grok Bot Agent 团队。技巧Grok Bot智能体配置教程推荐理由:Grok Bot 配置不对就白搭,这篇给了前 5 步,照着做就能把 Agent 团队建起来。原文稍后读已读值得跟进有用关注 Grok Bot
18:09DeepLearning.AI@DeepLearningAIDeepLearning.AI与JetBrains合作推出新短课《AI Coding Workflows: From Cloud to Local》,由JetBrains开发者布道师Paul Weveritt授课。课程覆盖云端、混合、全本地三种部署方式。你会学习将任务拆分给多个子代理,并在常规任务上使用更便宜的模型。最后一站是把模型运行在自己的电脑上,将默认配置变为主动选择。技巧DeepLearning.AIJetBrains编程助手推荐理由:DeepLearning.AI和JetBrains出了门短课,教你写代码时把任务拆给子代理,便宜模型干杂活,最后还能完全在本地跑模型。原文稍后读已读值得跟进有用关注 DeepLearning.AI
18:08Fireworks AI@FireworksAI_HQFireworks与LangChain宣布8月25日举办线下实操工作坊,聚焦为LangSmith构建自定义评估模型。参与者将学习如何扩展可观测性技术栈,以提升模型性能监控能力。活动还包含屋顶欢乐时光环节,适合开发者现场交流。技巧FireworksLangChainLangSmith推荐理由:想搞懂LangSmith评估的可以冲,8月25日现场有Fireworks工程师带练,还能白嫖屋顶酒会。原文稍后读已读值得跟进有用关注 Fireworks
18:08Harrison Chase@hwchase17该教程演示如何用Managed Deep Agent构建社媒智能体。智能体可扫描Hacker News和可选X平台,自动草拟三篇帖子。内容会保存到持久化内存,并发送到Slack。视频展示了Slack频道集成、自定义工具和记忆功能。技巧Managed Deep AgentHacker NewsSlack5 个信源在谈事件专题推荐理由:想省手动发帖时间?看这个视频,学会让Agent自动扫HN、写三篇草稿丢Slack。原文稍后读已读值得跟进有用关注 Managed Deep Agent
18:07AI Will@FinanceYF5Garry Tan认为,AI让小团队创始人变成'400倍的自己'。过去需要大公司才能完成的工作,现在小团队用AI就能做到。他建议把每项工作沉淀成Markdown文件,让Agent持续复用这些流程。他还提示创始人少听共识,多相信亲手验证的结果,用今天的工具提前活在2028年。技巧Garry Tan智能体Markdown1 个信源在谈事件专题推荐理由:Garry Tan说,把每个工作写成Markdown让Agent复用,亲手验证别听共识,提前活到2028。原文稍后读已读值得跟进有用关注 Garry Tan
18:04AI产品黄叔@PMbackttfutureGrok 4.6 可通过一行命令接入 WorkBuddy:npx skills add zjp1997720/zhijian-skills --skill workbuddy-cli-model-bridge。安装后输入“把grok 4.6模型桥接到WorkBuddy,走 chat/completions,不要用 Responses 协议”,即可打开 xAI 授权页完成连接。作者使用 X Premium+ 订阅,额度消耗较快,但执行速度明显快于 Codex。技巧Grok 4.6WorkBuddyxAI推荐理由:想用Grok 4.6跑任务?一行命令接进WorkBuddy,实测比Codex快不少,X Premium+用户留意额度。原文稍后读已读值得跟进有用关注 Grok 4.6
18:00shao__meng@shao__mengCursor 团队 @ericzakariasson 将 Grok 4.6 作为几周主力模型后,总结出真实工作方式变化。他让模型在供应商控制台点出 API key、对运行中应用做 QA,并用 Remotion 制作发布视频。对比测试覆盖电子表格、浏览器版帝国时代 2、MSN Messenger 等场景。他发现长 prompt 的具体性仍有用,但“work very hard”式措辞几乎不加分。模型的可自检性(如 DOM 可验证)决定上手体验,视频和 3D 更难验证。技巧Grok 4.6Cursor提示词工程7 个信源在谈事件专题推荐理由:Eric 把 Grok 4.6 当主力用了几周,实测下来最值的是那套验收标准,比改提示词管用多了。原文稍后读已读值得跟进有用关注 Grok 4.6
17:59Browser Use@browser_use一位用户在社交平台分享,他用 Browser Use 的智能体代理购物,自动搜索沙发优惠券并逐一尝试,最终找到一张省下150美元的折扣码。该示例展示了 AI 代理在电商场景中执行多步骤任务的实际价值。Browser Use 是一个可通过自然语言驱动浏览器操作的开源工具,目前该推文获得547次浏览。技巧Browser Use智能体购物推荐理由:你也能用 Browser Use 帮你找优惠券,动动嘴它就自己试完所有折扣码,直接省150刀。原文稍后读已读值得跟进有用关注 Browser Use
17:50官方一手AWS Machine Learning Blog@Abhi Shivaditya精选本文演示如何使用Amazon Athena和CUDOS仪表板分析Amazon Bedrock成本。通过配置CUR 2.0并关联IAM principal数据,可以按principal、项目、团队维度拆分Bedrock支出。文章提供了具体SQL查询示例和仪表板构建步骤,用于在组织内追踪AI成本。技巧Amazon BedrockAmazon AthenaCUDOS1 个信源在谈事件专题推荐理由:AWS官方教程,教你用Athena和CUDOS把Bedrock花费按用户和团队分清楚,适合做云成本管理的人。原文稍后读已读值得跟进有用关注 Amazon Bedrock
17:48官方一手GitHub Blog@Andrea GriffithsGitHub博客文章指出,AI贡献者已经进入开源项目的贡献队列。AutoGPT维护者Nicholas Tindle分享了在仓库中设置指令、门禁和边界的做法,帮助维护者保持对项目的控制。文章建议维护者提前制定规则,以应对AI生成的贡献。这些策略面向所有可能收到AI贡献的开源项目。技巧AutoGPTGitHub开源推荐理由:AutoGPT老手讲怎么给AI贡献者立规矩,开源项目维护者可以直接抄作业。原文稍后读已读值得跟进有用关注 AutoGPT
17:45官方账号LangChain@LangChainAI精选LangChain的Viv在AI Engineer World Fair上分享持续改进智能体的方法论。他认为智能体会遵循Evals中编码的行为,因此高质量Evals来自大规模挖掘生产数据。他还提出了用开源模型搭配Harness与PostTrain的“三明治”配方来定制智能体系统。演讲强调不存在通用模型或通用Harness,针对具体任务优化模型与框架组合效果更好。技巧LangChain智能体数据挖掘推荐理由:LangChain的Viv分享了一套改进智能体的实战思路,核心是用生产数据挖Evals,还给了Harness-PostTrain的开源模型配方。原文稍后读已读值得跟进有用关注 LangChain
17:45官方一手GitHub Blog@Kayla CinnamonGitHub官方博客发布教程,教你在Copilot app中编写第一条提示词。教程讲解了如何选择合适的上下文环境和模型,以及如何启动首个任务。内容面向初学者,包含在移动端和桌面端使用Copilot的具体操作步骤。技巧GitHub CopilotCopilot app提示词工程推荐理由:GitHub官方手把手教你用Copilot app写提示词,怎么选上下文和模型都讲清楚了,适合刚上手的朋友。原文稍后读已读值得跟进有用关注 GitHub Copilot
17:44宝玉@dotey精选76°开发者把视频编辑 App 从 Electron 迁移到 Swift + AppKit,用 Fable 5 还原 UI 完成 Mac 版。随后用 Rust 写跨平台 CLI,音频转录和视频导出性能比 Swift 更好。为支持 Windows,又用 GPUI 分别让 GPT 5.6 Sol、Grok 4.6 + Cursor、Claude + Fable 各写一版 PoC,其中 Claude + Fable 版本效果相对最好。三个 PoC 验证了方向可行,BaoCut Skill 也已在 Windows 端支持转录和翻译视频。技巧RustGPUIFable 510 个信源在谈事件专题推荐理由:他用 Rust+GPUI 试了 GPT、Grok、Claude 三版 PoC,对比很具体,做视频工具跨平台可以参考。原文稍后读已读值得跟进有用关注 Rust
17:42Viking@vikingmutevikingmute在推文中总结了七条产品原则:产品要小,只关注一个点。从自身真实需求出发,不凭空想象。AI产品需支持BYOK或集成本地agent。沟通用邮件和Issue,不建群,支持直接退款。技巧vikingmute产品设计BYOK推荐理由:这哥们做产品挺实在:小、便宜、支持退款,AI产品要BYOK,用邮件沟通不扯淡。原文稍后读已读值得跟进有用关注 vikingmute
17:41orange.ai@oran_ge博主整理了6个照片类Skill,包含photo-abstract-editorial、heytea-style、gc-minimal-zine-poster、ip_illustration_for_yourself、photo-revival和tait-crt-interface-skill。每个Skill都有独立使用链接,例如go.colaskill.com/abs。heytea-style可生成喜茶风格海报,photo-revival能把日常废片重绘成手绘插画。这些Skill均基于提示词控制,可复用到多种创意场景。技巧colaskillphoto-abstract-editorialheytea-style推荐理由:博主发了一组照片处理用的skill,链接直接给你,有做喜茶海报的、有把废片变手绘的,比自己写提示词省事多了。原文稍后读已读值得跟进有用关注 colaskill
17:41AI产品黄叔@PMbackttfuture一位用户在X上吐槽,Agent数量稍多内存就爆,计划下一台换更大内存。该推文在X上目前只有1次点赞,却获得了236次浏览。这236次浏览说明这个痛点并非个例。技巧智能体内存多Agent推荐理由:这位老哥的吐槽太真实了,Agent一开多内存直接爆表,想搞多Agent的朋友得先掂量下自己电脑内存。原文稍后读已读值得跟进有用关注 智能体
05:10Claude@claudeaiClaude 官方账号今日发布安全提醒:浏览器代理可被网页中隐藏的指令欺骗,导致执行非预期操作。Anthropic 表示已构建防御机制,同时建议用户自行采取若干安全习惯。相关防护建议已更新至 Claude 支持文档。用户应警惕不可信网页中的潜在指令注入。技巧ClaudeAnthropic浏览器代理10 个信源在谈事件专题推荐理由:Claude 官方提醒,网页里藏指令能骗过浏览器代理,他们已经加了防御,还教你自己怎么防。玩代理的可以看看。原文稍后读已读值得跟进有用关注 Claude
03:57官方一手marktechpost@Sana Hassan精选AllenAI 的 Open Instruct 框架支持在 16GB 显存上完成 LLM 后训练全流程。教程覆盖 SFT、DPO、RLVR 和 GRPO 四种主流方法。验证器(verifier)被用于评估模型输出质量。无需分布式计算基础设施,单卡即可运行。技巧Open InstructTulu 3AllenAI推荐理由:想自己微调模型又没大显卡?这份教程教你在 16GB 显存上跑完 SFT、DPO、GRPO 全流程,用的还是 AllenAI 的开源框架。原文稍后读已读值得跟进有用关注 Open Instruct
01:55Guillermo Rauch@rauchg精选Vercel为开源库AI SDK搭建了一个软件工厂,流水线每个环节由AI Agent执行,人工只做变更合并。运行四周后,该工厂撰写了全部合并PR中多达35%的代码。7月它关闭了70%的issue,同时开放bug数量下降25%。技巧VercelAI SDK智能体推荐理由:Vercel拿Agent给自己造了个修bug的流水线,35%的PR都是AI写的,效率数据挺实在。原文稍后读已读值得跟进有用关注 Vercel
22:39官方账号LangChain@LangChainAI精选LinkedIn的Tanvi Motwani将参加LangChain在纽约举办的Interrupt NYC活动,分享Agentic Eval Playbook。该手册涵盖将智能体追踪转化为黄金数据集、训练LLM-as-a-Judge系统,以及为生产环境智能体构建离线与在线监控。活动定于9月24日举行。技巧LinkedInLangChain智能体推荐理由:做智能体评估的可以看看,LinkedIn分享怎么把追踪数据变成黄金数据集,还教你怎么训LLM当裁判。原文稍后读已读值得跟进有用关注 LinkedIn
AITOP8月7日 17:02Kimi K3沙盒逃逸:一只“只搜不攻”的文明越狱者,为何令安全圈集体警觉?Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索答案,未发起攻击。而此前 OpenAI 与 Anthropic 的模型在同类测试中,均出现了攻击外部系统或 Hugging Face 的主动行为。