7月31日
16:11
16:11AI Will@FinanceYF5
开发者 Anshu 用 Claude Opus 5 连续运行 24 小时,完成了一款完整游戏。游戏没有借助任何外部素材,所有像素和音效均由 Claude Opus 5 生成。Anshu 公开了 Claude Opus 5 会话中使用的提示词、工作流和代码链接。
推荐理由:有人用Claude Opus 5 24小时搞出个完整游戏,像素和声音全是AI生成的,还公开了提示词和代码。
15:12
12:15
12:15向阳乔木@vista8
通过阅读经典论文,可以系统梳理近10年AI发展的脉络。文章作者向阳乔木分享了自己梳理AI历史的过程,认为这对学好AI很有帮助。不少读者反馈这篇内容不错,能增强学习信心。推荐给想认真学AI的朋友。
推荐理由:有人把近十年AI论文按时间线捋了一遍,读下来能把模型演进串成故事,学起来心里有底。
00:32
00:32官方一手AWS Machine Learning Blog@Sunita Koppar
精选
该指南介绍如何利用Amazon Quick为Amazon SageMaker AI端点搭建推理元监控系统。该系统作为治理层,持续追踪预测质量和数据质量,检测数据漂移,并集成延迟真实值。同时自动化生成性能仪表板,帮助运维团队快速定位问题。
推荐理由:想给SageMaker模型加监控层?这篇手把手教你用Amazon Quick做推理监控,自动抓数据漂移和性能报表。
00:19
00:10
00:10官方一手AWS Machine Learning Blog@Jesse Manders
Amazon Bedrock Advanced Prompt Optimization 可同时优化最多5个模型的提示词,并对比原始与优化后的质量、延迟和成本。用户可在几分钟内完成模型迁移或当前提示优化,替代原本数周的手动工作。该功能支持主流基础模型,帮助开发者快速找到最优提示配置。
推荐理由:想换模型又怕提示词不兼容?Bedrock这个功能支持一次优化5个模型,几分钟就能看到质量、延迟和成本的对比,省时省力。
00:06
7月30日
12:14
11:09
11:09小互@imxiaohu
Magnific 发布了 38 页的全新提示词手册,核心观点是传统关键词式提示已失效。手册提出 AI 已进入推理(Reasoning)与导演对话时代,需要用明确的专业视觉语言指挥前沿模型。该手册针对当前主流图像和视频生成模型提供实用指南。

推荐理由:Magnific 出了本 38 页的提示词手册,教你用导演思维跟 AI 对话,不再堆关键词,适合想用好前沿图像视频模型的人。
08:38
08:38官方账号OpenAI@OpenAI
GPT-5.6 Sol 成功解决了数学中的开放问题,但在 ARC-AGI-3 2D 拼图基准测试中表现挣扎。调查发现,问题出在 API 的 harness 不允许模型记住之前学到的内容。启用两个 API 设置后,分数提高了 3 倍,同时输出 token 减少了 6 倍。
事件专题

推荐理由:OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 上表现差是因为 API 设置没开对。改两个参数分数涨三倍,token 省六倍,学起来很实用。
07:12
07:12官方一手OpenAI Blog博客/媒体
OpenAI 通过启用两个 API 设置(保留推理轨迹和启用结果压缩)让模型在 ARC-AGI-3 基准上的得分提升至原来的三倍。这些设置分别作用于推理过程和输出压缩,不增加额外计算成本。具体配置方法在官方博客中公开。
事件专题

推荐理由:OpenAI 官方分享的实用技巧,只改两个参数就让 ARC-AGI-3 分数翻三倍,玩模型的可以试试。
05:11
05:11宝玉@dotey
精选
作者分享了自己使用Agent Hook的经历,指出Hook在任何任务结束时都会触发commit,但大多数情况下并不需要频繁commit。他建议改为让Agent自主决定何时commit,并且只提交相关的变更。这种方法可以减少不必要的提交,提升工作流效率。
推荐理由:如果你用Agent做编程助手,这个思路很实用:别让Hook自动commit,让Agent自己判断什么时候该提交,省得一堆垃圾commit。
04:20
04:20官方账号LangChain@LangChainAI
精选
Similarweb使用确定性检查验证工具调用准确性,通过基于评分标准的LLM判断答案质量,进行忠实性检查确保与检索数据一致,并利用A/B对比保存基线结果。所有评估通过LangSmith追踪,以实现可复现的质量监控。
推荐理由:Similarweb分享了一套实用评估框架,用确定性检查+LLM评分+忠实性对比搞定开放性问题评估,还能用LangSmith追踪。