7月11日
04:03
04:03官方账号Simon Willison@simonw
GPT-5.6 提供了多种模型和推理努力等级,用户常困惑如何选择。据测试,Sol medium 在编程任务上优于 5.5 xhigh。更高的推理等级(Sol 系列)能带来更佳性能,但会快速消耗限额。开发者正在改进沟通方式。
推荐理由:如果你用 GPT-5.6 写代码,可以试试 Sol medium,比 5.5 xhigh 更好用,别被复杂的选项吓到。
02:34
02:34Harrison Chase@hwchase17
Harrison Chase发布新视频,讲解OpenWiki Brains的通用大脑模式。视频涵盖本地配置步骤、系统架构文档、以及新增的‘open questions’ agent文件功能。该模式可帮助用户构建可定制的AI记忆系统。
推荐理由:如果你想自己搭一个通用AI记忆系统,这个视频手把手教配置和架构,还有新功能‘open questions’ agent文件。
7月10日
22:24
22:24Ethan Mollick@emollick
Emollick 在 X 上分享新 ChatGPT 语音功能体验,称其值得花一分钟在手机上试用。该语音模型并非完整的思考模型,智能程度有限但仍令人印象深刻。建议用户尝试时保持对能力边界的认知。
事件专题

推荐理由:Emollick 说新 ChatGPT 语音在手机上用着挺惊艳,花一分钟试试不亏,但别指望它跟思考模型一样聪明。
18:32
14:05
09:03
03:18
03:02
03:02官方账号LangChain@LangChainAI
LangChain指出,只读代理容易进行分支和测试,而涉及生产数据的写访问代理的评估仍是许多团队未解决的难题。该观点出自LangChain与Ben Tannyhill合作的Max Agency项目。推文中未提供具体基准数据,但强调了代理类型差异对测试流程的影响。
推荐理由:LangChain分享了一个很实在的观察:只读代理很好测,但写代理的评估目前大家都没好办法——做AI代理开发的可以看看。
01:32
01:06
01:06Harrison Chase@hwchase17
Palash Shah将在活动中讲解如何使用LangSmith Engine构建自改进智能体,该智能体将生产痕迹转化为持久内存更新以持续优化行为。Clay团队将展示他们开发的智能体评估框架(eval harness)。活动在纽约举办,需RSVP。
推荐理由:如果你做AI智能体,Palash会讲怎么用LangSmith Engine把线上数据变成记忆来改进行为,Clay还会分享他们的评测方案,干货满满。
00:46
00:46elvis@omarsar0
用户 @omarsar0 分享一个常用模式:用 Fable 5 作为评估/判断模型,GPT-5.5 作为执行模型,不依赖单一前沿模型,而是花时间做编排、工具和验证。他表示 GPT-5.6 只需直接替换 GPT-5.5 就能纳入该流程。他预告将发布完整教程,并特别对 GPT-5.6 搭配 Fable 5 的效果更期待。
事件专题

推荐理由:有人用 Fable 5 和 GPT-5.5 搭了个 Executor-Advisor 流程,还说 GPT-5.6 来了能直接换上去用,不用等新模型就能更好地编排工具和验证。
7月9日
13:32
07:40
07:40Notion@NotionHQ
Baseten每天处理数十亿次AI推理调用,因一名AE(Katz)成为全公司知识瓶颈而效率受阻。他们用Notion的Custom Agents构建了Katz的数字分身,将回答时间从平均30分钟降至20秒。该Agent全天候运行,让整个公司能即时获取答案,而Katz得以专注于只有他能完成的交易。
事件专题

推荐理由:Baseten用Notion的Custom Agents把员工Katz的脑子装进了数字分身,原本半小时的答疑现在20秒搞定,全员自取答案,Katz终于可以去干正事了。
07:01
07:01elvis@omarsar0
Claude高级用户认为Fable 5是最佳模型,Codex高级用户则推崇GPT-5.6。忠诚于单一模型提供商是糟糕策略。顶级开发者通过巧妙编排前沿闭源与开源模型来获得更好效果。该推文获得7725次查看和24条评论,反映行业趋势。
事件专题

推荐理由:别只押一个模型了,聪明人已经开始混合使用闭源和开源模型,这条推文用真实数据说明了为什么。