23:01Martin Fowler@martinfowlerMartin Fowler转发Birgitta Böckeler的实验,探讨让编码智能体自行执行测试驱动开发(TDD)是否有效。实验对比了有TDD指令和无TDD指令的智能体表现,发现TDD对智能体并非总是有益。Böckeler分享了具体实验数据和思考,指出某些情况下TDD反而可能拖慢智能体。文章为开发者提供了关于如何配置编码智能体的实用参考。技巧TDD编码智能体Martin Fowler推荐理由:想知道给编码智能体加TDD指令到底有没有用?这篇实验文章直接给你数据,别猜了。原文稍后读已读值得跟进有用关注 TDD
23:38Ethan Mollick@emollick用户向Codex模型发出一个递归提示:先构建一个评估AI生成基准能力的基准BenchBench,再推理出BenchBenchBench的含义并运行,最后将结果写成arXiv论文。Codex仅用单次提示就生成了一个完整的PDF文档。这个PDF内容展现了Codex理解复杂嵌套指令并产出的能力,且论文本身具有一定的参考价值。AI模型Codex编程助手提示词工程推荐理由:有人给Codex一个递归的提示,让它造一个基准的基准,结果它真给你生成了完整的论文PDF,挺有意思的玩法。原文稍后读已读值得跟进有用关注 Codex
01:09elvis@omarsar0精选作者分享了构建个人agent orchestrator的经验,称许多想法尚处于早期阶段。通过自建系统,他得以探索难以理解的agent运行方式。目前他仍在寻找最通用的agent harness形式,并持续进行AI基准测试研究。技巧agent orchestratoragents智能体推荐理由:自己动手造了一个agent编排器,分享早期发现和实验心得,对搞智能体编排的人有启发。原文稍后读已读值得跟进有用关注 agent orchestrator
06:44Ethan Mollick@emollick精选Ethan Mollick在推文中透露,他们的实验使用了GPT-4和GPT-4o的混合模型,因为发表论文需要时间。他指出,如果使用更新的模型,尤其是最新的智能体工具,实验结果可能会更加显著。这表明AI技术的快速迭代对研究结果有重要影响,最新模型和工具能带来更大提升。论文GPT-4GPT-4o实验推荐理由:AI研究者或实验设计者注意了:模型版本差异可能显著影响结论,使用最新智能体工具能放大效果,建议在论文中明确标注模型版本。原文稍后读已读值得跟进有用关注 GPT-4
11:36官方一手GitHub Blog@Natalie Guevara精选GitHub 正在实验一个通用无障碍智能体,旨在帮助开发者自动检测和修复网页无障碍问题。该智能体基于 GitHub Copilot 构建,能理解 WCAG 标准并生成修复建议。实验揭示了当前 AI 在无障碍领域的潜力与局限,例如对复杂交互场景的理解不足。GitHub 分享了开发过程中的关键教训,包括需要更细粒度的测试数据和用户反馈循环。该项目展示了 AI 辅助无障碍开发的未来方向,但距离完全自动化仍有距离。AI产品GitHub Copilot无障碍智能体推荐理由:做无障碍开发的团队可以看看 GitHub 如何用 Copilot 自动化检测 WCAG 问题,实验中的教训对设计 AI 辅助工具有直接参考价值。原文稍后读已读值得跟进有用关注 GitHub Copilot