AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

DSPy

共 3 条相关 AI 资讯
7月22日
12:40
12:40官方账号arXiv cs.AI@Daniel Pearson, Sidney Shapiro, Emiliano Sebastian Gonzalez Venegas, Sanad Al-Khatib, Aurora Pinzón Arzola
该论文介绍了基于LangGraph的三种可执行工作流方案:SQL分析带修复循环、智能体RAG带证据门控、人工在环策略审查带中断恢复。每种方案展示了类型化状态、条件路由、确定性工具、重试、中断和检查点恢复的组合方式。论文还对比了LangGraph与ReAct、SDK循环、DSPy等方法的适用场景,强调LangGraph适用于需要显式结构的工作流,而非通用默认选项。每份实践方案均说明了何时LangGraph值得额外结构,以及如何使路由、暂停和审计追踪成为显式产品行为。
技巧LangGraphDSPyReAct

推荐理由:这篇论文给了三个LangGraph实操例子,告诉你什么时候用它比ReAct或DSPy更合适,特别适合跑长时间有状态的业务流程。
原文
7月3日
03:19
03:19官方账号Simon Willison’s Weblog(博客/媒体)
精选
Simon Willison用Claude Fable 5通过DSPy自动化优化Datasette Agent的SQL系统提示。测试使用GPT 4.1 mini和nano,发现基线提示中由于schema只列表名、缺少列名,导致模型猜测列名并触发错误重试循环。改进方向包括在提示的schema listing中加入列名、调整“不要重复调用describe_table”的措辞。该研究展示了DSPy在提示优化中的实际应用。
技巧DSPyDatasette AgentClaude Fable 5
事件专题

推荐理由:Simon用DSPy自动调教Datasette Agent的SQL提示,发现了具体bug和优化方向,省去手动试错。
原文
5月27日
10:08
10:08官方一手arXiv: OpenAI@Nafiseh Kahani, Mojtaba Bagherzadeh
精选
多智能体系统日益依赖显式工作流结构(如智能体、工具、访问规则和委托路径),但现有评估主要依赖端到端任务成功率或最终响应质量,难以验证这些声明结构是否真正被测试覆盖。该论文提出一种结构测试方法,将工作流表示为类型化协调图,推导覆盖义务(如可达智能体、允许/限制工具边、委托边),并利用DSPy生成可执行场景。在10个基准测试中,该方法成功覆盖了54/75的允许工具义务和36/48的委托义务,并发现了23/248的限制工具违规。结果表明,结构覆盖为多智能体工作流测试提供了有用的充分性层,能揭示声明结构是否被实际执行。
论文多智能体系统结构测试工作流覆盖

推荐理由:多智能体系统测试长期依赖端到端指标,这篇论文给出了可落地的结构覆盖方法,做AI工作流测试的团队可以直接参考其DSPy实现来补全测试盲区。
原文
精选全部日报登录