18:15官方账号arXiv cs.AI@Aman Tyagi, Hemanth Boinpally, Jonathan Chen, Douglas Gebert, Steven Hickson该论文提出Agentic Self-Improvement框架,将图像到视频(I2V)生成重构为闭环优化。第一阶段用多模态大模型迭代优化提示词,通过Davidsonian Scene Graph(DSG)查询和Common Mistake Questions(CMQ)分别检测语义一致性与伪影。第二阶段用贝叶斯优化联合调优随机种子和CFG尺度,并引入Video-Text Adherence(VTA)评分作为质量指标。在人类偏好测试中,该方法生成的视频对比无引导搜索方法最高获得69%的胜率。论文Agentic Self-Improvement图像生成视频贝叶斯优化推荐理由:想让视频生成听你的话?这篇论文用多模态大模型加贝叶斯优化调提示词和参数,胜率最高69%,告别瞎试。原文稍后读已读值得跟进有用关注 Agentic Self-Improvement
09:35官方账号arXiv cs.AI@Cameron Cagan, Pedram Fard, Jiazi Tian, Jingya Cheng, Shawn N. Murphy, Hossein EstiriPythia是一个多智能体系统,可自主编写并优化临床概念提取提示词,无需人工工程或微调。在本地运行的开源模型上,Pythia利用开发集的敏感度和特异度选择提示词。与基于词典的方法在72个症状和400份临床笔记上比较,Pythia的平均敏感度为0.76,特异度为0.95;词典则分别为0.82和0.76。对于词典将所有笔记均标记为正的14个概念,Pythia通过要求现在时、患者归因的发现,恢复了平均0.97的特异度。在低于2%患病率的概念上,Pythia的敏感度转移出现0.25的平均差距,而BERT分类器在相同开发集上微调后,敏感度仅为0.23,且低于约5%患病率时降为零。论文Pythia多智能体提示词优化推荐理由:看这篇论文你就知道,不用微调也能高效提取临床症状。Pythia靠多智能体自己写提示词,敏感度0.76、特异度0.95,比传统词典和BERT都稳,还能本地部署。原文稍后读已读值得跟进有用关注 Pythia
06:12官方一手marktechpost@Sana Hassan本文详细介绍了微软SkillOpt的编码实现,包括仓库搭建、OpenAI兼容模型接入、优化器与目标模型配置。通过完整的优化循环(回滚、反思、聚合、选择、更新、验证门控),评估了原始种子技能作为基线,并运行了真实优化。最后通过训练历史、准确率、编辑预算行为和Token使用可视化,对比了进化后的技能与基线性能。AI产品微软SkillOpt提示词优化10 个信源在谈事件专题推荐理由:做提示词工程和自动化优化的开发者可以直接参考这套端到端实现,SkillOpt的验证门控机制能有效提升技能进化质量,值得动手试一下。原文稍后读已读值得跟进有用关注 微软
23:52官方账号LangChain@LangChainAILangChain 推出 LangSmith Engine,允许开发者审查 Agent 的追踪记录,从而发现提示词和代码中的 Bug 及改进点。Agent 能在运行间隔中回顾对话、从实际使用中学习,并自动更新 Context Hub 文件。这有助于提升 Agent 的可靠性和性能,减少人工调试工作量。AI产品LangSmith EngineAgent 追踪调试工具推荐理由:做 Agent 开发的团队终于有了自动化的调试工具——LangSmith Engine 能直接从追踪中学习并优化提示词和代码,建议正在维护复杂 Agent 的开发者试试。原文稍后读已读值得跟进有用关注 LangSmith Engine
01:16Philipp Schmid@_philschmid开发者Phil Schmid分享了一种使用GEPA自动优化任何CLI Agent提示词的方法。GEPA接受任何`(str) -> str`的可调用对象,兼容自定义CLI、本地模型或API Agent。只需将Agent封装在Python函数中,即可让其自我优化提示词。该方法可显著提升Agent的响应质量和效率,减少手动调优的工作量。AI产品GEPA提示词优化CLI Agent推荐理由:做Agent开发的团队终于有了自动化提示词优化的工具——GEPA支持任何CLI Agent,封装成函数就能自优化,省去反复手动调参的麻烦,建议试试。原文稍后读已读值得跟进有用关注 GEPA
08:01官方账号LangChain@LangChainAILangChain 的 Palash Shah 分享了一种针对长时运行 AI Agent 的评估方法。核心思路是将复杂的评估任务拆解成更小、更易处理的子任务,这样不仅便于人类理解,也更容易让 LLM 自身进行评估。他举例说明,对于运行超过 30 分钟的 Agent,通过从追踪中提取推理过程,找出特定行为的根本原因,然后重建简化版的评估场景。这种方法可以快速测试提示词调整的效果,而无需每次都运行完整的长时间评估。AI产品LangChainAI Agent评估方法推荐理由:做长时 AI Agent 评估的开发者终于有了实用技巧——拆解任务后评估效率大幅提升,建议直接参考这个流程优化你的评估策略。原文稍后读已读值得跟进有用关注 LangChain
10:51官方一手arXiv: DeepSeek@Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. Ajila精选研究人员提出一个基于强化学习的框架,将提示词优化建模为序列决策问题。PPO代理通过混合动作空间(直接生成、遗传变异、语义重写)迭代改进提示词,并利用单元测试反馈的奖励信号驱动优化。在MBPP+、HumanEval+和APPS基准上,使用CodeT5+、CodeLLaMA和DeepSeek-Coder作为冻结代码生成器,PPO代理在MBPP+的500任务测试集上分别达到57.58%、64.80%和85.50%的严格Pass@1,优于EPiC、Reflexion和随机混合方法。软Pass@1分别达到67.90%、73.10%和88.20%。结果表明,带形状奖励的强化学习能显著提升LLM代码生成的功能正确性。论文提示词优化强化学习代码生成推荐理由:做LLM代码生成或提示词工程的开发者,这个框架直接解决了提示词敏感性问题——用RL自动优化提示词,比手动调参高效得多,建议关注其混合动作空间和奖励设计。原文稍后读已读值得跟进有用关注 提示词优化
10:00官方账号arXiv cs.AI@Zheqin Yin, Yupei Ren, Yadong Zhang, Yujiang Lu, Man Lan精选现有研究在通过提示词准确理解和评估议论文方面存在不足。本文提出TIDE框架,通过引入“试验与辩论”机制,优化基于标准的提示词优化过程,减少噪声训练数据的影响并提升优化稳定性。在自动作文评分、论证成分检测和论证关系识别三个核心任务上,TIDE均提升了性能。该工作展示了结合提示词方法与辩论机制在高级论证理解中的潜力。论文议论文理解提示词优化辩论机制推荐理由:做教育AI或文本评估的团队,TIDE用辩论机制解决了提示词优化中的噪声和稳定性问题,值得在议论文分析场景中尝试。原文稍后读已读值得跟进有用关注 议论文理解
22:17官方一手歸藏(guizang.ai)@op7418抖音上流行的“法天象地”效果(将户外照片转化为奇幻场景)最近非常火爆。用户@op7418 发现,直接生成视频比图片效果更佳。他通过优化提示词,使用 GPT-Image-2.0 和 C-Down 3.0 模型组合,实现了高质量的视频生成。提示词已附在视频后。这一方法展示了多模型协作在创意视频生成中的潜力。AI产品视频生成GPT-Image-2.0C-Down 3.0推荐理由:该案例提供了生成式AI在短视频特效中的应用思路,适合内容创作者和AI视频工具爱好者参考,展示了模型组合的实用价值。原文稍后读已读值得跟进有用关注 视频生成