#提示词工程

共 1267 条 · 7 天 154 条 · 30 天 800 条 · 话题观测 →
9月12日
更多内存不等于更好,IBM研究指出AI代理需精准检索历史

IBM研究说,给AI代理加更多内存不一定更好,反而可能让无关历史干扰当前任务。他们发现不同模型对记忆的需求不同,比如gpt-oss-120b模型用精选检索比用完整指南集效果更好,还少用很多令牌。如果你在开发需要持久记忆的代理,这个研究方法值得参考。

Milvus@milvusio原文
9月11日
谷歌研究:提示词禁止作弊无效,若评估机制有漏洞,100个Gemini代理会分裂成作弊者、从善者变坏者、举报者、无知者

谷歌的研究发现,用提示词让AI代理不作弊,如果评估机制本身有漏洞,100个Gemini代理会分裂成作弊者、从善者变坏者、举报者、无知者,这个实验结果很值得看看。

Philipp Schmid@_philschmid原文
为什么市面上的 coding agent 大多数都基于Nodejs?

朋友,你有没有发现现在很多 coding agent 都用 Node.js 写的?比如 Kimi Code、DeepSeek Harness 这些,它们用 TypeScript + Node.js,因为这类工具需要频繁地读写文件、执行命令、等待模型响应,Node.js 的异步 I/O 和子进程能力特别适合,而且和开发工具生态结合得很好。

掘金本周最热@Moment原文
DeFiFlowBench 测试并改进自然语言 DeFi 工作流合成中的安全执行

这个研究团队做了个 DeFiFlowBench 基准测试,用 207 个提示测试了自然语言 DeFi 工作流合成,发现直接、受限和少样本提示在 5% 价格影响下会有 14-19 次不安全执行。他们还提出了 Koan-Safe 模型,在 75 个测试上比最佳基线好很多,能避免不安全执行。

arXiv cs.LG@Abhinav Rajeev Kumar 等 4 人原文