8月24日
02:33
8月23日
01:18
01:18elvis@omarsar0
精选
本文探讨了AI智能体当前存在的问题,如幻觉、成本效率低下等,提出了解决方案。通过将上下文获取视为主动推理,提出了一种名为“最优提问”的方法,并在25至300个候选者的二进制和多路任务上进行了基准测试。

推荐理由:这篇论文提出了AI智能体上下文获取的新方法,值得一读。它通过最优提问,提高了智能体的性能和效率,与现有方法相比有显著不同。
8月22日
03:53
8月21日
22:04
10:56
10:56官方账号arXiv cs.LG@Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki
Task-CoEvolve通过自适应验证任务选择,实现高效LLM智能体 Harness 优化,降低评估成本,提高性能。在在线文本分类和Terminal-Bench 2.1实验中,Task-CoEvolve比固定子集基线表现更优,且优化过程中评估次数减少80%。代码将在GitHub发布。
推荐理由:Task-CoEvolve通过自适应任务选择优化LLM智能体,比传统方法更高效,值得一看。
10:42
6月9日
6月2日
10:31
10:31AI Will@FinanceYF5
Ethan Mollick指出,AI模型发布正加速,尤其是OpenAI和Anthropic。他制作的时间线显示,仅列出在Artificial Analysis指数中得分比前代高3分以上的新模型。这表明AI进步速度加快,竞争激烈。关键细节是,这些模型在性能上有显著提升,而非微调。
事件专题

推荐理由:AI从业者需要了解模型迭代节奏,OpenAI和Anthropic的加速发布意味着技术拐点临近,建议关注时间线以把握趋势。