#LLM智能体

共 60 条 · 7 天 7 条 · 30 天 13 条
信息流里打上「LLM智能体」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
10月8日
10月7日
10月5日
10月1日
9月29日
9月28日
9月24日
9月23日
Trains but Doesn't Learn:面向 LLM 智能体交付能力的 Post-Training 基准

这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。

arXiv: DeepSeek@Weihang Ding, Junfei Zhan原文
8月28日
8月26日
8月21日
8月11日
8月10日
8月6日
7月29日
7月22日
7月17日
7月3日
6月30日
6月17日
6月16日
6月15日
6月12日
6月10日
论文多源确认72°10:30
ABC-Bench:评估LLM智能体的生物安全能力基准

这是首个系统评估LLM智能体在生物安全关键任务上能力的基准,做AI安全或生物计算的研究者值得关注——它揭示了当前模型在复制已知协议时很强,但在创新推理上仍有短板。

事件专题
arXiv: OpenAI@Andrew Bo Liu 等 6 人8 个信源在谈原文
6月9日
6月5日
6月4日