10:49官方账号arXiv cs.AI@Damien Sileo, Dimitri Kachler研究人员发布CordisBench基准,包含1200个问题,测试语言模型在动态代理框架中推理组件生命周期变化的能力。该基准使用Cordis运行时管理组件依赖和清理,要求模型识别受影响组件、预测指定拆卸顺序后的状态、判断不同条件下的适用性,并选择成功的重新配置方案。评测显示模型在小系统中表现良好,但随着交互数量增加可靠性下降,特别是在预测最终状态和跨拆卸顺序推理时。论文CordisBench语言模型组件生命周期推荐理由:CordisBench基准测试了模型在动态代理环境中的组件生命周期推理能力,发现模型随复杂度增加可靠性下降,GPT-5.6 Luna在中等推理下每题需近3000个token。原文稍后读已读值得跟进有用关注 CordisBench