7月27日
10:58
10:58官方账号arXiv cs.LG@Ritik Raj, Souvik Kundu, Sarbartha Banerjee, Dheemanth Joshi, Ishita Vohra, Tushar Krishna
TRACE-ROUTER 提出任务级路由框架,将每个任务在受理时通过上下文赌博机分配一次模型,后续所有LLM调用均固定到所选后端,并使用最终奖励更新策略。在 tau2-Bench 上,该方法比延迟匹配的单个模型插值高出7-8个准确率点。在 Terminal-Bench 上,相比最强单模型基线,TRACE-ROUTER 以36%更低延迟实现7.1个准确率点提升。该框架无需显式任务复杂度估计,即可学习适应工作负载的路由策略。
推荐理由:这篇论文给出了一个很实用的思路:用任务级反馈来动态路由LLM,不用每次调用都做独立决策。在多个基准上同时提升了准确率和速度。
6月11日
11:28
11:28官方账号arXiv cs.AI@Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone
精选72°
DIRECT 是一个路由框架,利用多模态场景上下文为每个提示分配测试时计算资源,以改善成功-成本帕累托前沿。研究发现,在链式思维深度、模型大小和记忆历史三个缩放轴上,测试时计算并非均匀杠杆,不同轴带来不同能力增益。在 VLABench 和 RoboMME 上的实验表明,DIRECT 在物理 Franka 机械臂上匹配或超越更强模型的成功率,同时平均延迟降低高达 65%。该工作揭示了朴素缩放测试时计算的浪费性,为具身代理的部署提供了更高效的方案。
推荐理由:DIRECT 解决了具身规划中测试时计算资源浪费的问题,做机器人部署和 VLM 应用的团队可以直接参考其路由策略,在降低成本的同时保持性能。