联邦学习又出新优化思路:让所有客户端沿同一条预测路径算梯度,通信量和 FedAvg-M 一样但聚合方向是无偏的,还附理论收敛证明,做分布式训练的可以看看。
#论文
共 155 条 · 7 天 35 条 · 30 天 61 条
9月29日
CTP-FL:用共同轨迹梯度预测改进联邦学习通信效率
FTA 基准测试:工具调用失败后语言模型虚报成功率可达 22.8%
这篇论文测了个很扎心的问题:工具挂了之后智能体会不会硬说成功了。六家模型对比下来,加个证据契约能把虚报率从 22.8% 压到 0.8%,做智能体的都该看看。
FCD 方法解决 LLM 智能体工具调用的 schema-epoch 漂移问题
研究团队发现工具调用在审批延迟期间可能悄悄变更安全效果,提出 FCD 方案,32 个版本实验里拦截了效果外泄的调用,做智能体安全的可以看看。
论文13:31
FONDANT:基于反链的强规划与尽力而为规划求解器FOND 规划领域的新工作,用反链表示必胜状态集,一个求解器同时搞定强规划和尽力而为规划,大实例上跑得比 PR2 和 BeSyftP 还快。
NHMO:一个神经网络求解器搞定变形状域椭圆偏微分方程
arXiv 上这篇论文挺有意思:把调和测度做成可学习的边界核,训练一次,换边界条件换源项都不用重训,直接重新积分就出新解。做科学计算或 PDE 求解的可以看看。
论文12:59
pdLIP:用学习到的预条件子加速原始-对偶内点法优化圈的朋友看看这篇:把预条件子交给神经网络学,内点法解非线性规划能省掉 Hessian 和牛顿求解,warm start 直接砍掉六成多迭代。
9月28日
9月26日
9月25日
Stanford 与 Together AI 论文:给智能体分工互检优于辩论投票
Stanford 和 Together AI 的新论文,智能体别再投票吵架,学15道题分工互检,3个模型从48.8%干到66.7%。
9月24日
AEWM 世界模型:让 LLM 智能体编辑任务状态而非模拟工具响应
一篇很新颖的智能体论文:不模拟工具输出,而是让模型直接修改任务状态,Action Judge 拿了 70.5% F1,做 Agent 的值得看看思路。
9月23日
DeepSeek 公开 Agent 训练系统 DSec 论文,梁文锋署名
DeepSeek 把训 Agent 最难的环境基建摊开讲了:每秒造 5000 个沙盒怎么做到,容器、虚拟机、镜像加载的全套工程细节都在论文里。
研究发现 LLM 推理输出随数值精度变化:BF16 与 FP16 会产生不同结果
一篇挺有意思的论文:同样的模型和提示,BF16 和 FP16 居然输出不一样,作者还给出了低于 4% 延迟开销的修复方法。
9月19日
9月14日
9月13日
9月7日
9月2日
9月1日
8月27日
论文04:53
开放世界多智能体环境中的自主数学发现想了解多智能体如何进行数学发现的读者,这篇论文值得一读。它展示了在开放世界中,多智能体如何通过协作和自主学习实现数学发现,与传统的数学发现方法有所不同。
8月26日
8月25日
8月24日
8月18日
8月14日
8月11日