论文Agent 与开发者10:21Probe-Space 预训练方法提升零阶训练效率新方法1.5-SPSA让零阶训练比传统方法快1000倍,OPT-13B只需70步就超越MeZO 10万步效果。#1.5-SPSA#ZOO#OPT#零阶优化aarXiv cs.LG@Francois Chaubard 等 3 人原文稍后读已读值得跟进有用关注 1.5-SPSA
论文Agent 与开发者精选10:30一种零阶范式用于大语言模型偏好对齐朋友,这篇论文提出了一种叫ComPO的新方法,能更高效地让大模型符合人类偏好,比传统方法效果更好。#ComPO#偏好对齐#零阶优化aarXiv cs.AI@Peter Chen 等 4 人原文稍后读已读值得跟进有用关注 ComPO
模型政策与合规12:13ZO-Act:通过一次性激活感知低秩子空间的高效零阶微调ZO-Act用激活信息锁定关键子空间,让零阶微调更稳定,在Llama-3和OPT-13B上都比旧方法强,适合显存受限的场景。#ZO-Act#Llama-3#OPT-13B#微调aarXiv cs.LG@Xun Dong 等 6 人原文稍后读已读值得跟进有用关注 ZO-Act
论文精选72°12:00LLM零阶微调本质是推理负载,vLLM实现8倍加速做LLM微调优化的团队终于可以省下GPU时间了——把ZO微调当推理跑,vLLM直接提速8倍,建议做低成本微调的人点开看看实现细节。#零阶优化#微调#推理优化#vLLMaarXiv cs.LG@Zelin Li, Caiwen Ding原文稍后读已读值得跟进有用关注 零阶优化
论文精选10:18AR1-ZO:拓扑感知的秩1零阶查询实现高秩LoRA微调解决了零阶优化与高秩LoRA结合时的信号坍缩问题,做大模型微调且受限于显存的开发者可以直接用AR1-ZO方法提升效果。#零阶优化#LoRA#大模型微调#拓扑感知aarXiv cs.AI@Ziye Chen 等 6 人原文稍后读已读值得跟进有用关注 零阶优化