论文Agent 与开发者多源确认18:30高频令牌掩码优化直接偏好优化研究人员发现高频令牌会稀释偏好信号,提出ADPO方法通过掩码这些令牌,在不增加计算成本的情况下提升了模型对齐效果。#DPO#ADPO#Qwen-2.5#Llama-35 个信源在谈事件专题aarXiv: Anthropic@Harshvardhan Saini 等 4 人6 个信源在谈原文稍后读已读值得跟进有用关注 DPO
模型政策与合规12:13ZO-Act:通过一次性激活感知低秩子空间的高效零阶微调ZO-Act用激活信息锁定关键子空间,让零阶微调更稳定,在Llama-3和OPT-13B上都比旧方法强,适合显存受限的场景。#ZO-Act#Llama-3#OPT-13B#微调aarXiv cs.LG@Xun Dong 等 6 人原文稍后读已读值得跟进有用关注 ZO-Act
论文09:26数据库失败时如何安全恢复:面向任务对话中LLM的轻量级提示策略论文用实际数据告诉你,数据库出错时LLM会瞎编内容,但加个简单提示就能把幻觉砍掉一半。不用重训模型,看各家的差距有多大。#DeepSeek-R1#Gemma-2#Llama-3#MistralaarXiv: DeepSeek@Mohammad Alijanpour Shalmani 等 3 人原文稍后读已读值得跟进有用关注 DeepSeek-R1