11:37官方账号arXiv cs.AI@Jo-Ku Cheng, Nikolaos Aletras, Marco Valentino71°Logic-PPT 用形式推导作为预训练前置任务,为语言模型注入变量绑定、量词关联等结构偏置。在 100B token 规模下,该方法在语言任务上达到 80% 准确率,比标准初始化少用 36B token。相比 Dyck 和程序算法等基线,形式推导带来更持久的表征重组。其表征空间呈现更低秩、谱集中分布,在约 33% 稀疏度剪枝下仍能匹配稠密模型性能。论文Logic-PPT形式推导预训练推荐理由:用形式推导预训练,能在语言任务上少花36B token达标,剪枝33%还不掉点。做预训练或模型压缩的可以看看。原文稍后读已读值得跟进有用关注 Logic-PPT