arXiv 上这篇论文教扩散语言模型同时建模 token 和粗粒度聚类表示,H-CoBit 在 LM1B 上 GenPPL 比基线低 24.2 分,代码也放出来了。
#GSM8K
共 18 条 · 7 天 1 条 · 30 天 6 条
信息流里打上「GSM8K」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月7日
H-CDLM:分层联合扩散框架提升连续扩散语言模型
10月1日
9月29日
论文14:44
QAM 提出二次精度检查点合并方法,误差达 O(h^3) 最优界一篇理论味很浓的 checkpoint 合并论文:证明信息论下界,给出达到 O(h^3) 最优误差的合并系数,还在 SmolLM3-3B 上做了实测对比。
9月23日
研究提出延续式因果测试:CoT 在难题上才真正影响答案
拿 Gemma、Llama、DeepSeek 三个模型做了个挺狠的测试:简单题模型根本不看自己的推理,难题上错误会一路传到底,这对做 CoT 监控的人是个警告。
8月21日
8月20日
8月16日
8月6日
8月4日
7月17日
7月14日
论文11:21
Calibrated e-CUSUM解码用于量化推理模型:为什么Token Log-Probability是错误观测这篇论文告诉你为什么监控量化的DeepSeek小模型不能用token概率,还给出了一个更靠谱的校准方法,真正提升了准确率。
7月6日
7月1日
6月30日
论文13:53
悲观悖论:保守离线训练放大推理模型在线适应中的奖励黑客这篇论文用Qwen3-14B和DPO实验证明,离线训练越保守,在线适应越容易翻车,还在GSM8K上给出了最优保守度公式。做RLHF的值得一读。
6月24日
6月3日