论文发现重启推理链的位置本身就有讲究,选对位置在 MATH-500 上能用更少算力超过 self-consistency,做推理成本优化的人可以看。
#DeepSeek-R1
Raschka 又更新了,这讲直接用 PyTorch 手写 GRPO,把 Qwen3-0.6B 的数学成绩从 15% 拉到 47%,想搞懂推理模型怎么训的别错过。
Raschka 又出新教程了,这次手把手带你从零写 GRPO,把 DeepSeek-R1 那套推理训练方法完整实现一遍,还带 MATH-500 评测结果。
拿 Gemma、Llama、DeepSeek 三个模型做了个挺狠的测试:简单题模型根本不看自己的推理,难题上错误会一路传到底,这对做 CoT 监控的人是个警告。
朋友,这篇论文挺有意思的,它不是简单说大模型有偏见,而是具体分析了哪些语言触发器(比如代理性语言、排斥性编码)会导致偏见,还给出了一个具体的审计方法,对做招聘AI系统的人应该挺有参考价值。
SchemaGUI提供了一个新的基准,用于评估可控制GUI生成,特别是对于LLMs在几何空间控制和布局复杂性方面的表现进行了深入分析,对于想要了解GUI生成领域最新进展的人来说是个好资源。
做LLM集群硬件设计的朋友可以看看,这个框架能自动探索芯片间互连方案,在DeepSeek-R1上吞吐提升44%,内存省98%,还开源了。
这篇论文把 GRPO 和 Dr. GRPO 的底裤都扒了——原来两者各占一个极端,没法同时做到无偏和长度无关,搞推理模型训练的人得看看这个权衡。
把Codex、DeepSeek-R1、vLLM的大佬凑一起了,做AI编程和推理的别错过,比刷推特干货多。
这篇论文告诉你:把DeepSeek-R1的推理能力蒸馏到小模型Qwen2.5-7B上,MATH-500能到73%,但回答越短准确率掉得越快。
这篇论文提出了一个叫Patnaik-Pearson的新维度指标,用来分析BERT和DeepSeek模型内部表示的结构变化,还开源了代码,挺实用的。
这篇论文发现LRM自己就能识别风险,用SFT+DPO触发安全分析,让DeepSeek-R1的越狱成功率高降36%,还不用外部数据,挺实用的。
硬件设计领域终于有了大规模开源数据集,做芯片验证或 RTL 生成的团队可以直接用这 13 万样本微调模型,省去自己爬取和标注的麻烦。建议做 EDA 工具或 AI for Hardware 的开发者点开看看。