#思维链
共 44 条 · 7 天 2 条 · 30 天 4 条
信息流里打上「思维链」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
10月7日
EgoLAP:用第一人称人类数据预训练机器人 VLA 模型
想让机器人从人类视频里学技能的可以看看这篇,EgoLAP 不硬抄人类动作,改成学语言化的动作意图,真实任务进度做到 80.1%,比其他表示高 2.3 倍。
9月23日
9月19日
9月9日
9月6日
9月4日
9月3日
9月2日
9月1日
8月31日
8月19日
8月13日
8月11日
8月6日
8月5日
8月4日
7月25日
7月21日
Anthropic论文揭示LLM全局工作空间:思维链与steering向量的可解释机制
Anthropic这篇论文把思维链和steering向量的工作机制讲透了,告诉你什么时候推理是真起作用,什么时候只是马后炮。搞可解释和推理的都该看看。
7月19日
7月11日
7月4日
Fable 5 内部对话泄露:模型用碎片化语言自我推理
Anthropic的Claude模型爆出内部对话,原来它想问题时在喊"DATA! GO! GRRR!",像原始人一样。不是幻觉,是它真实的思考过程。
7月1日
6月30日
6月25日
6月9日
IS-CoT 框架解决长文本生成崩溃,8B 模型超越 DeepSeek-V3.2
长文本生成是 LLM 的硬伤,IS-CoT 用动态规划循环解决了长度崩溃,做内容生成或写作助手的团队可以直接参考这个 8B 模型的训练方法。
6月5日
6月3日
论文10:58
Imaginative Perception Tokens 提升多模态模型空间推理空间推理是多模态模型的短板,IPT 提供了一种不依赖文本思维链的监督方式,做视觉推理或空间理解的团队可以直接参考论文方法。
5月27日
CoT 让大模型拒绝机制更鲁棒:DeepSeek-R1 研究揭示双重编码
这项研究揭示了 CoT 在模型安全中的双重角色——既增强鲁棒性又引入新风险,做 AI 安全和对齐的团队值得关注,尤其是使用推理模型的开发者需要重新评估防御策略。
5月20日
审计推理模型遗忘后记忆残留:Head-Conditioned Canaries 方法
做模型遗忘审计的团队会发现,思维链泄露可能被误判为权重记忆,这篇论文提供了一个简单有效的 sanity check 方法,值得在评估流程中加上。
5月19日
5月15日
DVMap:通过高共识人口-价值映射实现细粒度多元价值对齐
做 LLM 价值对齐的研究者终于有了从人口统计维度精细建模的方法——DVMap 用结构化 CoT 和 GRPO 实现了跨群体泛化,比国家标签更准,建议做 AI 伦理和可控生成的团队点开看看。
InsightReplay:通过洞察回放解决长链推理注意力衰减问题
长链推理的注意力衰减问题终于有了针对性解法,做推理模型优化或长上下文应用的团队值得关注——InsightReplay简单有效,可以直接在现有CoT框架上尝试。