#LLM
Pragmatic Engineer 博主 Gergely Orosz 说了句大实话:现在面试都默认你会用 LLM 写代码,不想用 AI 的工程师等于主动放弃 99.9% 的公司机会。
Sakana AI 这篇 TMLR 论文把错误直接种进论文里,再让 AI 审稿去找,还按严重程度分级,比单纯模仿人类审稿的评测靠谱。
arXiv 上的新论文,教长期智能体把过往推理经验压成一个轻量策略,实验里把 DeepSeek 的推理 F1 从 0.789 拉到 0.868,做智能体记忆的可以看看。
Sam Newman 聊他的分布式系统新书,还有段挺扎心的观点:LLM 没有因果概念,所以才会删库。做架构的可以听听。
新加坡国立和 collaborators 出的一篇论文,教模型从一堆论文里提炼新研究点子,训练加检索两条路分开验证,做科研 AI 的可以看看思路。
做自我进化 agent 的可以看看:不用改算法,套个统计检验就能让系统自己判断什么时候停止迭代,省 91.6% 的 token 还不掉点。
论文测了 4 个模型、2.2 万条标签,发现 LLM 在监管规则上判断不可靠,还给出 CoVer 这个修复方案,做合规验证的值得看看。
PaSS 不训练模型,用 INLP 在推理时把人格拆成多维子空间来放大或抑制某种特质,在 MATH-500、GSM8K 上验证比单方向激活导向更细。
Gary Marcus 用掷骰子和 rand() 函数抬杠,讽刺“随机性等于意识”的说法,顺带点名众议员 Lieu,挺好笑又说到点子上。
MIT 实测 GPT-4o、Claude 这些模型玩拍卖游戏,发现让它们“多想想”反而更差,一句话说明规则就能把错误率从 4.2% 降到 0.2%,写提示词的都该看看。
一篇把 LLM 智能体用在自然灾害分析上的论文,亮点是让智能体自己判断该用哪种科学方法,还配套了 141 个实例的基准,代码开源可以直接跑。
LeCun 在 ETH Zürich 直接劝学生别碰 LLM,连生成式模型也一起否了,观点很尖锐,看看他自己的理由。
Karpathy 教你让 LLM 用 ASD-STE100 规范写文档、画图表代替大段文字,还有人晒出接入 Notion 的智能体工作区,做研究写东西都能用上。
Karpathy 分享的提示词技巧:让 LLM 按航天文档规范 ASD-STE100 写解释,输出比默认风格好读多了,文末还有可安装的 Skill。