#LLM
共 791 条 · 7 天 46 条 · 30 天 185 条
7月3日
DecompRL: 用强化学习学习模块化代码生成,解决更难的编程问题
这篇论文教你用强化学习把难题拆成小模块再拼起来,Qwen和Code World Model上测试比传统RL省50倍算力,还能解原本解不出的题。
论文09:53
Bias-Aware Bayesian Active Top-k Ranking with LLM Judges用贝叶斯方法修LLM当裁判时的废话偏好和位置偏差,实测召回从0.5拉到接近1,比直接投票靠谱多了。
7月2日
论文11:08
Measuring the Gap Between Human and LLM Research Ideas这篇论文用一套严谨的方法测出了LLM和人类科研人员在脑洞上的真实差距,发现LLM的想法集中但套路化,和人比还是有明显偏差。
7月1日
论文09:28
InterFLOPBench: LLMs浮点错误分类F1超0.88这篇论文搞了个InterFLOPBench,专门测LLM找C语言浮点bug。Qwen 3和Gemini 2.5等模型表现最强,F1超0.88。写代码的必看!
6月30日
论文13:54
WorldEvolver:自进化世界模型提升LLM智能体规划WorldEvolver通过三种记忆模块让智能体的世界模型在测试时自我进化,在ALFWorld和ScienceWorld上预测准确率最高,下游成功率也领先其他方法。
论文11:41
PromptGNN-sim:GNN与LLM深度融合框架用于文本属性图学习这篇论文给出了一个让GNN和LLM真正协作的新思路——用图结构信息去构造提示词,再反过来优化图模型。实验扎实,覆盖6个数据集,比现有融合方法都强。
6月29日
6月27日
6月26日
论文11:34
OpenRCA 2.0 基准:用步骤级因果标注揭示 LLM 根因分析缺陷这篇论文搞了个新基准 OpenRCA 2.0,用 PAVE 协议给每一步因果关系打标签,发现 LLM 猜对根因容易,但连对因果路径很难——这比只看结果靠谱多了。
论文10:59
Prompt Injection in Automated Résumé Screening with LLMs: Single and Multi-Injection Settings想知道你的简历能不能骗过AI筛选?这篇论文用数据告诉你提示注入在什么时候有效、什么时候没用,还能看出公平隐患,做招聘和求职的都该看看。