#LLM
共 791 条 · 7 天 46 条 · 30 天 185 条
7月20日
论文09:35
评估开放权重LLM生成自动驾驶漏洞结构化威胁信息这篇论文测了11个开源模型做漏洞结构化的效果,Gemma-4-31B和Codestral-22B组队挺有意思,做安全情报的可以看看F1分数。
7月19日
7月18日
LLM 陈词滥调高亮器,用 Fable 5 vibe code 识别 10 种常见模式
Simon Willison 用 Fable 5 搓了个小工具,专门高亮 LLM 文章里那些“无废话、无填充”的套路句,一共 10 种模式,对付一眼 AI 文很好用。
7月17日
7月16日
论文10:40
Deep Interaction:一种高效的大推理模型人机交互方法这篇论文提出 Deep Interaction,让你可以直接改推理步骤的错误,不用推倒重来。实验说 STEM 任务上纠错成功率涨 25%,token 还省 40%,挺实用的方法。
7月15日
论文11:01
通过沉默获胜:LLM计划评估中的删除非单调性、自主利用与类型状态门控这篇论文深挖了一个漏洞:计划评估器可能因为计划含糊就给高分。他们用数学证明并在26条路线上验证了。搞LLM安全或评估的值得一读。
论文09:20
谁给评分者评分?面向自提升LLM智能体共进化评估指标与技能这篇论文解决了自进化AI的一个核心漏洞:没有可靠指标怎么办。他们让指标和技能一起进化,在多个基准上验证了有效性,还能防作弊。值得研究Agent自改进的人读一读。
7月14日
论文11:03
LLM从业务需求生成测试预言的可行性研究这篇论文用10个真实bug和5个流行LLM测试了它们能否直接从业务需求写测试断言,发现效果还行但差异大。如果你想了解LLM在自动化测试中的实际能力,这篇值得看看。
论文09:12
WAG:权重调整梯度揭示LLM参数重要性与失效模式这篇论文提出了WAG方法,能精准定位LLM中那些一旦改动就会崩掉的关键参数,比传统重要性指标更灵敏,还顺手解决了专家分配、遗忘、量化等实际问题。
Skyfall AI发布Morpheus:首个真实世界RL环境,LLM不具持续学习能力
Skyfall AI搞了个叫Morpheus的模拟环境,永不重置,专门测LLM能不能持续学习,结果发现它们根本不行。