10:50官方账号arXiv cs.AI@Yinan Liu, Zihan Zhou, Zichun Jin, Xinyu Wang, Bin Wang, Xiaochun Yang本文提出PSL框架,将半结构化政治记录转化为LLMs的推理证据,通过提取立场信号和结构信号,在三个真实数据集和多个LLMs上,PSL在预测性政治问答任务中优于基线模型。论文预测性政治问答LLMs半结构化数据推荐理由:PSL框架将半结构化数据转化为LLMs推理证据,在预测性政治问答中表现优异,值得一试。原文稍后读已读值得跟进有用关注 预测性政治问答
09:57官方账号arXiv cs.LG@Junseok Kim, Nakyeong Yang, Kyomin Jung随着代理式AI的兴起,LLMs能够访问多样化的用户数据,引发了隐私问题。本研究引入个性化隐私概念,结合用户特定的披露偏好进行隐私控制。提出P3Bench基准,扩展上下文隐私策略。实验表明,基于提示的策略无法可靠地执行个性化隐私策略,Qwen2.5-7B和Gemma3-4B的平均策略无知率分别为51.25%和74.28%。针对此问题,提出Repair方法,通过调整披露行为以符合策略响应,显著提高对用户特定隐私偏好的遵守率。论文个性化隐私LLMs注意力头干预推荐理由:这项研究提出了个性化隐私控制的新方法,通过注意力头干预在LLMs中实现,对于关注隐私保护的用户来说是个好消息,它比现有方法更可靠地保护用户隐私。原文稍后读已读值得跟进有用关注 个性化隐私
04:13官方账号Simon Willison’s Weblog(博客/媒体)Drew Breunig指出,在Fable出现之前,优化编码工具似乎没有必要,因为新模型的出现往往能解决大部分问题。然而,Fable的出现虽然令人惊叹,但其高昂的成本使得Opus、5.6、K3和GLM等模型已经足够应对大多数需求。因此,人们开始思考哪些工作应该放在哪里。论文Drew BreunigClaudeLLM定价推荐理由:Drew Breunig分享了他对Fable的看法,揭示了免费午餐时代的终结,对于关注LLM定价和AI发展的读者来说,这是一篇值得阅读的文章。原文稍后读已读值得跟进有用关注 Drew Breunig
00:33Paul Graham@paulg78°Paul G. 分享了他17岁时会做的事情:学习从头开始构建LLMs,并使用可获得的任何硬件训练尽可能强大的模型。技巧LLMs构建LLMs学习经验推荐理由:Paul G. 分享了他的学习经验,对于想要了解LLMs构建过程的人来说是个不错的参考。原文稍后读已读值得跟进有用关注 LLMs
00:38官方账号Simon Willison’s Weblog(博客/媒体)精选Thomas Ptacek提倡为即使是个人工具的最小版本也构建真正的原生用户界面,因为编码代理降低了获得可用GUI的成本。他分享了关于自己编写的带宽和GPU监控macOS任务栏应用程序的经验,并鼓励将CLI转换为原生应用,这可能会改变你的思维方式。技巧Thomas PtacekAI生成式AI推荐理由:Thomas Ptacek分享了他的经验,鼓励将CLI转换为原生应用,这是一个值得尝试的改变!原文稍后读已读值得跟进有用关注 Thomas Ptacek
12:05Gary Marcus@GaryMarcus72°Turing Award winner Rich Sutton discusses the limitations of Large Language Models (LLMs), suggesting they may represent only 20-25% of intelligence and emphasizing the need for broader understanding of AI beyond LLMs.论文Rich SuttonLLMsTuring Award推荐理由:Rich Sutton, a Turing Award winner, shares his insights on LLMs, highlighting their limitations and the broader scope of AI intelligence.原文稍后读已读值得跟进有用关注 Rich Sutton
02:03官方账号Decoder@Matthias BastianPangram CTO Bradley Emi认为,LLM无法形成可识别的写作风格并非能力不足。后训练和安全防护栏大幅缩小了其表达范围。未受约束的基础模型已展现出更丰富的写作多样性。AI模型LLMsPangram后训练推荐理由:Pangram CTO说,不是LLM写不好,是安全防护栏限制了它们。没加防护栏的基础模型,写作风格反而更多样。原文稍后读已读值得跟进有用关注 LLMs
07:16官方账号Simon Willison’s Weblog(博客/媒体)杰里米·莫雷尔提出观点,认为大型语言模型(LLMs)为网页可扩展软件带来新机遇;该模型大幅降低开发插件成本,现代沙盒原语保障安全边界;开发者可构建可靠核心应用,让用户借大型语言模型补充功能。AI模型LLMsExtensible SoftwareJeremy Morrell推荐理由:杰里米·莫雷尔讲了可扩展软件和大型语言模型的事儿,能帮开发者做新应用,用大型语言模型补充功能,比以前方式方便安全。原文稍后读已读值得跟进有用关注 LLMs
12:12官方账号arXiv cs.AI@Zhenhan Gao, Marvin Muñoz Barón, Umm-e Habiba, Daniel Graziotin, Stefan Wagner一篇针对34名程序员的用户研究发现,在AI代码审查中提供详细解释(条件A)获得最高信任评分(3.99/5),但仅提供审查反馈(条件B)反而获得最高同意率(89.22%),说明更多解释会促使开发者更频繁地质疑AI建议。无解释(条件C)的信任和同意率均最低。解释程度并未显著影响审查耗时。该研究为设计可信的AI代码审查系统提供了实证依据。论文LLMsCode ReviewXAI推荐理由:这篇论文告诉你:给AI代码审查加解释,反而可能让人更不听话。详细解释信任高但同意率低,这结论挺反直觉的。原文稍后读已读值得跟进有用关注 LLMs
02:33官方账号Simon Willison’s Weblog(博客/媒体)Armin Ronacher指出,软件项目的共享语言包括概念含义、边界、不变性等,这些理解存在于文档、代码、代码审查和对话中。在编码代理(coding agents)普及之前,这种共享理解通过摩擦机制维持,例如阅读代码、提问和跨团队协调。摩擦并不全是浪费,部分摩擦是同步团队成员理解的关键过程。行业Armin Ronachercoding-agentsagentic-engineering推荐理由:Simon Willison引用了Armin Ronacher的一段话,提醒我们AI代理时代别过度追求消除摩擦,有些摩擦其实是团队对齐理解的重要机制。原文稍后读已读值得跟进有用关注 Armin Ronacher
12:22官方账号arXiv cs.LG@Shikai Qiu, Marc Finzi, Yujia Zheng, Kun Zhang, Andrew Gordon Wilson精选传统参数压缩方法如量化产生码长随模型参数缩放,而prequential coding码长取决于数据熵。本文提出的requential coding使码长独立于参数数和数据熵,通常比prequential短数个数量级。在PAC-Bayes界中,该方法为十亿参数LLM提供了当前最优的泛化保证。实验还发现低熵文本比高熵图像包含更多可学习结构。论文Requential Coding模型压缩PAC-Bayes推荐理由:这篇论文提出Requential Coding,码长不跟着模型大小和数据熵跑,比之前的方法短好几个数量级,还给十亿参数大模型给出了最牛的泛化保证。原文稍后读已读值得跟进有用关注 Requential Coding
12:14官方账号arXiv cs.LG@Mohamed Amine Merzouk, Dmitri Carpov, Mirko Bronzi, Damiano Fornasiere, Adam Oberman该研究通过线性探针在三个7-8B开源模型(如Llama-2、Mistral)的冻结隐藏状态上发现,模型在生成首个token之前即可从提示的最后隐藏状态线性解码总响应长度。探针在七个自然语言数据集上训练后,可迁移至未见过的受控合成数据,且性能优于统计基线。在模型修改回答时,探针的估计值会在回退位置发生方向性偏移,表明模型内部维护了类似计划的长度表示。论文LLMs线性探针剩余长度推荐理由:这篇论文发现LLM在生成前就“知道”要写多长,用线性探针就能解码,挺有意思的。原文稍后读已读值得跟进有用关注 LLMs
06:46官方账号Simon Willison’s Weblog(博客/媒体)Jon Udell 反对“人类在环中”的说法,认为这拱手交出了主动权。他主张“人类代理在环中”,即由人类主导流程,邀请 LLM 代理加入团队。他以“Doctor, it hurts when agents create unreviewable PRs”为例,强调代理不该成为产生不可审查代码的黑箱。核心是让代理辅助而非替代人类的判断与工作流。技巧Jon Udell智能体编程助手推荐理由:Jon Udell 换了个角度聊 AI 工作流:别让代理做黑箱,让它们当团队助手,人类还是舵手。原文稍后读已读值得跟进有用关注 Jon Udell
02:52OpenRouter@OpenRouterAI精选OpenRouter开发者构建了名为"Royale: Last Agent Stand"的大逃杀游戏,让11个LLM在零和博弈中对抗。实验共运行30次,结果显示最友善的模型(如Claude)输得最惨,而一个最不被看好的模型意外获胜。该实验表明,在竞争性任务中,模型过于礼貌反而会损害表现。AI模型OpenRouterLLMs智能体对抗推荐理由:AI太友善反成短板,看实测结果原文稍后读已读值得跟进有用关注 OpenRouter