8月24日
10:50
10:50官方账号arXiv cs.AI@Yinan Liu, Zihan Zhou, Zichun Jin, Xinyu Wang, Bin Wang, Xiaochun Yang
本文提出PSL框架,将半结构化政治记录转化为LLMs的推理证据,通过提取立场信号和结构信号,在三个真实数据集和多个LLMs上,PSL在预测性政治问答任务中优于基线模型。
推荐理由:PSL框架将半结构化数据转化为LLMs推理证据,在预测性政治问答中表现优异,值得一试。
04:13
04:13官方账号Simon Willison’s Weblog博客/媒体
Drew Breunig指出,在Fable出现之前,优化编码工具似乎没有必要,因为新模型的出现往往能解决大部分问题。然而,Fable的出现虽然令人惊叹,但其高昂的成本使得Opus、5.6、K3和GLM等模型已经足够应对大多数需求。因此,人们开始思考哪些工作应该放在哪里。
推荐理由:Drew Breunig分享了他对Fable的看法,揭示了免费午餐时代的终结,对于关注LLM定价和AI发展的读者来说,这是一篇值得阅读的文章。
00:33
8月22日
00:38
00:38官方账号Simon Willison’s Weblog博客/媒体
精选
Thomas Ptacek提倡为即使是个人工具的最小版本也构建真正的原生用户界面,因为编码代理降低了获得可用GUI的成本。他分享了关于自己编写的带宽和GPU监控macOS任务栏应用程序的经验,并鼓励将CLI转换为原生应用,这可能会改变你的思维方式。
推荐理由:Thomas Ptacek分享了他的经验,鼓励将CLI转换为原生应用,这是一个值得尝试的改变!
8月21日
12:05
02:03
8月20日
07:16
07:16官方账号Simon Willison’s Weblog博客/媒体
杰里米·莫雷尔提出观点,认为大型语言模型(LLMs)为网页可扩展软件带来新机遇;该模型大幅降低开发插件成本,现代沙盒原语保障安全边界;开发者可构建可靠核心应用,让用户借大型语言模型补充功能。
推荐理由:杰里米·莫雷尔讲了可扩展软件和大型语言模型的事儿,能帮开发者做新应用,用大型语言模型补充功能,比以前方式方便安全。
7月28日
12:12
12:12官方账号arXiv cs.AI@Zhenhan Gao, Marvin Muñoz Barón, Umm-e Habiba, Daniel Graziotin, Stefan Wagner
一篇针对34名程序员的用户研究发现,在AI代码审查中提供详细解释(条件A)获得最高信任评分(3.99/5),但仅提供审查反馈(条件B)反而获得最高同意率(89.22%),说明更多解释会促使开发者更频繁地质疑AI建议。无解释(条件C)的信任和同意率均最低。解释程度并未显著影响审查耗时。该研究为设计可信的AI代码审查系统提供了实证依据。
推荐理由:这篇论文告诉你:给AI代码审查加解释,反而可能让人更不听话。详细解释信任高但同意率低,这结论挺反直觉的。
7月15日
02:33
7月14日
12:22
12:22官方账号arXiv cs.LG@Shikai Qiu, Marc Finzi, Yujia Zheng, Kun Zhang, Andrew Gordon Wilson
精选
传统参数压缩方法如量化产生码长随模型参数缩放,而prequential coding码长取决于数据熵。本文提出的requential coding使码长独立于参数数和数据熵,通常比prequential短数个数量级。在PAC-Bayes界中,该方法为十亿参数LLM提供了当前最优的泛化保证。实验还发现低熵文本比高熵图像包含更多可学习结构。
推荐理由:这篇论文提出Requential Coding,码长不跟着模型大小和数据熵跑,比之前的方法短好几个数量级,还给十亿参数大模型给出了最牛的泛化保证。