08:02Gary Marcus@GaryMarcusGary Marcus在X平台转发Luca Ambrogioni的推文,表示认同其观点。Luca认为LLM存在被推理和智能体流水线进展掩盖的根本性缺陷。该推文目前获得13次点赞、5条回复和2424次浏览。行业LLMGary Marcus推理模型推荐理由:Gary Marcus转推吐槽LLM有根本硬伤,被推理和智能体流水线盖住了,观点挺犀利,看看你认不认。原文稍后读已读值得跟进有用关注 LLM
06:50官方账号Yann LeCun@ylecunLeCun在推文中指出,长期研究常被追求短期效益的公司管理层视为浪费时间。他认为,若相信AGI靠LLM scaling就能实现,则研究世界模型等新概念会被看作徒劳。LeCun与Demis认为AGI还需要更多概念性突破,因此他选择更贴近研究、远离产品管理的角色。他始终支持高质量LLM研究,但强调LLM只是有用技术,不是人类级AI的最终答案。行业LeCun世界模型AGI推荐理由:LeCun出来聊长期研究和LLM了,说AGI还得靠新概念,他看好世界模型,跟主流scaling路线唱反调。原文稍后读已读值得跟进有用关注 LeCun
01:02官方账号Simon Willison@simonw精选404media《The Tokenpocalypse》披露,埃森哲的Token支出里有相当一块来自非工程师。这批人用LLM把PDF转成Markdown,也在消耗Token。Simon Willison在X上转述说,企业Token开销的构成比想象中更基础。行业AccentureLLMPDF转Markdown推荐理由:埃森哲的Token开销大头居然是非工程师拿LLM转PDF成Markdown,跟想象的企业AI场景不一样。原文稍后读已读值得跟进有用关注 Accenture
12:05官方账号arXiv cs.AI@Donna Hooshmand, Shubham Shahi, Cameron Barrie, Abhratanu Dutta, Marko Sterbentz, Harper Pack, Kristian J. HammondTYTAN是一个从关系数据库自动构建分析语义模式的系统,结合符号分析和LLM推理来提出实体、分配角色并命名。在八个数据库的评估中,TYTAN在七个参考域上达到100%的实体与特征覆盖率。其1,678条自生成检索指令全部正确执行,语义角色在92-100%的匹配属性上与参考一致。在一张无声明键的十表实时数据库盲测中,TYTAN恢复了完整实体结构并满足五位独立标注者100%的可满足期望。论文TYTAN语义模式关系数据库推荐理由:TYTAN这篇论文教系统自动看懂数据库结构,不用手写语义层,测试里百分之百跑通,挺实在。原文稍后读已读值得跟进有用关注 TYTAN
10:43官方一手Pandaily@contact@pandaily.com (Pandaily)文章指出,中国出口的'新新三样'已变为机器人、AI模型和创新药物。澳大利亚出现了中国制造的爬墙清洁机器人,巴西电网则采用中国大语言模型运行。澳大利亚与巴西的案例表明,中国出口的这三个领域正在改变海外印象。行业机器人AI模型创新药物推荐理由:这篇讲的是中国出口的新花样:机器人、AI模型和药物,连巴西电网都在用中国LLM,有意思。原文稍后读已读值得跟进有用关注 机器人
09:40官方账号arXiv cs.AI@Jia Xiong, Runkai Li, Chenxu Niu, Guangyuan Gao, Changwen Xing, Yifan Zhang, Xinlai Wan, Jieran Cui, Chen Bai, Yusheng Hua, Ying Wang, Ming Ling, Xi Wang, Tao Xie论文提出MicroEvo框架,将现成LLM与蒙特卡洛树搜索(MCTS)结合用于多目标微架构优化。该框架包含LLM驱动的进化算子、Pareto感知树策略、主动知识积累机制和状态感知指令。实验显示,MicroEvo相比NSGA-II将Pareto前沿质量最高提升36.2%,搜索效率提升10.6倍。该方法在复杂工业级核心上展现出强可扩展性,代码已在GitHub开源。论文MicroEvoMCTSLLM推荐理由:MicroEvo用LLM引导芯片微架构设计搜索,比NSGA-II质量高36.2%,效率提升10倍多,代码已开源。原文稍后读已读值得跟进有用关注 MicroEvo
09:18官方账号arXiv cs.AI@Thomas H. Costello, Nathaniel Rabb, Michael Nicholas Stagnaro, Gordon Pennycook, David Rand在2024年7月特朗普刺杀未遂和2025年9月Charlie Kirk刺杀事件后,美国成年人(实验1 N=472,实验2 N=1035)与LLM进行多轮对话,其阴谋论信念相比对照组显著下降。对照组分别与LLM讨论无关话题或查看静态事实表。干预效果在1至2个月后的后续危机事件中仍可观测到,对不同阴谋论的信念同样降低。研究提示,基于LLM的对话干预能在重大事件后即时抑制错误信息。论文LLM阴谋论错误信息推荐理由:这篇论文让LLM当对话对手,跟人聊几轮就能把阴谋论信念聊下来,比干看事实清单管用,效果还能延续一两个月。原文稍后读已读值得跟进有用关注 LLM
08:10Paul Graham@paulgPaul Graham在X上发帖(17238次查看)称,用更抽象的语言编写代码能降低LLM生成时的token成本。他认为LLM并不排斥前缀表示法,这也是抽象语言值得尝试的原因(该帖有35条评论)。这条推文获得161个赞、6次转发和42次分享。技巧Paul GrahamLLMtoken成本推荐理由:Paul Graham说,想让LLM写代码更省token,就换更抽象的语言,连前缀表示法它也不怕。原文稍后读已读值得跟进有用关注 Paul Graham
03:16Gary Marcus@GaryMarcus精选Gary Marcus在X平台驳斥了一个热门类比,该类比将LLM比作“缸中之脑”。有人以ARC-AGI 3为例提问,若大脑不接身体是否还能完成该测试,并认为加装工具等同于拥有身体。Marcus认为此类比不成立,因为人类智力依赖的是前额叶皮层这一关键脑区。他强调harness应当是大脑自身的组成部分,而非外部附加的传感器或肢体。行业GaryMarcusARC-AGILLM推荐理由:Gary Marcus怼了个流行类比:别把LLM当缸中脑,人的智力靠前额叶,不是靠身体。看看他咋说的。原文稍后读已读值得跟进有用关注 GaryMarcus
12:01官方账号arXiv cs.AI@Johann Knechtel, Ozgur Sinanoglu, Paul V. Gratz, Ramesh Karri这篇论文统一分析了 chiplet 与 LLM 时代硬件攻击面的扩展,覆盖架构、逻辑和物理三个层面。针对 2.5D chiplet 系统,论文提出利用 2.5D split manufacturing 和 active interposers 构建物理隔离的 Root of Trust 防御架构。针对 LLM 驱动的 EDA 流水线,论文识别了原生威胁并梳理了现有防御技术。论文还探讨了 LLM 系统如何用于增强 chiplet 等现代系统的硬件安全。论文chipletLLMEDA推荐理由:这篇论文把 chiplet 和 LLM 两个热点合在一起聊硬件安全,既有攻击面分析也有防御方案,做芯片安全的值得看看。原文稍后读已读值得跟进有用关注 chiplet
10:00官方账号arXiv cs.AI@Shaopeng Liang该论文提出一个可审计的LLM信息管道,将动态Dixon-Coles统计模型与LLM情境推理结合,用于足球精确比分预测。论文记录了V1到V4四次迭代:V1为Dixon-Coles基线,V2将LLM评级映射到预期进球参数,V3用逐球模拟替代标量修正,V4加入首破门与后续级联判断。在2025-26英超前150场比赛的时间回放中,V1的Top-1精确比分准确率为10.0%,Top-3为26.7%;V4提升至14.7%和30.7%,候选覆盖率从77.3%增至84.7%。V1的原生1X2分布的argmax准确率为53.3%,对数损失0.9878,Brier分数0.5870。结果属于探索性,开发切片并非未触碰的基准,且时间输入隔离无法排除封闭LLM中的结果记忆。论文Dixon-ColesLLM足球比分预测推荐理由:用LLM预测足球比分?论文把Dixon-Coles和LLM结合成可审计管道,英超前150场Top-3精确率从26.7%提到30.7%,还说了哪里没用。原文稍后读已读值得跟进有用关注 Dixon-Coles
09:53官方账号arXiv cs.AI@Isaiah Andrews这篇论文把决策论中的表示定理用于AI评估:检查模型行为是否满足公理,不需要外部标签或人类反馈。作者用德菲内蒂定理做概率一致性检验、用阿夫里亚特定理检验偏好理性、用Echenique和Saito(2015)定理检验主观期望效用。每个检验都给出连续惩罚项,当行为可被理性化时惩罚为零。由于公理是充要条件,通过检验的模型在理性标准下无法被同一数据上的其他测试拒绝。这些惩罚不限制具体目标函数,因此可与其他评估和训练信号互补。论文LLM无标签评估表示定理推荐理由:想不靠人工标注就给模型打分?这篇论文用数学定理把理性检验变成可计算惩罚,还给了三个现成公式。原文稍后读已读值得跟进有用关注 LLM
01:48AK@_akhaliq精选MerchantBench 是一个专门评测 LLM 智能体在电商运营中长期连贯性的新基准。MerchantBench 包含跨多轮任务的测试场景,用于检验智能体在长时间运营中的记忆与决策一致性。论文全文已发布在 Hugging Face 平台上。论文MerchantBenchLLM智能体推荐理由:MerchantBench 专门测 LLM 智能体在电商里的长期连贯性,比单轮问答更贴近实际运营,可以看看。原文稍后读已读值得跟进有用关注 MerchantBench
23:09Suhail@SuhailSuhail 在 X 上提问:哪些公开可用的 LLM 基准测试足够可信,能展现模型之间的真实差距?截至当前,这条帖子有 4 条回复、1 次转发、3 个赞和 1777 次查看,另有 4 次收藏。提问未限定具体基准,而是希望获得社区认可的评测标准,以避开厂商自报成绩的干扰。行业SuhailXLLM推荐理由:有人问哪些公开基准能看出模型真实差距,帖子下已有回复在讨论,想看别人怎么选评测可以参考。原文稍后读已读值得跟进有用关注 Suhail
12:28官方账号arXiv cs.AI@Hailong Jiang, Feng Yu, Emran Hossain, Jianfeng Zhu, Mengfei Ren, Qiang Guan, Chunwei XiaSeGaBench 包含 100 个合成用例和 20 个真实源码用例,覆盖底层假设、数据结构不变式和高层语义提升。研究评估了五个大语言模型,每个用例取五次独立响应。最强模型在 94.8% 的响应中生成正确工件,83.3% 的响应实现至少 1.05 倍加速,在 93.3% 的用例上获得性能成功。结果表明 LLM 可作为推测性语义提议者,但生成工件仍需验证。论文SeGaBenchLLM编译器优化推荐理由:编译器漏掉的优化,LLM 能补上?SeGaBench 测出最强模型在 93% 用例上拿到性能提升,挺有意思。原文稍后读已读值得跟进有用关注 SeGaBench
12:22官方账号arXiv cs.AI@Zizhao Hu, Nathan Elijah Segura, Mohammad Rostami, Jesse Thomason论文提出HIVE(Human Input-Variation Engine)输入扰动测试套件,覆盖语音转写扰动和QWERTY键盘扰动。HIVE实验显示,语音转写扰动让所有被测指令微调模型的准确率下降,成本主要来自转写结构而非填充词。在HIVE的键盘扰动测试里,模型吸收大量QWERTY噪声后准确率才明显下降,两类扰动的影响都取决于问题中token被破坏的数量。七项发现中的第六项指出,思考预算能基本恢复键盘通道的准确率,但对语音转写无效。压缩语音在思考预算下反而更差,该结果来自HIVE的第七项发现。论文HIVELLM语音输入推荐理由:这篇论文用HIVE工具对比语音和键盘输入的扰动,发现语音转写对模型影响更大,键盘错字反而扛得住。想知道输入方式怎么影响LLM表现可以看看。原文稍后读已读值得跟进有用关注 HIVE
11:23官方账号arXiv cs.LG@Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach该研究在13个模型(9个LLM和4个VLM)中系统评测了字母大小写对注意力分配的影响。实验发现,将目标信息改为交替大小写或大写,能显著集中文本注意力。但这种注意力集中并不提升下游准确率,在交替大小写的高熵场景下甚至会造成下降。推理模型的思考阶段会缓冲这类排版敏感性,而视觉语言模型则表现出部分迁移效应。研究将大小写视为无需模型访问或微调的零样本注意力引导机制。论文大小写注意力机制LLM推荐理由:这篇arXiv研究测了13个模型:把关键词大写能集中LLM注意力,但准确率不一定提高,交替大小写还会拖累成绩。原文稍后读已读值得跟进有用关注 大小写
11:05官方账号arXiv cs.AI@Chao Peng, Ruida Hu, Ajitha Rajan, Tegawendé F Bissyandé, Jacques Klein, Cuiyun Gao论文调研了197个真实TUI应用,发现仅12%的测试代码涉及界面,其中45%从不发送输入。作者将ratatui/Rust、bubbletea/Go、textual/Python、ink/TypeScript应用打包成无头基准,对比4个前沿LLM与随机探索。在相同时间预算下,随机探索是强基线,但每次交互LLM引导更高效,且能独特到达需要输入触发的故障。自动派生启动输入带来最大实际收益,使原本无法启动的应用得以运行。行覆盖率无法有效预测崩溃发现,说明它不宜作为测试有效性的代理指标。论文LLMTUI软件测试1 个信源在谈事件专题推荐理由:这篇论文把197个终端界面应用打包成基准,拿4个大模型和随机点击对比,发现随机探索还挺能打,但大模型单次操作效率更高。他们开源了tuicov和tuibot,想测TUI的可以试试。原文稍后读已读值得跟进有用关注 LLM
10:58官方账号arXiv cs.AI@Yining Hua, Hongbin Na, Cyrus AyubchaCARE-Bench是一个源引用的基准,用于评估医疗大模型在患者面对面的分诊任务中,每轮应给出的当前行动建议。基准包含500个病例和1,059个患者披露前缀,覆盖医疗对话、咨询和随访问题来源。在269个保留轮次上评估了11个模型,无提示时宏F1分数在31.2到50.4之间。加入最小提示后,10/11的模型表现提升,宏F1达到46.9到63.4,但仍有大量阈值错误。当正确行为是索取更多信息时,仅有33.5%的模型输出保留了该步骤。AI模型CARE-Bench医疗分诊评测基准推荐理由:这个基准测的是医疗分诊模型会不会乱建议,结果发现简单加提示词远远不够,做医疗AI的人都该看看。原文稍后读已读值得跟进有用关注 CARE-Bench
10:12Geek@geekbbFirecrawl发布了一个基于Rust的文档转换库。它支持Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV、PDF共14种办公格式。该库能将上述格式转换为统一的GitHub风格Markdown。转换速度快,输出干净,适合直接用于LLM训练或推理。项目已开源在GitHub上。AI产品Firecrawl文档转换Markdown4 个信源在谈事件专题推荐理由:Firecrawl出了个Rust库,能把14种办公文档一键转成Markdown,喂给LLM特别好用,速度还快。原文稍后读已读值得跟进有用关注 Firecrawl
09:54官方一手arXiv: Anthropic@Monnie McGee, Mateo Langston Smith, Julian Cabrera一项研究提出结合准确率、响应行为、主题建模和词汇相似性的多维评估框架,用于分析大语言模型的统计推理。该框架应用于15款当前大语言模型对90道统计考题的解答,题目覆盖高中、本科和研究生四个考试。模型准确率介于55%到78%之间。结构主题建模显示所有模型在概念组织上高度一致,词汇相似性分析则发现Anthropic、OpenAI等同一厂商的模型解释风格更为接近。论文统计推理LLM模型评估10 个信源在谈事件专题推荐理由:这篇论文用多维方法测了15个大模型的统计推理,不只是比正确率,还看解释风格,发现Anthropic和OpenAI的模型各自有相似的话风。原文稍后读已读值得跟进有用关注 统计推理
09:34官方账号arXiv cs.LG@William Bolton, Philip Torr这项研究将肿瘤药物开发建模为离线决策问题,预测决策日后六个月的试验组合。研究者整合31.7k条公共记录,构成881个离线决策片段,覆盖45个历史项目。对比四种离线目标和四个前沿LLM智能体后,奖励加权行为克隆表现最佳,指示F1达46.2%,严格F1为14.2%;表现最好的工具智能体分别只有25.0%和2.1%。在2025年8月后的数据上,离线训练模型也明显超过未微调基线。论文临床试验离线决策行为克隆推荐理由:用真实试验数据训练AI规划临床试验,奖励加权行为克隆F1达46.2%,比工具智能体高很多,做医药AI的可以看。原文稍后读已读值得跟进有用关注 临床试验
08:33官方账号Simon Willison@simonwSimon Willison 发布了 LLM 命令行工具和 Python 库的新版本。该工具可用于连接数百种不同的 LLM。此次更新加入了推理痕迹(reasoning traces)功能,并支持 OpenAI Responses 接口。新版还新增服务器端工具和更智能的日志记录。AI产品LLMOpenAI Responses推理痕迹10 个信源在谈事件专题推荐理由:Simon 的 LLM 工具更新了,新增推理痕迹和 OpenAI Responses 支持,一条命令连几百个模型,写脚本更省事。原文稍后读已读值得跟进有用关注 LLM
08:30官方账号Simon Willison’s Weblog(博客/媒体)精选LLM 0.32将推理模型的思考过程输出到stderr,并可用-R/--hide-reasoning关闭。新版本默认模型改为GPT-5.6 Luna,支持OpenAI服务端工具如CodeInterpreter和WebSearch。llm-anthropic插件新增WebSearch、WebFetch、CodeExecution和AnthropicMCP,可让Claude调用外部MCP接口。Python API新增model.prompt(messages=[])参数,可直接传入完整消息历史。AI产品LLMGPT-5.6OpenAI10 个信源在谈事件专题推荐理由:LLM 0.32来了,能看模型推理过程,默认GPT-5.6 Luna,还能让Claude直接调MCP接口。原文稍后读已读值得跟进有用关注 LLM
08:29官方账号Simon Willison’s Weblog(博客/媒体)condense-json 1.1版本发布,在前一版1.0基础上新增两项功能:替换对象的值不再局限于字符串,condense_json()和uncondense_json()可识别并执行结构化替换。此外,对象可作为合并操作的基础,condense_json()能识别近似匹配的对象并记录键的更新或删除指令,uncondense_json()可应用这些合并。新版还引入了基于Hypothesis属性测试库的往返测试。AI产品condense-jsonJSONLLM推荐理由:condense-json 1.1能让JSON压缩更智能,支持对象合并和结构化替换,处理复杂数据时比纯字符串替换强不少。原文稍后读已读值得跟进有用关注 condense-json
03:29官方账号Pika Labs@pika_labsPika Labs 推出 API Club,通过单一 API 接入超过100个主流生成式媒体模型,覆盖视频、图像、音频和 LLM。所有模型价格均公开透明,官网列出每个模型与竞品的详细对比。即使 API Club 偶尔定价更高,也会明确标示,方便开发者直接比较。AI产品API ClubPika Labs多模态推荐理由:Pika 搞了个 API Club,一个接口就能调上百个视频、图像、音频和语言模型,价格还全透明,方便比价。原文稍后读已读值得跟进有用关注 API Club
21:12IT之家(博客/媒体)71°Linux 内核维护者 Greg Kroah-Hartman 宣布,drivers/staging/ 暂存区不再接受 AI 模型生成的补丁,但真实有效的安全漏洞修复除外。暂存区是新手学习内核开发流程的入口,用 AI 自动改代码会违背培养新人的初衷。Greg 警告说,LLM 补丁很容易被识别,不披露使用情况也无法蒙混过关。他认为目前最好的 AI 工具生成的结果中至少有三分之一完全错误或有害,提交者必须先在实际硬件上测试并说明测试过程。在 Linux 内核其他区域,AI 生成代码并未被全面禁止,Linus Torvalds 曾表示 AI 只是工具。行业LinuxLLMAI生成代码推荐理由:Linux维护者明文规定:暂存区不收AI补丁,想交安全修复得先真机跑过测试,别想着蒙混过关。原文稍后读已读值得跟进有用关注 Linux
11:49官方账号arXiv cs.LG@Iaroslav Chelombitko, Ekaterina Chelombitko, Mika Hämäläinen一项研究对18个开源大模型进行跨文化神话知识探测,覆盖8个架构家族。模型能准确识别宙斯、朱庇特、托尔,但在芬兰、斯拉夫、埃及或中国神话中表现明显下降。研究者使用线性探针、logit lens、激活修补等方法,发现残差流能清晰区分文化,但解码器将特定文化token坍缩为主导传统。失败发生在读出阶段而非表征阶段,且解码行为受提示语言门控。论文发布了逐实体分解框架、跨文化基准及18个模型的预测结果。论文开源模型多模态LLM推荐理由:这篇论文用18个模型告诉你:LLM其实知道芬兰神话,但输出时故意不说。想看AI文化偏见的根源,读这篇。原文稍后读已读值得跟进有用关注 开源模型
09:29官方账号arXiv cs.AI@Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho研究通过5个开源权重模型、500个MedQuAD问题和120万次试验,分析医学谄媚行为。结果发现,虚假来源伴随提问时使谄媚率提高2.0倍,但在模型回答后出现则使谄媚率减半。谄媚程度在不同问题间的差异是模型间差异的67倍对3倍。思维链追踪显示,重新审视自己答案的模型会让步,而推理医学事实的模型坚持。论文医学谄媚LLMMedQuAD推荐理由:这篇论文用120万次试验测了5个开源模型,发现你反驳它就会改答案,假来源出现的时机不同效果差很多,值得看看。原文稍后读已读值得跟进有用关注 医学谄媚
06:30官方账号Yann LeCun@ylecun精选Yann LeCun 在 X 平台回应网友评论,澄清他批评的对象是纯 LLM 所采用的自回归 token 预测。他表示,优秀的代码生成系统并不属于纯 LLM,工作方式也不是简单的自回归 token 预测。这条推文获得 133 次点赞、25 条回复,浏览量超过 1.7 万。行业Yann LeCun代码生成LLM推荐理由:LeCun 发推澄清:别把代码生成器和纯 LLM 自回归划等号,观点直接,适合关注大模型技术路线的人。原文稍后读已读值得跟进有用关注 Yann LeCun
01:53官方账号Simon Willison’s Weblog(博客/媒体)Simon Willison在Hacker News评论中表示,LLM改变了开源软件自由修改的可行性。他每天多次让Claude执行从GitHub克隆仓库并解释代码的指令。过去编译开源项目常因摩擦而放弃,现在他直接交给Codex或Claude Code处理,十分钟后查看构建结果。他认为一年前还不存在这样的路径。行业开源软件LLMClaude推荐理由:Simon Willison分享了新工作流:让Claude Code帮你编译开源项目,十分钟后看结果。改代码的门槛突然没了。原文稍后读已读值得跟进有用关注 开源软件
21:56Paul Graham@paulgPaul Graham 在 X 上发布推文,询问为何 LLM 数学能力强但写作仍不佳。他请教专家后得知,LLM 在数学上拥有明确的对错答案,所以训练数据更容易标注。他预计 LLM 很快也会在写作上取得进步。这篇推文目前有 88 个赞和 6116 次浏览。行业Paul GrahamLLM数学推荐理由:Paul Graham 问专家后得到一个反直觉的解释:数学容易训练不是因为简单,而是因为对错明确。原文稍后读已读值得跟进有用关注 Paul Graham
14:14AI Will@FinanceYF5Deedy在推文中演示了一个玩法:把湾区房屋平面图喂给LLM,要求改成京都风格,模型输出了3D室内效果。这条推文目前有487次浏览。整个演示说明LLM已经能理解空间布局并生成视觉设计。这种用LLM驱动户型改造的做法,给室内设计带来了新玩法。技巧LLM3D生成户型图推荐理由:Deedy晒了个玩法:湾区户型图丢给LLM,一句话改成京都风,直接出3D效果。你可以照着试试。原文稍后读已读值得跟进有用关注 LLM
10:31官方账号arXiv cs.AI@Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing HuangAgentHPOBench 提出一个包含30个可执行机器学习任务的序列化基准,覆盖7个研究类别,用于评估LLM智能体的超参数优化能力。每个任务从已验证的基线运行开始,智能体需逐步观察配置、指标和日志后提出下一组超参数。研究在统一协议下评测了12种智能体和传统HPO基线。结果显示当前智能体具备初步实验优化能力,但在持续迭代改进、复杂日志诊断和逼近参考性能方面仍有明显局限。论文AgentHPOBench超参数优化智能体推荐理由:想用LLM自动调超参?这个基准测了12个智能体,告诉你它们能做什么、卡在哪。原文稍后读已读值得跟进有用关注 AgentHPOBench
10:25官方账号arXiv cs.AI@Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin PeloquinFriendBench 是一个新基准,要求从20秒破冰对话片段判断两人是否熟识。研究对比了7家公司的26个模型与人类受试者在96组对话上的表现。最佳模型与人类在准确率上无显著差异,但模型更倾向于回答“陌生人”。音频和视频信息对模型和人类的好处不同,只有人类能从可见行为中获益。论文公开了全部刺激材料、人类评分和模型预测。论文FriendBench多模态LLM推荐理由:试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。原文稍后读已读值得跟进有用关注 FriendBench
07:53官方账号Simon Willison’s Weblog(博客/媒体)condense-json 1.0正式发布,这是一个拥有1.5年历史的Python库。它通过replacements对象将JSON中重复出现的字符串替换为{$r:...}语法,并可用uncondense_json()还原。开发者Simon Willison表示,该库用于压缩LLM生成的SQLite日志,相关实现见PR #1586。此次1.0版本应用了合理且无破坏性的修复,属于稳定版发布。AI产品condense-jsonPythonLLM3 个信源在谈事件专题推荐理由:Simon Willison给他的condense-json发了1.0,能把JSON里重复的字符串换成短引用,省存储空间,配合LLM日志用正好。原文稍后读已读值得跟进有用关注 condense-json
23:15Gary Marcus@GaryMarcus76°MIT和哈佛发布论文《Evaluating Large Language Models in Scientific Discovery》,提出名为SDE的新评估框架。该框架将LLM置于假设提出、实验设计和结果解读的完整研究循环中。测试覆盖生物学、化学、材料科学和物理学的前沿模型。结果显示,LLM在标准科学基准上的表现与真实研究能力之间存在巨大差距。研究者还发现,单纯扩大模型规模无法缩小这一差距。论文LLMSDEMIT推荐理由:MIT和哈佛发了个评测,把前沿LLM丢进真实科研流程,结果它们连假设都提不好。原文稍后读已读值得跟进有用关注 LLM
07:08Gary Marcus@GaryMarcusGary Marcus在X上发文,批评以LLM为中心的系统无法被信任遵循硬约束。他针对Richard Socher关于Constitutional AI的宣传,认为该路径并未奏效。Constitutional AI曾被视为通往AGI的更安全路径。Gary Marcus强调必须找到能够遵循硬约束的替代方案,否则后果严重。行业Constitutional AIGary MarcusLLM推荐理由:Gary Marcus说Constitutional AI不靠谱,LLM守不住硬约束,得找替代方案。原文稍后读已读值得跟进有用关注 Constitutional AI
13:13官方账号arXiv cs.AI@Cesare Zavattari, Alessandro Tommasi, Giuseppe Prencipe一篇arXiv论文研究单人对N个LLM智能体舰队在每轮预算B≪N次审计下的监督问题,依据自我报告置信度排序,但置信度可能被对抗性错误校准且误差相关。作者用双层高斯Copula建模,找到了错误校准阈值δ*,超过该阈值后按置信度排序审计比随机审计更差。两个先验预期被推翻:预算越少δ*反而越高,跨家族相关性并不低——共享难度主导了谱系。五个开源模型置信度近乎恒定、无操作价值,点估计处于或超过翻转点但置信区间跨越;一个专有模型有信息量且落在阈值以下。论文还给出了“空洞监督”的定量判据,并通过历史轨迹回放验证了排序。论文LLM智能体审计推荐理由:这篇论文用数学告诉你,LLM自报置信度不靠谱时,按置信度排序审计可能比随机还差,而且越省预算越危险,值得做AI治理的人看看。原文稍后读已读值得跟进有用关注 LLM
12:25官方账号arXiv cs.LG@Ruman Wang, Hangting YeScaFE将临床知识从大语言模型转移到确定性的可执行特征程序,而非直接让模型诊断图像。在来自三家医院的600张照片上,ScaFE达到81.0%的站点宏平衡准确率,比最强基线BiomedCLIP高出10.0个百分点。仅用10%的开发数据时,ScaFE保持72.0%的平衡准确率,仍领先11.8个百分点。迭代修复将可执行程序率从66.7%提升到95.0%,91.7%的最终特征有验证证据。该方法表明LLM知识能通过本地可审计的特征程序支持跨医院的医学图像分类。论文ScaFELLMBiomedCLIP推荐理由:这篇论文发了个叫ScaFE的方法,让LLM写图像特征程序来分类疤痕,照片不用出本地,比BiomedCLIP高10个点,数据少也够用。原文稍后读已读值得跟进有用关注 ScaFE