7月23日
11:28
11:28官方账号arXiv cs.AI@Yiming Wang, Jiayuan Di
本研究系统评估了大型语言模型(LLM)在文化负载翻译中的表现。使用《红楼梦》构建了500条中-日双语数据集,覆盖多种文化类别。发现前沿LLM对文化负载内容存在显著性能差距。人工评估中,不同文化背景的评估者导致明显分歧。常用自动评估指标如BLEU无法可靠评估翻译质量。
推荐理由:这篇论文用《红楼梦》测了LLM翻译文化内容的能力,结果发现GPT-4也不好使,连人工打分都吵起来了。适合关注翻译质量的人看。
7月22日
12:56
12:56官方账号arXiv cs.AI@Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini
本教程汇总了基于大语言模型(LLM)的智能体系统在软件工程、科学发现和金融等领域的生产级部署经验。内容涵盖推理与规划、多智能体协调和评估等研究进展,以及来自实际部署的挑战。通过制药发现和金融系统的应用案例,分析了成功设计模式和失败缓解策略,包括验证管线、回退机制和人在环路监督。
推荐理由:这篇论文从实际部署出发,总结了LLM智能体在软件、金融等领域的成功模式和失败应对,比只看benchmark的研究更有实战价值。
7月21日
12:20
12:20官方账号arXiv cs.AI@Daniela Rojas, Abdulwahab Albassam, Aidan G. Leung, Jett Ngo, Ryan Luo, Peter R. Quawas, Junpyung Kim, Kangkai Liang, Mansi Nanavati, Jonathan Mai, Meng-Chi Tsai, Yun-Tong Tsai, Yize Chen, Yuanyuan Shi
本论文提出了一种基于求解器的设计原则,确保数值结果来自可信工具并通过明确验证。在四个案例研究中,EVAgent在EV充电调度中复现了CVXPY最优解,并将LLM-only的未满足能量减少了7.5-9.5倍;GridDebugAgent修复了17/39个应急案例,总违规减少52.3%。论文提出了一个四组评估框架,涵盖任务效用、求解器正确性、忠实性与安全失败、成本与延迟。核心结论是智能体系统负责编排、检索与解释,可信工具负责计算,验证门控决定报告内容。
推荐理由:这篇论文把LLM智能体怎么用在智能电网上讲得很清楚,给出了具体的数字对比,比如EVAgent减少了7.5倍未满足能量,适合做电网AI系统的实践参考。
11:50
11:50官方账号arXiv cs.LG@Thomas MacDougall, Maksim Kuznetsov, Roman Schutski, Rim Shayakhmetov, Maxim Malkov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov
结构药物设计(SBDD)利用蛋白质靶标3D结构生成候选分子,扩散模型是主流方法。本工作引入3D-Fit基准测试,评估LLM在多约束空间分子生成中的表现,包括蛋白口袋、锚定片段、药效团点及口袋-配体相互作用。结果显示,LLMs虽落后于专用扩散模型,但能同时处理多种空间约束,展现出可扩展的潜力。
推荐理由:这篇论文系统测了GPT等LLM在3D分子生成上的表现,发现它们虽不如专用扩散模型,但能同时处理多种约束,值得关注。
11:27
11:27官方账号arXiv cs.AI@Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang
论文提出Criterion-Distilled Policy Optimization (CriPO),针对评分强化学习中的两个问题:未探索准则(UC)和抑制准则(SC)。分析显示SC在训练中发生率超过57%,平均每样本1.8个SC。CriPO通过在线自蒸馏分别处理UC(构建准则注入自教师)和SC(反事实自教师翻转token级优势),在医学和科学基准上一致优于基线,训练步数减少约2倍。
推荐理由:这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。
11:26
11:26官方账号arXiv cs.AI@Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow, Lin Wang
SelectInfer是一个神经元级优化框架,通过离线分析识别任务特定和通用神经元,实现选择性加载和动态计算。在多个数据集上评估,内存占用减少40%-60%,计算量降低30%-50%,同时保持任务性能。该方法无需重新训练或微调,适用于资源受限的边缘设备。
推荐理由:这篇论文提出了一种在手机上跑大模型的新思路:不加载全部神经元,只算有用的部分。效果不错,内存和计算都省很多,关键是精度没掉。
7月20日
09:20
09:20官方账号arXiv cs.AI@Mazene Ameur, Abdelkader Mekrache, Bouziane Brik, Adlen Ksentini
该论文以教程与综述形式,系统梳理了LLM驱动的智能体AI在5G/6G网络中的应用。Part I形式化5G/6G的控制、管理和AI原生平面,涵盖推理、规划、工具使用、多智能体协调等基础。Part II将智能体能力映射到5G/6G控制面、标准组织及6G主要倡议,指出开放挑战。文章弥补了协议集成、评估和标准化对齐的研究空白。
推荐理由:这篇综述把LLM智能体怎么用在5G/6G网络上讲清楚了,覆盖架构、协议和标准化,做通信AI的可以看看。
09:17
09:17官方账号arXiv cs.AI@Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani, Mitch Weiss
新基准BusinessCaseBench涵盖18个学科数百个商业案例问题,每个问题配有专家编写的评分标准。前沿AI模型在该基准上已获得高分,且同一模型家族在两年内能力大幅提升。结果显示AI在分析性知识工作上的表现已经很高且快速进步。
推荐理由:想看看AI能不能做商业案例分析?这个新基准直接给模型打分,结果挺有参考价值。
7月19日
14:00
14:00官方一手marktechpost@Michal Sutter
本文介绍了10个开源无代码/低代码平台,用于构建LLM应用、RAG系统和AI智能体。每个平台均附带已验证许可证、代码仓库和最佳用例。这些工具将检索、智能体和工作流以可视化及纯英语工具形式交付。
推荐理由:想快速搭LLM或RAG应用?这份列表精选10个开源无代码工具,每个都标了许可证和适用场景,省得你一个个试。
7月18日
19:33
19:33官方一手Sebastian Raschka: Ahead of AI@Sebastian Raschka, PhD
文章介绍了大型语言模型通过训练学习低、中、高三种推理模式的方法。低努力模式快速输出简短回答,中努力模式进行适度推导,高努力模式则执行逐步推理。这种技术允许用户根据任务需求和计算预算灵活调整模型的推理深度。

推荐理由:想省算力又不想牺牲推理质量?这篇技术分享教你LLM如何按需切换推理模式。
17:52
16:15
16:15官方账号Decoder@Tomislav Bezmalinović
美国海军部签署新战略,旨在'武器化'数据和AI,构建'AI优先'舰队。该战略要求大语言模型直接运行在战舰上,并设立AI战争委员会以优先排序任务场景。核心信息是行动缓慢比'不完全对齐'带来更大风险。

推荐理由:美国海军要把AI塞进战舰,直接跑大模型,还认为慢比不准更危险——这思路跟硅谷完全相反。
03:09
03:09官方账号Simon Willison’s Weblog博客/媒体
Simon Willison 对 LLM 生成文章中充斥的套话感到不满,于是用 Fable 5 的 vibe code 开发了一个高亮工具。该工具能识别 10 种常见写作模式,例如“no fluff, no filler, no jargon”这类陈词滥调。用户粘贴文本即可自动标记出这些模式,帮助识别 AI 生成痕迹。
事件专题

推荐理由:Simon Willison 用 Fable 5 搓了个小工具,专门高亮 LLM 文章里那些“无废话、无填充”的套路句,一共 10 种模式,对付一眼 AI 文很好用。
7月17日
7月16日
10:40
10:40官方账号arXiv cs.AI@Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li
Deep Interaction 是一种针对大推理模型的人机交互方法,允许用户直接编辑 Chain-of-Thought (CoT) 推理中的错误步骤。该方法将编辑后的 CoT 精炼为蒸馏提示,引导模型沿校正路径推理。在 STEM 任务上,纠正成功率提升超过 25%,token 使用减少约 40%。实验基于多个 STEM 推理基准,展示了显著的效率提升。
推荐理由:这篇论文提出 Deep Interaction,让你可以直接改推理步骤的错误,不用推倒重来。实验说 STEM 任务上纠错成功率涨 25%,token 还省 40%,挺实用的方法。
09:41
09:41官方账号arXiv cs.AI@Xinhao Cai, Yixuan Sun, Minghang Zheng, Qingchao Chen, Xin Jin, Song-chun Zhu, Yang Liu
该研究提出结构感知框架,将舞蹈建模为原子动作序列。通过分割大规模舞蹈数据并聚类得到原子动作词汇,利用大语言模型进行语义重标和聚类优化。框架包含两阶段:先规划原子动作的类型、时长与时机,再生成平滑连贯的运动。实验在结构连贯性、节奏对齐和感知自然度上显著优于现有基线。
推荐理由:这篇论文用原子动作来编舞,比直接生成连续动作更可控,效果也更自然,做AI舞蹈生成可以看看。