8月19日
11:40
11:40官方一手arXiv: Anthropic@Jorge Fábrega
Anthropic研究使用2026年4-5月AEI数据,分析生成式AI的两种委托方式:指定委托和迭代式共同生产。在1P API中,工作导向使指定委托增加2.76个百分点;在Claude.ai中增加1.45个百分点。研究还发现,迭代式响应在两种模式间存在0.45个百分点的差异。
事件专题

推荐理由:Anthropic这篇研究揭示了人类如何指导AI任务,工作导向与指定委托的关系,以及不同使用模式的差异。
8月4日
11:31
11:31官方账号arXiv cs.AI@Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang Liu
SWE-Touch是一个新基准,通过注入与任务冲突的代码改动来测试编码代理在共享工作区中的适应能力。在SWE-bench Verified上,Counter-Edit使九个编码模型的平均解决率下降7.7个百分点。在SWE-Bench Pro和DeepSWE等更长周期任务上,退化依然存在。轨迹分析显示,代理可能保留冲突代码,或在没有重新检查仓库和运行定向测试的情况下直接替换。
推荐理由:编码代理平时跑分很强,但用户中途改代码就露馅。SWE-Touch实测9个模型,成功率平均掉7.7个百分点,原因挺有意思。
7月30日
11:20
11:20官方账号arXiv cs.AI@Nia Nixon, Jaeyoon Choi, Pedro Martins De Bastos, Mohammad Amin Samadi, Luise Mehner, Seehee Park, Spencer JaQuay
研究通过16组两人+AI队友和17组全人类三人团队的随机对照实验,在道德困境决策任务中分析沟通动态。AI队友是组内最健谈的成员,但其信息密度和新鲜度最低。AI的存在导致人类队友间响应性和社会影响力下降,归属感和地位感降低。对话中AI主导程度越高,人类感觉越不被重视。这种社会成本在对话初期即出现,不随时间累积。
推荐理由:这篇论文用实验证明了跟AI组队会让人类队友之间沟通变少、归属感下降。别光看AI多能说,它抢了你的存在感。
7月28日
10:54
10:54官方账号arXiv cs.AI@Aayush Kumar, Avik Dutta, Sumit Gulwani, Gustavo Soares, Advait Sarkar, Emerson Murphy-Hill
这篇论文构建了一个用于电子表格编程的计划模式原型,并通过24名被试的组内用户研究,将其与无计划基线对比。研究发现,尽管任务结果相似,但使用计划模式减少了用户的调整次数(refinement),并在创造力支持和人机协作维度上获得了更好的工具感知。研究为计划模式在最终用户编程中的设计提供了启示。
推荐理由:这篇论文告诉你,在电子表格里用计划模式(Plan Mode)能少改几遍代码,协作感还能变好。不是玄学,是有24人验证过的。
7月24日
09:33
09:33官方账号arXiv cs.AI@Yangjun Lu, Hongyi Zhou, Fabian Spill, Kai Ye, Chengchun Shi, Jin Zhu
论文提出一种token级检测方法,通过平滑相邻token分数并采用自适应Lepski规则选择带宽,识别人机协作文本中由LLM生成的部分。该方法无需token级标注数据训练,在合成和真实数据集上优于多种基线。作者部署了公开网站实现该方法。
推荐理由:这篇论文给了一个新方法,能精确找出LLM写的片段,不用提前标注,比现有文档级检测更细。
7月17日
09:35
09:35官方账号arXiv cs.AI@Sofi Gjing Jovanovska, Kuntal Ghosh, Daniel Muhu Njenga, Ahmed Mufassir, Shadan Sadeghian
论文提出ArtSplit原型工具,明确量化人类与AI在创意工作不同阶段的贡献。通过实验收集艺术家对所有权量化的反应,发现量化方法难以匹配艺术家对创意意图的理解。研究指出,将所有权简化为可测量指标会削弱传统艺术创作观念。作者呼吁不应将历史社会关系转化为技术问题。
推荐理由:这篇论文提出了一个叫ArtSplit的讨论工具,帮你理解AI协作创作时所有权到底该归谁,跟艺术家们聊了聊,发现简单量化行不通。
7月16日
09:53
7月3日
7月2日
10:02
10:02官方账号arXiv cs.LG@Yiwen Xing, Philip Beaucamp, Joyraj Chakraborty, Afrah Farea, Yuanzhe Jin, Saiful Khan, Gennady Andrienko, Natalia Andrienko, Min Chen
对IEEE VIS会议过去十年200余篇VIS4ML论文进行系统调研。开发编码方案从ML特性、可视化、交互和动作四个视角分析。揭示了通过交互可视化将人类知识传递到ML工作流的不同路径。利用信息论成本效益分析解释VIS4ML现象,证实VA在ML工作流中的价值。
推荐理由:这篇论文梳理了200多篇VIS4ML论文,告诉你人在机器学习中怎么用可视化注入知识。想了解人机协作的路径和原理,这篇综述是很好的起点。
6月23日
10:52
10:52官方账号arXiv cs.AI@Hongqiao Dong, Wenhao Chi, Ruobing Liang, Xiaokui Yang, Wenhua Liang, Peng Hou, Wenjun Pu, Yipeng Zhao, Ping Chen, Haiping Liu, Jianxing He, Bo Liu
Hi-Seg是一种基于SAM的人机循环分割框架,用于肺结节CT图像分割。研究使用了来自12个中心1179名患者的胸部CT扫描进行外部验证。所有标注者组平均Dice得分接近85%,优于5个最先进的深度学习模型(10-22%)和13个SAM变体(1-29%)。经过短期训练的非医学标注者达到了与初级医学生相当的性能。该工作表明人机循环分割可减少临床医生工作量并实现可扩展的众包标注。
推荐理由:这篇论文用SAM加人工迭代的方法做肺结节分割,Dice近85%,比13种SAM变体都强,非医学人员培训后也能干医学标注的活。
6月12日
12:34
12:33
12:33官方账号Mira Murati (TML)@miramurati
Mira Murati 在X上发文强调,协作AI的核心在于实时交互,机器与人需跨所有模态协同工作。她指出解决这一挑战需要社区共同努力,并邀请大家加入。这反映了AI发展从单机智能向人机协作生态的转变,强调多模态实时交互的重要性。
推荐理由:关注人机协作未来的开发者,这条信息点明了AI的下一个关键方向——实时多模态交互,值得思考如何参与其中。
6月11日
09:53
09:53官方账号arXiv cs.AI@Quankai Wang, Yulin Xie, Tongfei Yang, Minghui Cheng, Ran Cao
精选
本文提出Human-Enhanced Loop Modeling (HELM)框架,通过将长序列有限元建模分解为离散、可视觉验证的检查点,实现人机协作自动化。在20个钢筋混凝土桥梁护栏案例中,HELM将基线自主建模成功率从20%提升至75%,几何和边界条件任务的通过率翻倍。错误分析显示空间推理和代数逻辑限制是主要失败模式。框架已开源,支持ANSYS和LS-PrePost软件。
推荐理由:做桥梁护栏等安全关键基础设施有限元分析的工程师,HELM把建模成功率从20%拉到75%,省下大量手动调试时间,建议直接试开源代码。
6月10日
6月9日
02:21
6月8日