10:55官方账号arXiv cs.AI@George Andrikopoulos当专家修正大型语言模型助手的错误时,通常无法长期保存纠正信息,错误类别会再次出现。作者认为这是运营问题而非工具问题,现有机制可持久化纠正但缺乏管理规范。将大语言模型堆栈映射到传统机械系统,识别出配置绑定和验证阶段的缺陷。基于此提出七原则操作系统模型,包含错误循环。论文LLM人机协作系统工程师推荐理由:系统工程师讲了怎么优化大语言模型操作,能解决错误留存难题,和普通工具用法不一样。原文稍后读已读值得跟进有用关注 LLM
11:40官方一手arXiv: Anthropic@Jorge FábregaAnthropic研究使用2026年4-5月AEI数据,分析生成式AI的两种委托方式:指定委托和迭代式共同生产。在1P API中,工作导向使指定委托增加2.76个百分点;在Claude.ai中增加1.45个百分点。研究还发现,迭代式响应在两种模式间存在0.45个百分点的差异。论文AnthropicClaudeAI治理10 个信源在谈事件专题推荐理由:Anthropic这篇研究揭示了人类如何指导AI任务,工作导向与指定委托的关系,以及不同使用模式的差异。原文稍后读已读值得跟进有用关注 Anthropic
09:25IT之家(博客/媒体)NEC于8月初成立“企业人工智能与劳动力部门”,所有员工角色均由AI扮演,包括部门主管、委员会、经理和一般员工4个层级。该系统让AI自主处理从任务定义到执行和自我进化的所有环节,真人负责质量管理和控制。AI员工需接受入职培训,学习NEC的价值观和行为准则。该部门每周收集AI员工的意见并在AI委员会上讨论解决。NEC表示,AI能持续执行管理分析、模拟和风险预测,将核心操作用时缩短至原来的约1/7。行业NECAI员工企业AI推荐理由:NEC搞了个全AI员工部门,从主管到员工全是AI,真人只管质量。AI还能自己开会提意见,核心操作快7倍。想看看人机协作怎么玩,这篇值得看。原文稍后读已读值得跟进有用关注 NEC
01:45向阳乔木@vista8推文提到,有工程师完全不写代码,工作全交给agent。但这些agent产出的东西需要人的判断和审查,工作量没少、难度反而上去了。推文还以特斯拉为例,称其能接管方向盘是因为终点和路线都确定;知识工作大多不知道终点,不确定性正是人不可替代的原因。技巧特斯拉智能体编程助手推荐理由:推文把用AI的心态讲透了,恐惧和好奇都会被放大。一个工程师把活全交给agent后,工作量没减难度反升,现实。原文稍后读已读值得跟进有用关注 特斯拉
11:31官方账号arXiv cs.AI@Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang LiuSWE-Touch是一个新基准,通过注入与任务冲突的代码改动来测试编码代理在共享工作区中的适应能力。在SWE-bench Verified上,Counter-Edit使九个编码模型的平均解决率下降7.7个百分点。在SWE-Bench Pro和DeepSWE等更长周期任务上,退化依然存在。轨迹分析显示,代理可能保留冲突代码,或在没有重新检查仓库和运行定向测试的情况下直接替换。论文SWE-TouchSWE-bench VerifiedCounter-Edits推荐理由:编码代理平时跑分很强,但用户中途改代码就露馅。SWE-Touch实测9个模型,成功率平均掉7.7个百分点,原因挺有意思。原文稍后读已读值得跟进有用关注 SWE-Touch
11:20官方账号arXiv cs.AI@Nia Nixon, Jaeyoon Choi, Pedro Martins De Bastos, Mohammad Amin Samadi, Luise Mehner, Seehee Park, Spencer JaQuay研究通过16组两人+AI队友和17组全人类三人团队的随机对照实验,在道德困境决策任务中分析沟通动态。AI队友是组内最健谈的成员,但其信息密度和新鲜度最低。AI的存在导致人类队友间响应性和社会影响力下降,归属感和地位感降低。对话中AI主导程度越高,人类感觉越不被重视。这种社会成本在对话初期即出现,不随时间累积。论文AI teammate团队沟通人机协作推荐理由:这篇论文用实验证明了跟AI组队会让人类队友之间沟通变少、归属感下降。别光看AI多能说,它抢了你的存在感。原文稍后读已读值得跟进有用关注 AI teammate
11:19官方账号arXiv cs.AI@Peter Tisnikar, Maja Swieczkowska, Benteng Ma, Gerard Canal, Matteo Leonetti论文将临时团队合作(AHT)扩展至多任务场景,提出CE-CM方法,通过贝叶斯推断从少量任务中在线学习隐藏的合作伙伴能力向量。CE-CM采用仿真采样构建上下文多智能体MDP进行规划,无需群体预训练。针对人类行为不可预测性,CE-CM-Div通过多样化规划轨迹评估能力假设,在模拟实验中快速恢复隐藏能力并减少不可行动作分配。基于225条人类轨迹的离线研究显示,CE-CM-Div比基线CE-CM显著提升能力估计准确性。论文CE-CMAd-hoc Teamwork能力估计推荐理由:研究团队提出了CE-CM和CE-CM-Div两种能力估计方法,能让AI在未知合作伙伴能力时快速适应,还考虑了人类行为多样性,看模拟和真人实验结果都挺有说服力的。原文稍后读已读值得跟进有用关注 CE-CM
10:54官方账号arXiv cs.AI@Aayush Kumar, Avik Dutta, Sumit Gulwani, Gustavo Soares, Advait Sarkar, Emerson Murphy-Hill这篇论文构建了一个用于电子表格编程的计划模式原型,并通过24名被试的组内用户研究,将其与无计划基线对比。研究发现,尽管任务结果相似,但使用计划模式减少了用户的调整次数(refinement),并在创造力支持和人机协作维度上获得了更好的工具感知。研究为计划模式在最终用户编程中的设计提供了启示。论文Plan ModeSpreadsheet Agents人机协作推荐理由:这篇论文告诉你,在电子表格里用计划模式(Plan Mode)能少改几遍代码,协作感还能变好。不是玄学,是有24人验证过的。原文稍后读已读值得跟进有用关注 Plan Mode
18:33官方一手OpenAI Blog(博客/媒体)OpenAI发布的新研究显示,使用ChatGPT的用户正在跨角色承担更多任务,重新定义工作边界。研究基于对大量用户行为的分析,发现AI工具使非专业岗位也能完成原本需要特定技能的工作。例如,营销人员开始参与数据分析,工程师也涉足文案撰写。这暗示AI可能在未来模糊职业分工。行业OpenAIChatGPT人机协作10 个信源在谈事件专题推荐理由:OpenAI出了份真实用户数据研究,讲ChatGPT怎么让员工跨岗干活的,挺开脑洞。原文稍后读已读值得跟进有用关注 OpenAI
11:26官方账号arXiv cs.AI@Fares Fourati, Hinrich Schütze, Eyke Hüllermeier, Iryna Gurevych这篇论文挑战了自动化可以无限取代人类的假设,提出了人类参与即使在高能力AI系统中也会持续存在的三种原因。技术互补性理由指出人类提供了AI无法替代的能力或视角。规范性或发展性理由强调参与本身对人类能动性和学习的价值。最关键的是目标涌现理由:某些活动的目标并非事先完全确定,而是通过交互本身涌现,此时人类参与构成了目标的一部分。论文基于这些论点论证了人机共同构建不是对不完美AI的临时应对,而是某些活动的持久特征。论文自动化人机协作人类参与推荐理由:这篇论文从哲学和理论层面分析了为什么有些事AI再强也替代不了人,不是技术不行,而是目标本身就得人参与才能定义。看完会重新理解自动化的真正边界。原文稍后读已读值得跟进有用关注 自动化
09:33官方账号arXiv cs.AI@Yangjun Lu, Hongyi Zhou, Fabian Spill, Kai Ye, Chengchun Shi, Jin Zhu论文提出一种token级检测方法,通过平滑相邻token分数并采用自适应Lepski规则选择带宽,识别人机协作文本中由LLM生成的部分。该方法无需token级标注数据训练,在合成和真实数据集上优于多种基线。作者部署了公开网站实现该方法。论文LLMtoken级检测文本检测推荐理由:这篇论文给了一个新方法,能精确找出LLM写的片段,不用提前标注,比现有文档级检测更细。原文稍后读已读值得跟进有用关注 LLM
09:35官方账号arXiv cs.AI@Sofi Gjing Jovanovska, Kuntal Ghosh, Daniel Muhu Njenga, Ahmed Mufassir, Shadan Sadeghian论文提出ArtSplit原型工具,明确量化人类与AI在创意工作不同阶段的贡献。通过实验收集艺术家对所有权量化的反应,发现量化方法难以匹配艺术家对创意意图的理解。研究指出,将所有权简化为可测量指标会削弱传统艺术创作观念。作者呼吁不应将历史社会关系转化为技术问题。论文ArtSplit创意所有权人机协作推荐理由:这篇论文提出了一个叫ArtSplit的讨论工具,帮你理解AI协作创作时所有权到底该归谁,跟艺术家们聊了聊,发现简单量化行不通。原文稍后读已读值得跟进有用关注 ArtSplit
17:18IT之家(博客/媒体)亚马逊正在测试一套用于决定仓库员工岗位分配的软件系统,计划推广到北美数十个配送和分拣中心,预计全面应用后每年可节省数亿美元成本。然而,内部Slack记录显示,部分仓库经理频繁无视系统建议,要求关闭自动化功能或通过其他方式绕过系统。亚马逊内部文件承认,仅提供优化建议不足以改变行为,2026年目标为实现系统强制执行。这场冲突反映了仓库管理自动化中人机信任的挑战。行业亚马逊仓库自动化AI排班2 个信源在谈事件专题推荐理由:亚马逊想用AI排班省几亿美元,但仓库经理不买账,直接关系统。内部矛盾挺有意思,看看机器和人的博弈。原文稍后读已读值得跟进有用关注 亚马逊
09:53官方账号arXiv cs.AI@Maliha Noushin Raida, Daqing Hou本研究分析了2361个热门GitHub仓库中的25264个代理PR。结果显示,中位仓库在三个月内仅产生1-2个代理PR,密集采用集中在少数项目。小项目(1-5名贡献者)的代理PR参与比例高于中型和大型项目。人机协作以单人监督为主,即一名开发者审查或修改代理贡献。这些发现提供了代理编码工具在开源项目中采用的早期实证。论文GitHubAgentic Coding Tools人机协作推荐理由:这篇论文用两千多个仓库的真实数据告诉你,小项目反而更爱用AI写代码,但整体上大家用得还不多。想了解实际项目怎么管AI贡献的可以看看。原文稍后读已读值得跟进有用关注 GitHub
09:57官方账号arXiv cs.AI@Yuma Ichikawa, Yamato Arai, Kosaku Kimura, Akira Sakai, Hiromichi KobashiLOGOS是一个可插拔层,用于强化现有多智能体框架,而不是替换它们。它编译异构多模态输入(文档、图像、音频、表格、数据库、API、人类指令)为版本化的agent packs,包含智能体、工具、知识、测试、权限和策略。操作中,LOGOS将智能体活动转化为可审计的事件轨迹,并在框架和后端之间应用失败关闭验证。每个学习到的提示、记忆、技能、工具、角色或工作流被视为未信任发布候选,直到通过保留执行证据、人类控制的策略和明确授权才允许升级。该架构实现了可验证的人-智能体循环工程,支持智能体提议改进而人类控制目标、权限和不可逆操作。论文LOGOS智能体治理人机协作推荐理由:这篇论文提出了LOGOS,一个让AI团队自我进化同时受人类控制的框架。它不替换现有系统,而是增加了治理层,确保问责。原文稍后读已读值得跟进有用关注 LOGOS
23:25向阳乔木@vista8当AI模型能力逼近通用水平时,用户表达模糊想法的差距成为新瓶颈。学会把“大概想要什么”转化为“明确要什么、不要什么”是高效使用模型的关键。表达能力正取代模型本身的进步,成为人机协作的核心竞争力。技巧提示词工程表达能力人机协作推荐理由:这条推文点透了:别再只追新模型了,提升自己提需求的能力才是正经事。原文稍后读已读值得跟进有用关注 提示词工程
11:34官方账号arXiv cs.AI@Vivienne Ming该论文以Polymarket真实金钱市场作基准,分析个体预测者与AI协作表现呈三模态:多数人要么完全依赖模型(成绩持平模型),要么用模型背书原有猜测(成绩比单独模型更差),仅少数人进行真正互补推理,准确率匹配甚至超过市场本身。协作特质(观点采择、知识谦逊、好奇心)比原始认知能力或模型基准更能区分高绩效人群。结果初步但统计显著,预注册复制研究正在进行。论文Polymarket人力资本人机协作推荐理由:别总盯着模型分数,人怎么用AI才是关键。这篇论文发现,能跟AI互补的人靠的是好奇心而非高智商。原文稍后读已读值得跟进有用关注 Polymarket
09:38官方账号arXiv cs.AI@Nathan Hughes, Ibrahim Habli本研究系统分析了53篇关于人机团队的论文,基于心理学团队分类法将其归纳为5个集群:AI助手、临时依赖、临时强制依赖、配对平衡和群体平衡。每个集群代表不同的整体团队特征,表明同一术语下存在多种异质团队类型。研究指出,不同论文间的见解是否可迁移存疑,并提供了识别人机团队类型的指南和研究报告清单。论文Human-AI团队团队分类论文推荐理由:这篇论文帮你理清了人机团队到底有几种类型,看了53篇文献给你分了5类,读完就知道不同研究到底在聊什么、结论能不能通用。原文稍后读已读值得跟进有用关注 Human-AI团队
01:37Ethan Mollick@emollick持续学习问题使AI模型无法自主掌握新任务,每次都需要人类重新训练或微调,这限制了AI应用的速度与广度。研究人员指出,这一瓶颈也直接影响递归自我改进,因为模型无法像人类那样持续积累经验。如果无法解决遗忘问题,AI的进化将始终依赖人类反馈循环。行业持续学习AI采用递归自我改进推荐理由:这篇讨论点出了很多AI产品落地卡在哪:模型学不会新东西,每次都要人来教。想避开跟风炒作,先看懂这个根本问题。原文稍后读已读值得跟进有用关注 持续学习
10:02官方账号arXiv cs.LG@Yiwen Xing, Philip Beaucamp, Joyraj Chakraborty, Afrah Farea, Yuanzhe Jin, Saiful Khan, Gennady Andrienko, Natalia Andrienko, Min Chen对IEEE VIS会议过去十年200余篇VIS4ML论文进行系统调研。开发编码方案从ML特性、可视化、交互和动作四个视角分析。揭示了通过交互可视化将人类知识传递到ML工作流的不同路径。利用信息论成本效益分析解释VIS4ML现象,证实VA在ML工作流中的价值。论文VIS4ML知识注入交互可视化推荐理由:这篇论文梳理了200多篇VIS4ML论文,告诉你人在机器学习中怎么用可视化注入知识。想了解人机协作的路径和原理,这篇综述是很好的起点。原文稍后读已读值得跟进有用关注 VIS4ML
10:43AI Will@FinanceYF572°Andrej Karpathy将Claude的新交互模式称为LLM UI/UX的第三次重大重新设计。前两次分别是将LLM作为网站访问和作为App下载。第三次是把LLM打造成一个自包含、持久、异步的实体,拥有组织范围的工具和上下文。他认为这种模式让Claude无缝加入团队,可以像与人交谈一样交互。行业ClaudeAndrej Karpathy智能体推荐理由:Karpathy发了条推,说Claude现在可以像团队同事一样跟你干活,比当网站或App好用多了,建议看看他的新思路。原文稍后读已读值得跟进有用关注 Claude
10:52官方账号arXiv cs.AI@Hongqiao Dong, Wenhao Chi, Ruobing Liang, Xiaokui Yang, Wenhua Liang, Peng Hou, Wenjun Pu, Yipeng Zhao, Ping Chen, Haiping Liu, Jianxing He, Bo LiuHi-Seg是一种基于SAM的人机循环分割框架,用于肺结节CT图像分割。研究使用了来自12个中心1179名患者的胸部CT扫描进行外部验证。所有标注者组平均Dice得分接近85%,优于5个最先进的深度学习模型(10-22%)和13个SAM变体(1-29%)。经过短期训练的非医学标注者达到了与初级医学生相当的性能。该工作表明人机循环分割可减少临床医生工作量并实现可扩展的众包标注。论文SAMHi-Seg肺结节分割推荐理由:这篇论文用SAM加人工迭代的方法做肺结节分割,Dice近85%,比13种SAM变体都强,非医学人员培训后也能干医学标注的活。原文稍后读已读值得跟进有用关注 SAM
03:03官方账号LangChain@LangChainAILangChannel指出,随着智能体采用增长,团队需建立可重复的方法来安全、一致地构建多个生产级智能体。关键管理领域包括:成本与使用监控(✅ Cost and usage)、工具访问与审批(✅ Tool access and approvals)、人机协作工作流(✅ Human-in-the-loop workflows)、提示词/技能/上下文版本控制(✅ Prompt, skill, and context versioning)、跨团队可复用资产(✅ Reusable assets across teams)、以及生产智能体的监控与评估(✅ Monitoring and evals across production agents)。这些实践旨在解决规模部署时的一致性与可靠性问题。技巧LangChain智能体MCP/工具1 个信源在谈事件专题推荐理由:LangChain总结了团队构建多个智能体的核心痛点:成本、权限、版本控制、监控等,全是实战干货,适合正在做 Agent 上线的团队参考。原文稍后读已读值得跟进有用关注 LangChain
10:35AI Will@FinanceYF5Wharton教授Ethan Mollick测试了Anthropic的Claude 5 Fable模型,发现其能力远超前代。Mollick指出,用户不再需要像向导一样引导AI,而是转变为甲方角色,直接提出需求即可。这一变化标志着人机协作模式的根本性转变,Claude 5 Fable在复杂任务中表现出更强的自主性和理解力。AI模型Claude 5 FableAnthropicEthan Mollick10 个信源在谈事件专题推荐理由:教授实测,AI变甲方了原文稍后读已读值得跟进有用关注 Claude 5 Fable
12:44官方账号John Schulman@johnschulman2精选Thinky 团队分享了全双工多模态模型的研究成果,该模型支持实时、自然的交互,同时不牺牲智能水平。创始人 John Schulman 指出,人机协作能力在 AI 领域常被低估,因为其评估难度高于智能或自主性。他们认为未来每个 AI 系统都将以交互模型作为面向用户的外层,持续了解用户意图并保持信息同步。这项技术有望推动 AI 从单向输出转向双向对话式协作。AI模型全双工多模态模型实时交互推荐理由:全双工交互解决了 AI 对话中“你说我听”的延迟感,做实时语音/视频助手或协作工具的团队可以直接参考——Thinky 把自然交互和智能水平平衡好了。原文稍后读已读值得跟进有用关注 全双工
12:34AI Will@FinanceYF5本文指出,为了让AI智能体或助手有效工作,它们需要被赋予与同岗位人类完全相同的工具权限,如手机号、信用卡和邮箱地址。这一观点强调了AI与人类协作时权限对等的重要性,是AI从辅助工具向自主智能体演进的关键一步。文章还列举了多家相关公司,包括AI助手和基础设施提供商,表明这一趋势正在被行业关注和推动。行业AI智能体工具权限人机协作推荐理由:做AI智能体开发的团队需要正视权限对等这一核心问题,它直接决定了AI能否真正替代人类执行复杂任务。建议关注文中提到的Infra提供商,它们正在解决这个基础设施难题。原文稍后读已读值得跟进有用关注 AI智能体
12:33官方账号Mira Murati (TML)@miramuratiMira Murati 在X上发文强调,协作AI的核心在于实时交互,机器与人需跨所有模态协同工作。她指出解决这一挑战需要社区共同努力,并邀请大家加入。这反映了AI发展从单机智能向人机协作生态的转变,强调多模态实时交互的重要性。行业协作AI实时交互多模态推荐理由:关注人机协作未来的开发者,这条信息点明了AI的下一个关键方向——实时多模态交互,值得思考如何参与其中。原文稍后读已读值得跟进有用关注 协作AI
12:03官方账号arXiv cs.LG@Haoyuan Deng, Yitong Gao, Yudong Lin, Haichao Liu, Zhenyu Wu, Ziwei Wang精选真实世界机器人操作中,人类在环强化学习(HiL-RL)依赖频繁人工纠正,成本高且难以扩展。UniIntervene 提出一种智能体干预模型,能自动检测无效探索并引导策略回到高价值状态,大幅减少人工干预。它通过未来条件动作价值估计和时序价值风险评判器,在价值停滞或下降时触发干预,并从记忆库中检索高价值恢复目标生成纠正动作。在多种真实操作任务中,UniIntervene 将平均成功率提升 8.6%,同时减少 57% 的人工干预。这项研究为降低 HiL-RL 部署成本、提升可扩展性提供了新思路。论文强化学习人机协作机器人操作推荐理由:做机器人强化学习或人机协作的团队,终于有了减少人工干预的自动化方案——UniIntervene 用价值感知的智能体干预替代频繁人工纠正,成功率还更高,值得在真实场景中一试。原文稍后读已读值得跟进有用关注 强化学习
11:00官方账号arXiv cs.AI@Maria Edwards, Julian Togelius该研究通过一个游戏化写作实验,探讨人类在AI辅助创作中何时会采纳AI建议,以及这对个人创造力的影响。74名参与者(214份回复)在写作时可以看到AI生成的单词建议,但游戏设定在一个反乌托邦未来,AI试图学习人类个性,因此明确禁止使用AI建议。实验通过反向设计“乐于助人的助手”模式,揭示用户真实偏好而非默认行为。分析聚焦于用户在不同任务类型中保持创意自主与违反规则接受AI帮助的行为模式。该游戏化方法为研究真实人机交互及效率与真实性之间的张力提供了新视角。论文人机协作创意写作游戏化实验推荐理由:这项研究用游戏机制戳破了AI辅助创作中“默认接受”的假象,做创意工具或人机交互设计的团队值得一看,能帮你理解用户何时会主动拒绝AI建议。原文稍后读已读值得跟进有用关注 人机协作
09:53官方账号arXiv cs.AI@Quankai Wang, Yulin Xie, Tongfei Yang, Minghui Cheng, Ran Cao精选本文提出Human-Enhanced Loop Modeling (HELM)框架,通过将长序列有限元建模分解为离散、可视觉验证的检查点,实现人机协作自动化。在20个钢筋混凝土桥梁护栏案例中,HELM将基线自主建模成功率从20%提升至75%,几何和边界条件任务的通过率翻倍。错误分析显示空间推理和代数逻辑限制是主要失败模式。框架已开源,支持ANSYS和LS-PrePost软件。论文有限元建模人机协作桥梁护栏推荐理由:做桥梁护栏等安全关键基础设施有限元分析的工程师,HELM把建模成功率从20%拉到75%,省下大量手动调试时间,建议直接试开源代码。原文稍后读已读值得跟进有用关注 有限元建模
14:49IT之家(博客/媒体)OpenAI CEO 萨姆·奥尔特曼在最新博文中明确表示,完全自动化一切并非公司追求的未来,转而强调人机协同发展模式。此前 OpenAI 曾计划在 2028 年 3 月前构建完全自主的 AI 研究系统,但现已放弃该目标,改为探索 AI 与人类研究人员协同完成研究工作。奥尔特曼指出,AI 能力越强,人类设定方向、权衡利弊和运用判断力的作用就越重要。他还提议成立国际组织来协调前沿 AI 工作,必要时放慢技术发展速度以确保安全。行业OpenAI人机协作AI 安全10 个信源在谈事件专题推荐理由:奥尔特曼的转向给所有关注 AI 发展方向的从业者敲响警钟——完全自动化不是终点,人机协作才是务实路径。做 AI 产品、政策或战略规划的人,值得点开看看 OpenAI 为何放弃激进目标。原文稍后读已读值得跟进有用关注 OpenAI
14:36IT之家(博客/媒体)哈佛大学与Perplexity联合研究,基于10000组真实生产数据,对比了对话式搜索与AI智能体(Perplexity Computer)的效率。结果显示,智能体在自主性上提升48倍,任务时间缩短87%,总成本下降94%,且质量未降反升(不满率1.3% vs 2.9%)。智能体虽单次模型成本更高(4-10美元 vs 0.05美元),但大幅降低了人力边际成本(从2.05美元降至0.16美元)。研究建议,短小单步任务适合搜索,多步骤、需调用工具的工作应交给智能体。行业AI智能体效率提升成本优化推荐理由:这份研究用真实数据证明了AI智能体在复杂任务中的效率优势,做自动化流程或知识管理的团队可以直接参考成本收益模型,评估是否值得投入。原文稍后读已读值得跟进有用关注 AI智能体
09:22官方账号arXiv cs.LG@Eric Nalisnick, Chi Zhang, Sophia Qian, Yixin Wang精选这篇论文从统计校准的角度研究人类与AI的团队协作模型。假设团队由AI模型和人类组成,两者都基于特征空间的某种划分进行了校准,论文揭示了校准假设如何影响团队协作框架。研究考虑了两种框架:一是结合人类和模型的预测,二是将预测责任委托给人类或模型。理论和实验结果表明,现有的组合方法无法保持人类的校准程度;而委托方法虽然保留了预测者的校准,但将负担转移到了决定谁预测的拒绝元模型上。拒绝元模型需要足够精细的校准以定位每个成员的优越区域,这种需求随着人类专业知识的增加而增长,当人类依赖系统无法观察的信息时,这种校准变得不可实现。论文人机协作校准统计学习推荐理由:这篇论文为设计更可靠的Human-AI协作系统提供了理论基石,做AI系统设计或人机交互研究的团队值得关注,能帮你理解校准假设如何影响团队决策的可靠性。原文稍后读已读值得跟进有用关注 人机协作
03:24OpenRouter@OpenRouterAIOpenRouter 发布了其 Agent SDK 的新功能:人机协作工具。该 SDK 能自动处理常规工具调用,对高风险操作则暂停执行等待人工审核。它支持在重启后持久化状态,并验证人类响应是否符合预定义模式,之后能无缝恢复执行。这一更新让开发者可以更安全地构建需要人工介入的 AI 代理流程。AI产品OpenRouterAgent SDK人机协作推荐理由:做 AI 代理应用的开发者终于有了现成的方案来处理人机协作的痛点——暂停、恢复、状态持久化,建议直接集成到你的工作流中。原文稍后读已读值得跟进有用关注 OpenRouter
12:55官方账号arXiv cs.AI@Arsalan Shahid, Gordon Suttie, Philip Black72°随着基础模型从生成回复转向执行操作任务,多人类、多智能体的协作场景日益普遍,但当前缺乏统一协议来记录人类判断、任务交接和审核决策。CHAP(Collaborative Human-Agent Protocol)协议应运而生,它定义了一个共享工作空间,通过核心组件(工作区、参与者、任务、工件和仅追加的证据日志)以及可组合的配置文件(如审核、路由、交接、签名等),将原本散落在聊天记录和代码中的关键信号(如人类编辑、审批、交接)转化为结构化、可追溯的事件。该协议旨在解决当前多智能体部署中人类监督信号丢失、责任归属不清的问题,为跨团队、跨时区的协作提供标准化基础。论文智能体协议/标准人机协作推荐理由:CHAP 解决了多智能体协作中人类监督信号丢失的痛点,做 AI 部署和智能体系统的团队可以直接参考其协议和开源实现,避免重复造轮子。原文稍后读已读值得跟进有用关注 智能体
11:55官方账号arXiv cs.AI@Beiwen Zhang, Yongheng Liang, Guowei Zou, Haitao Wang, Hejun Wu精选研究者提出Collaboration Policy Tree (Co-pi-tree),一种将大语言模型推理蒸馏为可执行策略树的方法,用于人机协作。该方法包含伙伴行为预测树和智能体动作选择树,通过闭环交互反馈自动改进策略分支。在Overcooked-AI实验中,Co-pi-tree相比基线平均奖励提升35.4%,同时将LLM查询次数减少77.7%,测试延迟降低97.1%。这解决了传统多智能体强化学习缺乏可解释性、以及直接使用LLM决策成本高的问题。论文人机协作策略树LLM蒸馏推荐理由:做AI协作系统或人机交互研究的团队值得关注——Co-pi-tree用可解释的策略树替代黑箱模型,既提升性能又大幅降低推理成本,实验数据很有说服力。原文稍后读已读值得跟进有用关注 人机协作
02:21rohanpaul_ai@rohanpaul_aiRohan Paul 在 X 上发文指出,传统的提示词(prompt)时代正在结束,因为这种方式过于线性且受限于人类输入。他认为我们正进入 AI 智能体的循环机器时代,核心价值在于将判断力上移,让人类设计流程,而模型处理重复性摩擦。这一观点反映了 AI 从工具向自主系统的转变趋势,强调人类应专注于战略设计而非微观操作。行业AI智能体人机协作流程设计推荐理由:AI 从业者需要理解从提示词到智能体的范式转变,这关乎如何重新分配人机协作中的价值。做 AI 产品设计或自动化流程的团队,建议关注这一趋势以优化工作流。原文稍后读已读值得跟进有用关注 AI智能体
21:15小互@imxiaohu一位用户分享了自己从追求完全自动化到转向人机协作的心路历程。他之前不断优化AI系统,却导致系统崩溃和效率下降。现在他删除了所有规则,只在关键节点人工介入,与AI共同完成任务,效果反而更好,人也更轻松。这反映了当前AI应用中的一个重要趋势:过度自动化可能适得其反,合理的人机分工才是更优解。行业人机协作自动化AI应用推荐理由:做AI自动化或智能体开发的团队值得一看——过度追求全自动反而容易翻车,关键节点人工介入的思路可能更实用。原文稍后读已读值得跟进有用关注 人机协作
16:16AI Will@FinanceYF583°前OpenAI CTO Mira Murati在离开OpenAI后首次接受广泛采访,分享了她在AGI初创公司Think Machines Lab的愿景。她描绘了一个人类与AI更紧密协作的未来,比喻为“双人自行车”,强调随着机器能力增强,人类不应被排除在循环之外。Murati的访谈通过Bloomberg Live播出,引发业界关注。行业AGI人机协作Mira Murati10 个信源在谈事件专题推荐理由:Mira Murati首次公开分享离开OpenAI后的创业方向,对关注AGI发展、人机协作模式的从业者和研究者来说,她的观点值得细读。原文稍后读已读值得跟进有用关注 AGI
16:01AI Will@FinanceYF588°前 OpenAI 首席技术官 Mira Murati 在离开 OpenAI 后首次接受全面采访,详细披露了她正在打造的 AGI 初创公司 Thinking Machines 实验室的项目。她阐述了对未来人机协作的愿景,强调人类不会被排除在决策循环之外,而是与 AI 更紧密地协作,如同“双人自行车”一般。这次采访首次公开了她在 AGI 领域的最新探索方向,引发了行业广泛关注。AI产品AGIThinking Machines 实验室Mira Murati10 个信源在谈事件专题推荐理由:Mira Murati 首次公开她的 AGI 新项目,关注 AI 协作模式的从业者可以从中看到未来人机关系的新思路,值得点开了解。原文稍后读已读值得跟进有用关注 AGI