09:16官方一手arXiv: DeepSeek@Maxim Chupilkin论文使用动态序数理想点方法,将LLM作为受访者分析1946-2025年5555份联合国决议。支持率从DeepSeek的37.8%到GPT-5的97.3%。在21世纪,GPT-5、Claude Sonnet和Gemini最接近俄罗斯,DeepSeek最接近法国,所有四个模型均远离美国。针对美国反对而中俄支持的2104项决议,GPT-5支持96.1%,Gemini 83.4%,Claude Sonnet 65.2%,DeepSeek 36.1%。论文DeepSeekGPT-5Claude Sonnet推荐理由:用联合国投票数据测了四个大模型的政治立场,发现DeepSeek最亲法,GPT-5最亲俄,跟开发者国家不一样。原文稍后读已读值得跟进有用关注 DeepSeek
09:14官方一手arXiv: DeepSeek@Maxim Chupilkin一项论文使用背书实验测试GPT-5、Claude Sonnet、Gemini和DeepSeek四款大模型对国际经济与安全政策的评分。当政策被描述为获得美国或欧盟支持时,模型评分显著高于被描述为获得中国或俄罗斯支持的政策,数值条件中GPT-5、Claude Sonnet和Gemini对中国和俄罗斯背书的政策评分分别降低约10%-20%。加入要求模型提供理由后,GPT-5和Claude Sonnet的西方/非西方差距保持不变,Gemini的惩罚减弱,但DeepSeek此前无差距转而呈现对中国和俄罗斯的惩罚。模型理由显示西方背书被视为可信度信号,而中俄背书与数据安全、主权、监控或地缘政治风险关联。论文GPT-5Claude SonnetGemini推荐理由:这篇论文用实验数据告诉你,大模型评政策时会看谁站台——同一政策挂美国旗得分高,挂中国旗得分低。GPT-5、Claude Sonnet、Gemini、DeepSeek表现各异,值得关注。原文稍后读已读值得跟进有用关注 GPT-5
10:48官方账号arXiv cs.LG@Despina Christou, Grigorios Tsoumakas论文对比了5个小型语言模型(360M至3B参数)在通用域和文学域关系抽取上的表现。在通用域,Qwen2.5-0.5B经过微调后达到0.83 micro-F1,超过零样本的GPT-5.4(0.69)和Claude Sonnet 4.6(0.66)。在文学域,调优后的SLM在Biographical基准上达0.92,GPT-5.4为0.83,文学均值0.833 vs 0.578。结果表明,任务特定调优的SLM可在单张消费级GPU上部署,提供准确、隐私且硬件高效的关系抽取。AI模型Qwen2.5-0.5BGPT-5.4Claude Sonnet推荐理由:Qwen2.5-0.5B调优后,在关系抽取任务上干掉了GPT-5.4和Claude Sonnet,而且模型很小,单卡就能跑,适合隐私敏感场景。原文稍后读已读值得跟进有用关注 Qwen2.5-0.5B
14:22官方账号AlphaSignal@AlphaSignalAI精选CUA-Gym是一个端到端流水线,通过三个协调编码智能体自动生成可验证的计算机使用任务。它构建了94个流行应用的模拟版本,包括Slack、Notion、Salesforce和Gmail克隆,并直接读取状态设计奖励函数。生成的训练数据集包含32,112个验证元组,覆盖110个环境。基于该数据训练的模型在OSWorld-Verified基准上达到72.6%,与Claude Sonnet 4.6持平。一个3B参数的小模型以十分之一参数匹配了17B基座模型的性能。AI模型CUA-GymClaude SonnetOSWorld-Verified5 个信源在谈事件专题推荐理由:CUA-Gym用三个AI智能体自动生成训练数据,省去人工标注。它克隆了94个常用软件,训练出的模型追平了Claude Sonnet 4.6,小模型3B参数达到17B效果,还完全开源。原文稍后读已读值得跟进有用关注 CUA-Gym
11:17官方账号arXiv cs.AI@Sanjay Basu精选研究者标注313个MedAlign EHR问答对的四层跃点分类,评估301个问题。三个模型(Claude Sonnet 4-6、GPT-4o、GPT-5.4-2026-03-05)准确率随跃点增加单调下降:Claude从30.6%(hop=1)降至17.6%(hop=4),GPT-4o从37.8%降至14.7%,GPT-5.4从37.8%降至23.5%。上下文充分性审计显示高跃点问题并未因EHR截断而更差,准确率下降源于推理难度。扩展思考未明显缓解精度-深度曲线,思考token使用量与跃点正相关(r=0.31)。论文Claude SonnetGPT-4oGPT-5.41 个信源在谈事件专题推荐理由:这篇论文用实验告诉你,临床AI回答EHR问题时,推理步骤越多越容易翻车。Claude、GPT-4o和GPT-5.4都逃不过,部署前得重点防多步推理。原文稍后读已读值得跟进有用关注 Claude Sonnet
02:18rohanpaul_ai@rohanpaul_ai精选72°一篇新论文提出CL-BENCH基准,测试AI智能体是否真正从经验中学习,而非仅依赖记忆。研究发现,简单的全上下文学习优于专门的记忆系统,Claude Sonnet 4.6在纯上下文模式下取得最佳成绩。该基准涵盖编码、数据库、预测等6个领域,要求智能体在连续任务中发现模式。结果表明,当前记忆密集型AI智能体并未比保持完整对话上下文更可靠地学习。这提醒我们,长期运行的AI智能体需要更好的方式来记住有用经验、遗忘过时信息并适应环境变化。论文智能体基准测试持续学习推荐理由:这篇论文戳破了AI智能体“越用越聪明”的幻觉,做智能体开发或长期任务自动化的团队值得看看——你的系统可能只是在记笔记,而不是真在学习。原文稍后读已读值得跟进有用关注 智能体