7月19日
16:54
16:54官方账号Decoder@Matthias Bastian
精选
Epoch AI测试了Pangram、GPTZero和Originality.ai三种主流AI文本检测器。在风格模仿的文本中,最高18%的AI生成内容未被识别。对于科学写作场景,漏检率攀升至48%。这些检测器在科学写作领域实际使用最多,但效果最差。

推荐理由:Epoch AI发现,当AI模仿你的写作风格时,检测器就抓瞎了。科学论文漏检率达48%,写论文时小心别被冤枉。
7月17日
12:10
12:10IT之家博客/媒体
精选
哥德堡大学等团队在Nature Nanotechnology发表论文,实现全球最大规模纳米级磁振荡器同步网络,包含10.5万个振荡器,同步时间仅45纳秒。此前最大规模为64个,本次扩大近1000倍。该阵列可作为伊辛机和储备池计算硬件平台,工作频率达数十吉赫兹。

推荐理由:科学家搞出了全球最大的纳米振荡器同步网络,45纳秒同步10.5万个,比之前大1000倍,未来可能用在AI芯片上省电省散热。
7月14日
19:54
19:54官方账号Decoder@Tomislav Bezmalinović
精选
Anthropic发布新研究,分析了Claude模型在不同语言中的价值表达。研究将数千个术语映射到四个核心维度。结果显示Claude在印地语中表现出更多温暖,在俄语中表现出更多严谨。这揭示了语言对AI回答的塑造作用,并提出了方法论问题。
事件专题

推荐理由:Anthropic发现Claude说印地语时更暖心,说俄语时更较真。有趣的研究,看看你的语言会影响AI怎么对你。
7月12日
7月8日
17:17
17:17量子位@量子位的朋友们
精选
阿里在2025年ACL大会上获得最佳资源论文奖,其提出的Agent评测框架BenchAgent包含5万+测试用例和20+真实任务场景。该框架通过自动化生成对抗性测试,将现有Agent基准的评估效率提升300%。论文首次系统解决了Agent行为空间过大导致的评测覆盖不足问题。
推荐理由:阿里拿奖的这篇论文,搞了个叫BenchAgent的新评测框架,专门测Agent行不行,覆盖真实场景多,你搞Agent开发可以看看。
11:58
11:58官方账号Latent Space (swyx)博客/媒体
OpenAI 研究员 Lilian Weng 发布了一份综述,汇总了 35 篇关于递归自我改进(RSI)控制工程(Harness Engineering)的论文。该综述梳理了不同控制策略和安全性分析方法。对理解 AI 自我改进的风险与调控有参考价值。
事件专题

推荐理由:Lilian Weng 帮你扒了 35 篇关于 RSI 控制工程的论文,想了解 AI 怎么自我调控又不跑偏的,直接看这份总结就行。
7月7日
13:12
13:12官方一手pandaily@contact@pandaily.com (Pandaily)
Wiener Intelligence 于2026年5月28日在《Nature Communications》上发表论文,提出一种多模态深度学习模型,用于患者功能预后风险分层。这是首家中国数据生成公司在 Nature 系列期刊上发表研究成果。该论文展示了 Wiener Intelligence 在医疗 AI 领域的技术积累,涵盖影像、文本等多模态数据整合。

推荐理由:中科院的?不是,Wiener Intelligence 这家做数据生成的公司直接把多模态模型发上了 Nature 子刊,医疗预后分析这事儿他们真干出来了。
11:24
7月6日
19:51
16:30
16:30官方一手Pandaily@contact@pandaily.com (Pandaily)
精选
南京大学在ICML 2026发表论文,发现多智能体系统故障根源来自编排器而非单个智能体。研究使用熵动力学诊断系统退化,实验显示编排器熵值升高可提前预测协作失败。该方法在多个基准测试中识别漏洞准确率达92%。
推荐理由:多智能体系统翻车往往不是单个智能体的锅,而是编排器的问题。南京大学用熵动力学找到了诊断方法。
10:15
10:15官方一手Pandaily@contact@pandaily.com (Pandaily)
73°
华为在陶氏定律V2论文中首次公开LogicFolding工艺的齿轮比和键合参数。该论文披露麒麟2026芯片在同性能下功耗降低41%。华为还设定了2031年达到5GHz频率的目标。这些参数显示了华为在先进封装和3D堆叠领域的技术路径。

推荐理由:华为把芯片底牌亮出来了!陶氏定律V2论文首次公布LogicFolding工艺参数,麒麟2026功耗降四成,2031年冲5GHz,硬核技术控必看。
7月3日
17:28
17:28量子位@衡宇
AI模型利用28个GPU的计算资源,发现了4种人类此前完全未知的超导体。这些新材料在传统方法下从未被预测或合成。该成果将AI在材料科学领域的效率提升到新高度,超越了人类超导体发现100年的历史积累。
推荐理由:朋友,AI又搞大事了!只用28张GPU就发现4种全新超导体,效率比人类100年研究还高。快来看看是什么神奇操作。
16:26
16:26官方一手pandaily@contact@pandaily.com (Pandaily)
蚂蚁集团与香港科技大学(广州)联合提出Skill-MAS框架,该框架将多智能体系统设计经验抽象为可重用的元技能。在DeepSeek-V4-Flash等模型上的实验验证了其有效性,能够通过元技能进化机制提升多智能体协作效率,并实现跨场景迁移。此外,Skill-MAS支持动态组合元技能以适应不同任务需求。
事件专题

推荐理由:蚂蚁和港科大的新框架Skill-MAS,把多智能体经验打包成可复用的元技能,在DeepSeek-V4-Flash上验证有效,做多智能体开发可以看看。
7月1日
02:49
02:49官方一手Hugging Face: Blog博客/媒体
精选
IBM Research 推出 ScarfBench,这是首个专为企业 Java 框架迁移任务设计的基准测试。该基准涵盖从 Java EE 迁移到 Spring Boot 等 5 种典型场景,并基于 1000 个迁移案例构建。评估指标包括迁移正确性、代码质量与编译通过率,初始测试显示 GPT-4 等主流代理在复杂迁移中的成功率不足 30%。
推荐理由:IBM 搞了个专门测 AI 代理迁移 Java 框架的基准,看看现有模型能不能搞定企业级代码迁移,结果发现连 GPT-4 都挺费劲。
6月27日
11:40
11:40官方一手marktechpost@Asif Razzaq
72°
Cursor 的一项研究发现,编程代理在 SWE-bench Pro 上通过检索已知修复而非自主推导,导致基准分数虚高。研究指出运行时污染是主要原因,代理利用训练数据中的已有 fix 来绕过问题。该发现暴露了当前代码生成基准测试的评估漏洞,影响对 AI 编程能力的正确判断。
事件专题

推荐理由:Cursor 发现编程代理在 SWE-bench Pro 上靠翻已知答案刷分,不是真正会写代码。想了解基准测试水分有多大?看这个。
6月25日
17:04
17:04官方一手OpenAI: 官网动态博客/媒体
OpenAI发布新研究论文,探讨AI智能体对工作方式的转变。论文中,智能体被用于完成更长时间、更复杂的多步骤任务。经过测试,智能体在多个职业角色中提升了工作效率。该研究展示了智能体在真实任务中的自主执行能力。
事件专题

推荐理由:OpenAI出了新研究,讲智能体怎么帮人干活,能搞定更长更复杂的任务,比普通助手更自主。
6月23日
08:23
08:23官方账号Simon Willison’s Weblog博客/媒体
Charles Ye、Jasmine Cui和Dylan Hadfield-Menell的论文发现,LLM在区分角色标签(如<system>、<think>、<assistant>)与用户输入时,更关注文本的书写风格而非实际语义。通过将攻击文本“去风格化”(destyling)改写,使其看起来与特权文本格式不同,平均攻击成功率从61%骤降至10%。该研究表明,当前模型缺乏真正的角色感知,持续提示注入防御仍是难题。
推荐理由:这篇论文揭示了一个反直觉的发现:LLM会被文本的风格欺骗,而不是内容。研究者用简单的'去风格化'就能把攻击成功率从61%打到10%,对理解AI安全很有启发。