5月28日
10:16
10:16Y Combinator@ycombinator
YC 孵化的 Rentahuman 平台允许 AI 智能体与真人沟通并支付报酬,让 AI 完成现实世界中的任务。其使命是利用 AI 创造新工作岗位,并在全球范围内协调劳动力。该平台旨在为数字世界之外的人们提供更多智能、就业和机会。这标志着 AI 从纯数字任务向物理世界任务执行的重要一步,可能改变未来工作模式。
推荐理由:做 AI 智能体或自动化工具的开发者,终于有了让 AI 直接调用人类劳动力的接口——Rentahuman 解决了 AI 无法处理现实任务的痛点,值得关注其如何创造新岗位。
5月27日
10:29
10:29官方账号arXiv cs.AI@Tamerlan Aghayev, Maxime Elkael, Michele Polese, Minh Dat Nguyen, Gabriele Gemmi, Andrea Lacava, Ali Saeizadeh, Reshma Prasad, Paolo Testolina, Angelo Feraudo, Soumendra Nanda, Pedram Johari, Salvatore D'Oro, Tommaso Melodia
精选72°
GENESIS是一个AI智能体框架,旨在解决6G无线接入网(RAN)研发中六个结构性瓶颈,包括从标准合成代码、一致性测试、现场异常处理、数据驱动优化、新波形原型设计到安全加固。传统LLM在RAN场景中会幻觉API、误读规范,且依赖仿真导致硬件迁移失败。GENESIS通过三个可组合原语(智能体、技能、钩子)和持久知识层SYNAPSE,将意图(如规范条款、遥测异常)转化为经过空中实验验证的解决方案,并回馈到知识库。该框架使能力随运行次数累积,显著压缩R&D周期。
推荐理由:GENESIS解决了6G RAN研发中手动迭代耗时的核心痛点,做通信系统开发或6G标准研究的团队可以直接用这个框架加速从规范到验证的全流程。
5月21日
08:00
08:00Jerry Liu@jerryjliu0
LlamaIndex 在 Google I/O 开发者主题演讲中被官方提及,作为 AI 智能体的文档基础设施。该项目计划与 Gemini API 和 Antigravity agents 深度集成,为 Google 生态内的开发者提供文档处理支持。这标志着 LlamaIndex 在 AI 文档基础设施领域获得了 Google 的认可,未来将更好地服务于构建 AI 智能体的开发者。

推荐理由:LlamaIndex 被 Google I/O 官方点名,说明其文档基础设施方案在 AI 智能体领域的重要性。如果你是使用 Google 生态(Gemini API、Antigravity agents)构建 AI 应用的开发者,值得关注 LlamaIndex 的集成进展,能帮你更高效地处理文档数据。
5月19日
14:33
14:33官方账号arXiv cs.AI@Sanderson Oliveira de Macedo, Ronaldo Martins da Costa
精选72°
Reversa 是一个将遗留系统(如COBOL代码)转化为AI智能体可操作规范的框架。它通过多智能体流水线,自动映射项目表面、分析模块、提取隐含规则、合成架构并编写单元级规范,强调代码与规范的可追溯性、显式置信度标记和保留人工验证缺口。在将ATM系统从COBOL迁移到Go的案例中,生成了517条声明、10个缺口、53个Gherkin场景和9/11任务完成的重建计划。该框架以Node.js CLI形式发布,支持多种智能体引擎,并利用SHA-256清单保护修改文件。
推荐理由:做遗留系统现代化或AI驱动代码迁移的团队,终于有了一个能自动生成可追溯规范的框架——Reversa 直接帮你把老代码变成AI智能体能理解的文档,建议做COBOL迁移或大型系统重构的开发者点开看看。
12:31
12:31LlamaIndex@llama_index
LlamaIndex 推出了 ParseBench,这是首个专门为 AI 智能体设计的文档 OCR 基准测试。现有的基准测试无法满足 AI 智能体在文档解析方面的实际需求,ParseBench 填补了这一空白。该基准测试将帮助开发者评估文档解析器在生产环境中的真实表现。LlamaIndex 将通过线上研讨会详细解读其背后的原理和方法。
推荐理由:做文档解析或 AI 智能体应用的开发者终于有了针对性的评估工具,ParseBench 能帮你判断解析器是否真的 ready for production,建议关注后续研讨会细节。
5月15日
5月13日
19:12
19:12官方一手arXiv: OpenAI@Zhun Wang, Nico Schiller, Hongwei Li, Srijiith Sesha Narayana, Milad Nasr, Nicholas Carlini, Xiangyu Qi, Eric Wallace, Elie Bursztein, Luca Invernizzi, Kurt Thomas, Yan Shoshitaishvili, Wenbo Guo, Jingxuan He, Thorsten Holz, Dawn Song
精选75°
ExploitGym 是一个大规模、多样化的基准测试,用于评估 AI 智能体将安全漏洞转化为实际攻击的能力。该基准包含 898 个来自真实世界漏洞的实例,涵盖用户空间程序、Google V8 JavaScript 引擎和 Linux 内核三个领域。评估显示,前沿模型如 Anthropic 的 Claude Mythos Preview 和 OpenAI 的 GPT-5.5 能成功利用 157 和 120 个漏洞实例,即使在启用常见防御措施后仍保持一定成功率。这项工作揭示了 AI 智能体在网络安全中的双重用途风险,为防御和攻击场景提供了重要测试平台。
事件专题

推荐理由:安全研究员和红队成员终于有了评估 AI 攻击能力的标准化工具——ExploitGym 覆盖真实漏洞和防御场景,做渗透测试或 AI 安全评估的团队可以直接拿来用。