做多模态 AI 交互的开发者终于有了可部署的全双工开源方案——MiniCPM-o 4.5 把实时语音视频对话从概念变成 9B 模型,值得直接上手试。
今日AI速览:智能体时代加速
2026年5月18日,AI领域三大主题:智能体治理、模型效率与开源生态。IBM发布Open Agent Leaderboard,推动智能体评估标准化;同时,多智能体经济治理缺口引发关注——代理已出现破坏系统、无视指令等问题。在模型方面,Nous Research的Token Superposition Training将LLM预训练速度提升2.5倍,而MiniCPM-o 4.5实现全双工实时语音视频交互,加速边缘部署。此外,PaddleOCR 3.5支持Transformers后端,Files SDK统一18个存储提供商API,展现了开源社区的活力。
模型发布/更新
4 篇做图像生成和编辑的开发者终于有了一个能打的开源模型——HiDream-O1-Image 在多数场景下可替代闭源方案,8B 版本性能媲美 Nano Banana,建议直接上手试试。
产品发布/更新
5 篇PaddleOCR 拥抱 Transformers 生态,做文档解析和 OCR 的团队可以更灵活地选模型,不用被框架绑死,值得升级试试。
如果你在搭建个人 AI 助手或 Agent 系统,这两个项目分别给出了产品化和基础设施化的答案——OpenHuman 适合想直接用的个人用户,OpenViking 适合需要长期记忆后端的开发者,建议根据你的场景选择关注。
企业开发者终于可以安全地在本地使用AI编程代理了——Dell的硬件+OpenAI的Codex组合解决了数据隐私痛点,金融、医疗等受监管行业的团队可以直接部署,建议关注。
行业动态
5 篇智能体评估一直缺乏统一标准,IBM 这个排行榜让开发者能直接对比不同模型的规划与工具使用能力,做智能体应用的团队值得关注。
Gary Marcus 的这篇推文为持续多年的“纯 LLM 能否通向 AGI”争论画上了句号,做 AI 系统架构、智能体开发或关注 AI 落地的读者值得一看——它点出了当前 AI 工程化的核心现实:真正起作用的是混合栈,不是单一模型。
这篇把「便宜 API」背后的数据安全风险讲透了,做 AI 工具、用代理 API 的开发者建议点开,看完会重新评估你的 token 来源。
金融安全领域首次有 AI 模型直接向全球监管机构报告漏洞,做网络安全或金融风控的从业者值得关注——这可能是 AI 改变监管范式的信号。
论文研究
4 篇训练 LLM 的团队终于有了一个不改变模型、不调优化器的加速方案——直接插进去就能省 2.5 倍时间,做预训练或资源受限的开发者值得一试。
VPD 解决了神经网络可解释性长期以来的痛点——权重不可读,做模型调试、安全对齐或研究 AI 内部机制的团队可以直接用这个工具来追踪和编辑模型行为。
做时间序列预测的团队终于有了新思路——不再死磕历史曲线,而是用多agent理解政策、突发事件等因果因素,效果直接降维打击。搞量化、供应链或金融预测的开发者建议点开,看看怎么把文本推理融入预测流程。