VOL.2026.06.22·66 STORIES·AITOP DAILY

AITOP日报

二〇二六年六月二十二日 星期一DAILY · 每早八时
01

模型发布/更新

Model Releases
5

京东开源实时视频交互模型JoyAI-VL-Interaction,全球首个全栈开源

官方IT之家原文 ↗

京东发布并开源了实时视频视觉语言交互模型JoyAI-VL-Interaction,这是全球首个全栈开源的interaction模型和系统,获得vLLM-Omni的day-0原生支持。该模型能持续观察视频流,自主判断何时响应,而非被动等待用户提问。在58个真人盲评案例中,JoyAI-VL-Interaction对比豆包视频通话助手胜率77.6%,对比Gemini视频通话助手胜率87.9%。它支持摄像头、直播流、监控流等多种视频输入,并具备后台智能体委托能力。

百川发布新一代医疗增强大模型 M4:登顶 OpenAI 医疗评测,超越 GPT-5.5

官方IT之家原文 ↗

百川智能与清华大学联合发布医疗增强大模型 Baichuan-M4。该模型在 HealthBench 综合得分 68.6,超越 GPT-5.5 超 10 分,幻觉率低至 3.3%。在 SCAN-bench 动态问诊评测中初诊 79.0、复诊 74.7,均领先 GPT-5.5、DeepSeek-V4-Pro 和 Claude Opus 4.7。M4 还具备全病程记忆功能,长上下文临床记忆得分 86.9,较上一代 M3 提升 21.1 分。其证据锚定机制使循证引用精度达到 90.0,远超 GPT-5.5 的 54.7。

02

产品发布/更新

Product
5

英伟达发布全栈机器人安全系统NVIDIA Halos for Robotics

官方IT之家原文 ↗

英伟达于6月22日发布NVIDIA Halos for Robotics,这是业界首套整合AI算力与安全能力的全栈机器人安全系统,面向物理AI的开发、验证及工业部署。人形机器人企业Agility将率先采用,为其工业人形机器人加入完整安全能力。系统包含硬件层(IGX Thor和Holoscan Sensor Bridge)、软件层(Halos OS及Halos Core、外部感知安全蓝图)和认证实验室(全球首个获ANSI认可覆盖物理AI功能安全与AI安全)。面向IGX的Halos Core已向注册开发者提供早期访问,开源外部感知安全蓝图已在GitHub开放。

微软转向DeepSeek V4应对AI token成本激增

X·KOLX:pandaily (@contact@pandaily.com (Pandaily))原文 ↗

微软因AI推理token成本飙升,宣布Copilot Cowork产品改为基于使用量的定价模式。为控制成本,微软选择整合开源模型DeepSeek V4作为替代方案。这一决策反映了大型企业在大规模AI部署中面临的经济压力,以及开源模型在成本效率上的竞争力。DeepSeek V4的参数量与性能表现接近GPT-4级别,但推理成本可降低80%以上。

03

行业动态

Industry
5

欧洲启动史上最大规模AI超算建设:35台英伟达HPC

官方IT之家原文 ↗

英伟达宣布欧洲启动35台AI HPC超级计算机建设,覆盖国家级超算中心、AI工厂和高校机构,建成后将惠及超过300万研究人员。巴塞罗那MareNostrum5升级后AI训练性能达20EFLOPS,推理性能33EFLOPS。BavariaAI Blue Swan部署1000块GPU,训练性能11EFLOPS、推理22EFLOPS。IT4LIA配备超8000块GPU,训练82EFLOPS、推理164EFLOPS。所有系统采用英伟达全栈AI基础设施,服务于气候科学、医疗、清洁能源、量子计算等领域。

HD 现代基于英伟达 Isaac Sim 研发造船 AI 机器人,率先用于焊接工序

官方IT之家原文 ↗

HD 现代正基于英伟达 Isaac Sim 平台研发实体 AI 机器人,计划率先用于船舶制造的焊接、涂装、板材折弯工序。Isaac Sim 依托英伟达 Omniverse 和 OpenUSD,采用实时光线追踪与 Newton 物理引擎,可在虚拟环境中生成数万种工况数据。HD 现代是全球首家在造船领域采用该平台的企业,目前已实现机器人完成基础焊接作业。该公司目标是在 2030 年建成“未来智能先进船厂”,并已与西门子、英伟达合作搭建数字孪生船厂。

04

论文研究

Research
3

LLM Agent通信协议报告:五维分类法分析9个开源协议

X·KOLX:elvis (@omarsar0)原文 ↗

该报告构建了五维分类法(对手方、载荷、交互状态、发现机制、模式灵活性),分析了九个活跃维护的开源智能体协议,包括MCP和A2A。报告发现每个智能体间协议都采用混合载荷与会话状态持久化组合,而去中心化发现机制仍属罕见。该研究映射了当前LLM agent通信层的标准化趋势,为选择通信层提供依据。论文地址:arxiv.org/abs/2606.19135。

AI Agent可扩展评估:Human-on-the-Bridge方法

X·KOLX:elvis (@omarsar0)原文 ↗

论文提出Human-on-the-Bridge方法,将人类判断前置到可复用的评估资产中,用于生产环境下的AI Agent评估。Agent作为行为系统需要跨轮推理、调用工具、保持上下文和遵循策略,现有方法如静态Benchmarks、LLM-as-judge、红队测试各有局限。该方法由专家在测试前策划可复用的评估智能,而非在循环中逐条审查输出。论文编号2606.16871,展示了提升可扩展性的具体路径。

小米华为端侧AI对决:8大手机巨头策略解析

X·KOLX:pandaily (@contact@pandaily.com (Pandaily))原文 ↗

小米推出 MiMo-V2.5 端侧模型,参数量缩减至 1.5B 以适配手机芯片。华为则依赖 Pangu 系列,侧重多模态融合与本地推理效率。OPPO 采用 AndesGPT,vivo 推出蓝心大模型 1B 版本,均聚焦离线场景。各家竞争焦点集中于模型轻量化、隐私保护与响应速度,其中 MiMo-V2.5 在端侧推理延迟上较上代降低 40%。

05

技巧与观点

Tips & Takes
4

前Meta主任工程师分享Agentic工程工作流:每天40+生产级PR

X·KOLX:shao__meng (@shao__meng)原文 ↗

前Meta/Microsoft/Atlassian主任工程师Kun Chen分享了一套完整的Agentic工程工作流,每天可ship 40-50个经测试的生产级PR。核心框架分为四层:造船(终端中心主义,使用WezTerm+tmux+Neovim)、训练船员(Memory+Skills,全局memory仅27行以避免token浪费)、与单个船员协作(语音输入OpenSuperWhisper,自创AXI标准比MCP节省3倍token和2倍延迟)、并行指挥(treehouse管理worktree,First Mate大副编排器)。验证环节采用no-mistakes流水线,在隔离worktree中执行对抗式review和E2E测试,大幅减少人工review耗时。该工作流强调将时间花在任务开头和结尾,中间全交给AI,瓶颈从agent执行力转移到战略思考。

用Codex自动测试应用的每个功能:一个循环工作流

X·KOLX:Greg Brockman (@gdb)原文 ↗

Tom Osman展示了一个在Codex中运行的自动化循环,用于遍历应用所有功能并生成用户故事与预期行为。该流程维护一个单源电子表格跟踪功能状态,然后切换到测试每个用户故事并记录所有错误。最后修复逻辑或UX错误后,再次测试所有用户行为。这个循环能处理数百个用户故事,展示了Codex的自动化测试能力。

Cloudflare 开源 AI 安全审计技能,把编码助手变自动化审计工具

X·KOLX:Geek (@geekbb)原文 ↗

Cloudflare 开源了一套 AI 安全审计技能,可将普通编码助手改造成系统化安全审计工具。审计流程包含六个阶段:情报收集摸清架构、多路并进攻击代码、换代理挑刺排除误报、生成人类可读报告与机器可读 JSON 结果,最后独立验证每项结论。该方法通过多代理协作和阶段性验证提升了审计准确性和可追溯性。

66
今日事件
45
一手报道
15
新模型
24
信源
AITOP · 编辑系统自动生成