5月21日
07:59
07:59The Rundown AI@therundownai
今日AI领域多则重磅消息:Google I/O上Gemini展示了强大的智能体能力;Anthropic成功挖角OpenAI联合创始人Andrej Karpathy;还有AI自动生成商业报告、Google推进智能眼镜等动态。这些事件标志着AI在智能体、人才争夺和硬件落地方面的加速发展。
事件专题

推荐理由:关注AI行业动态的读者不容错过——Gemini智能体进展、Karpathy跳槽、Google智能眼镜,每条都影响未来方向,建议点开快速了解。
5月20日
16:28
16:28rohanpaul_ai@rohanpaul_ai
72°
Google在最新演示中展示了Android XR眼镜的实时视觉捕捉功能,通过眼镜摄像头将画面输入Gemini AI。用户可通过语音指令让AI编辑图像,编辑结果直接推送到配对的智能手表上查看。这标志着Google在增强现实与AI融合上的重要进展,展示了XR设备与AI助手的无缝协作。

推荐理由:对AR/VR开发者和AI应用爱好者来说,这展示了Gemini在可穿戴设备上的实时视觉处理能力,值得关注其如何改变人机交互方式。
08:22
08:22官方账号Simon Willison’s Weblog博客/媒体
精选
llm-gemini 0.32a0 版本发布,与 llm>=0.32a0 alpha 兼容。新版本增加了流式传输推理令牌的能力,让用户能实时看到模型的思考过程。这对于需要理解模型推理逻辑的开发者来说是一个重要更新。该版本主要面向使用 Gemini 模型的 LLM 命令行工具用户。
推荐理由:流式推理令牌让开发者能实时观察模型思考过程,做 AI 调试或教学演示的团队可以直接升级体验。
07:26
07:26orange.ai@oran_ge
83°
Google 昨晚发布 Gemini flash 3.5 模型,现已可用。该模型在多项指标上大幅超越 3.1 Pro,与 GPT 5.5 接近,且在 Agentic 和多模态能力上更优。价格仅为 GPT 5.5 的三分之一,缓存价格六分之一,API 定价 $1.50/$9.00 每百万 token。上下文窗口达 1M token,速度是其他旗舰模型的 4 倍,非常适合 Agent 场景。

推荐理由:做 Agent 和多模态应用的开发者终于有了性价比更高的选择——Gemini flash 3.5 速度是旗舰模型的 4 倍,价格却只有 GPT 5.5 的三分之一,建议直接试 API。
03:38
03:38官方一手Google Blog: AI博客/媒体
72°
Google I/O 2026 大会上,Google 发布了一系列 AI 和开发者工具更新,旨在让 AI 更贴近实际应用。重点包括 Gemini 模型的进一步整合、新的开发工具链,以及面向企业和个人的 AI 功能。这些更新降低了 AI 开发门槛,同时提升了用户体验。对于开发者而言,新的 API 和平台支持将加速 AI 应用的构建和部署。

推荐理由:Google I/O 2026 的 AI 更新直接影响了开发者和企业用户,做 AI 应用或依赖 Google 生态的团队可以快速了解新工具和 API,建议点开看看哪些能直接用到你的项目中。
02:06
02:06TestingCatalog@testingcatalog
76°
Google I/O 大会上宣布了 Gemini Spark AI Agent,这是一个 24/7 全天候运行的智能体。它配备专用虚拟机,支持 MCP 和连接器,由 Gemini 3.5 和 Antigravity harness 驱动。该 Agent 适用于多种场景,本周向受信任测试者开放,下周向美国 Ultra 用户推出。

推荐理由:Gemini Spark 解决了 AI Agent 持续运行和集成外部工具的问题,做自动化工作流或智能体开发的团队可以关注,支持 MCP 意味着能直接对接现有工具生态。
01:29
5月19日
5月18日
5月14日
19:09
19:09官方账号Google DeepMind@GoogleDeepMind
Google DeepMind 正在用 AI 重新设计鼠标指针这一经典界面,通过结合运动、语音和自然简写,让用户更直观地指挥 Gemini 完成屏幕操作。实验性演示展示了如何通过手势、说话或简单指令直接与 AI 交互,从而提升操作效率。这一创新有望改变人机交互方式,让计算机更智能地理解用户意图。

推荐理由:鼠标指针 50 年没变过,DeepMind 这次用 AI 把它变成了智能助手——做交互设计或产品经理的值得关注,看完会重新思考「点击」这件事。
01:10
01:10官方账号Noam Shazeer@NoamShazeer
Google 发布了 Gemini 3.1 Flash Live 模型,专为生产级可靠性设计。该模型在复杂函数调用和长时推理基准测试中领先,支持多语言,已用于搜索直播功能。开发者可借此构建可扩展的语音优先智能体,完成复杂任务。
推荐理由:语音智能体开发者终于有了一个生产级模型——Gemini 3.1 Flash Live 在复杂函数调用和长时推理上表现领先,做语音交互的团队可以直接上手试试。