Google 的 Gemini 4 据说要这两天就发,The Information 爆料的,感兴趣的可以先蹲一下官方消息。
Gemini 3.8 的语音合成变便宜了,能一次生成多人对话,2000 多种声音可选还能克隆,Simon Willison 已经拿来做 demo 玩了。
Google 新出的 Gemini 3.8 Flash TTS 能用一句话描述就造出音色,还能一段剧本生成双人对话,做播客和配音的可以试试。
Google 在 Gemini API 里开放了逐行调语气的语音生成,能控制节奏、情绪甚至笑声停顿,还自带 SynthID 水印,做语音产品的可以去 AI Studio 试试。
Google 新出的 Gemini 3.8 Flash 语音模型,2000 多个音色支持 100 种语言,还能克隆声音,Hume 基准第一名。
谷歌新出的两款 TTS 模型能逐行控制台词语气,还能用 30 秒录音复制声音,做播客有声书的朋友可以去 AI Studio 试试。
sklearn 里的 SMO 算法作者、拿了奥斯卡的 Google 科学家聊 AI 怎么做科学、解决气候问题,访谈内容很扎实。
谷歌 DeepMind 新出的 Dream-RSI 系统,能让 AI 代理自己迭代优化,在算法设计、数学优化这些领域,用更少的尝试找到更好的方案。
美国司法部赢了官司,法院没让谷歌拆分业务,但要求它和竞争对手合作,给出版商更多数据,这对广告行业来说是个重要消息。
Google 新增了 Gemini API 的 Managed Agents 功能,让你能更方便地创建和管理智能体,实现更复杂的任务流程。
Google 新出的 Credentials API 很实用,能帮大模型安全地访问外部服务,比如 Slack 或其他工具,而且不会把你的密钥直接暴露给模型。
谷歌新出的Gemini 3.8 Live和Extended Thinking,能一边说话一边思考,比如查资料时能同步汇报进度,比普通语音助手更智能。