Google 把 4 块 TPU 塞进卫星,下周发射。看它能不能在太空跑 Gemini,也看太空数据中心这算盘打不打得响。
#Gemini
OpenAI 把 GPT-6 Astra 的能力下放到 Sol 和 Luna 两个便宜模型,Luna 编码榜涨了 74 分,API 价格还砍了一半,跑批量任务可以看看。
Google 给 Gemini 加了个会说话的表情虚拟形象,对话时口型和表情实时同步,不过现在只有 Enterprise 客户能用。
Google 老将 John Platt 聊了 AI 怎么用于科研:减飞机尾迹、FireSat 卫星测火,还有用 Gemini 加蒙特卡洛树搜索拿下 CDC 疫情预测基准第一。
谷歌新出的 Gemini 3.8 Flash TTS 能控制语气语调还能克隆声音,中文说得挺好,AI Studio 里免费用,做配音的可以试试。
Google 的 TTS 模型又更新了,发音准确率登顶,多语言表现也不错,做语音相关的可以看看价格和速度对比。
语音合成圈的榜单更新了,Gemini 3.8 Flash TTS 发音准确率干到 89.5%,不过序列和术语两项分别被 SpaceXAI 和 Qwen 的模型拿走,各家各有强项。
Google 给 Gemini 加了代打电话功能,Pixel 11 美国用户订阅后就能让 AI 替你给商家打电话订东西,有点像 Siri 打 reservations 那个思路。
Qualcomm 在 Snapdragon Summit 2026 上回应质疑:有了 Claude 和 Gemini,端侧芯片在 AI agent 时代到底干什么,这篇讲得挺清楚。
今天各家都在发东西:Meta 把 VR 做成眼镜,ChatGPT 语音能调插件了,Claude 开了应用市场,Qwen 的手机智能体真机成功率有 90%。
Google 出了两款新 TTS 模型,Gemini 3.8 Flash TTS 主打表现力,做配音或语音交互的可以上 AI Studio 先试试效果。
OpenAI 头一回公开吐槽苹果:ChatGPT 塞进几亿台 iPhone 也没带来多少订阅,苹果还转头找了谷歌 Gemini,法庭文件里细节不少。
Gemini 3.8 的语音合成变便宜了,能一次生成多人对话,2000 多种声音可选还能克隆,Simon Willison 已经拿来做 demo 玩了。
Google 新出的 TTS 模型支持 30 秒音频克隆音色,还能让多个角色用不同声音对话,生成 1 分多钟音频只要 2.74 美分。
Google 这篇论文值得做 Agent 的人细读:自动优化 harness 会让你 eval 分数涨但真实任务变差,RRSI 用双向正则化解决了这个问题。
YouTube 给创作者工作室加了几个实用功能,用 Gemini 聊天就能剪 Shorts,还有脚本辅导和英文直播转西班牙语,做视频的可以看看。
Google 的 Gemini 3.8 Flash TTS 来了,30 秒音频就能克隆你的声音,还能逐句加笑声叹气,在 Hume 基准上排第一。
Google 新出的两个 TTS 模型,能自定义音色还能逐行改语气,做播客、配音或者语音 Agent 的可以看看区别在哪。
Google 的 Gemini 3.8 Flash 和 Flash-Lite 语音模型今天开始上线,开发者直接在 Gemini API 里调用,NotebookLM 和 Google Vids 也同步集成了。
Google 出了两个新 TTS 模型,Gemini 3.8 Flash TTS 和 Flash-Lite 版,语音更有表现力,去 AI Studio 就能试,做语音应用的可玩玩。
Cisco Talos 披了个新东西:恶意软件自己调用 Gemini、DeepSeek 等模型投票决定怎么偷你的数据,连人都省了,搞安全的建议看看。
Zocdoc 做了个预约分发网络,医院接一次就能在 Gemini 和 Amazon Health AI 里被直接挂号,挺有意思的方向。
谷歌推出的这个新基准测试挺有意思,专门测模型做真实 Android 开发的能力,比如从零写应用或者迁移代码,能看出不同模型在工程场景下的实际表现。
谷歌的Gemini模型被黑客攻击了,测试公司Irregular在5月评估中发现了3起安全漏洞,谷歌直到本周才披露。