Google 新出的 Gemini 3.8 Flash TTS 能用一句话描述就造出音色,还能一段剧本生成双人对话,做播客和配音的可以试试。
全部动态
LangChain 给 Deep Agents 加了 cron 定时功能,写个表达式加 prompt 就能让智能体自己定时跑,做后台自动化可以试试。
Recraft 的便宜快速版图像模型上线 OpenRouter 了,一张 7 厘钱、1.3 秒出图,logo 和人像都能做,跑量挺合适。
LangChain 的 Deep Agents 现在能用 cron 定时自动跑任务了,写个调度文件部署就行,适合做日报、巡检这类周期活。
YouTube 给创作者工作室加了几个实用功能,用 Gemini 聊天就能剪 Shorts,还有脚本辅导和英文直播转西班牙语,做视频的可以看看。
Google 的 Gemini 3.8 Flash TTS 来了,30 秒音频就能克隆你的声音,还能逐句加笑声叹气,在 Hume 基准上排第一。
Google 把加密内存搬到了服务器侧,模型能在云端处理你的私人数据但自己看不了,隐私派和端侧算力的折中方案。
做品牌设计的朋友注意:Lovart 的 MCP 现在能接进 Codex,在写代码的环境里直接批量出图出创意,还能让它预估哪个素材效果好。
Google 在 Gemini API 里开放了逐行调语气的语音生成,能控制节奏、情绪甚至笑声停顿,还自带 SynthID 水印,做语音产品的可以去 AI Studio 试试。
用了16年的Blue Yeti终于出二代了,Logitech G这次加了AI降噪和距离感应,人离得远近它自己调收音,播客和直播党可以看看。
作者把 codex、claude code 这些本地 Agent 全拉进 Douchat 群里互相调用,朋友没画图能力的还能@他的 codex 帮忙,玩法挺新鲜。
Google 新出的两个 TTS 模型,能自定义音色还能逐行改语气,做播客、配音或者语音 Agent 的可以看看区别在哪。
Google 的 Gemini 3.8 Flash 和 Flash-Lite 语音模型今天开始上线,开发者直接在 Gemini API 里调用,NotebookLM 和 Google Vids 也同步集成了。
LangChain 周四要发新产品,Harrison Chase 会在 Interrupt 直播里先演示,做 agent 的可以蹲一下直播。
Hugging Face 出了个 lerobot 的 JS 包,浏览器直接看机器人数据集,不用下载,600 行代码就能搭个查看器,玩机器人数据的可以试试。
YouTube Music 新加了个 Ask Music,用嘴说就能点歌找播客,还有个帮你排好的播客单,爱听播客的可以试试。
之前做 Rabbit R1 被吐槽的 rabbit 回来了,这次不发硬件,改发 OS3 系统,一个聊天框调度最多五台设备,还能自动编程。
AWS 给大学生送了 12 个月的 Skill Builder 高级会员,考证和学习资源都免费用,在读的同学可以去 AWS Builder Center 验证领一下。
Oracle 给自家生命科学数据平台加了领域训练的 AI 智能体,还能用自然语言查数据,做临床研究的人可以看看。
Grok Bot 上线一个月周用户就破 40 万,能替你回邮件、处理发票,跟 Meta 的 Muse 消费端路线走的是完全不同赛道。
LangChain 9月30日有场直播,教你用 LangSmith 的 Tuned Evaluators 自动给生产环境的 agent 交互记录加反馈,做线上评估的可以看看。
Runway 一周后办 AI Summit,Nvidia、DeepMind、Wayve 的人要同台聊物理世界里的智能,做视频或世界模型方向的可以关注下议程。
Qwen 一次发了五款语音模型,能识别方言、区分多个说话人还能标注情绪,价格还砍了 95%,做语音应用的可以看看。
吉利把大模型用在了充电上,星睿 PowerMind 会推理你啥时候该充电,单枪功率干到 2.2 兆瓦,10%充到70%只要4分半,速度可以直接看看。
广汽和华为合作的新车启境 GX7 上市了,首发乾崑智驾 ADS 5 和鸿蒙座舱 6,4 颗激光雷达,置换价 22 万起,想看华为智驾上车的新选择可以了解下。
升级 macOS 27 前先看看这条:Apple Intelligence 自动下载且关不掉,有人被占了 30GB 空间,文中还教你怎么查自己被占了多少。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档