Vercel 给 Sandbox 加了外接硬盘 Drives,智能体的文件存储可以单独挂载,单 Drive 最大 16 TiB,跑云端智能体更省钱也更安全。
全部动态
Recraft 家最快的图像模型 V4.1 Flash 上 fal 了,出一张图只要 1.3 秒左右,调提示词试构图可以飞快迭代,做设计的可以去试试。
一次看完五个视觉与 OCR 实战案例:Sarvam 读了 13 万亿 token,Reducto 解析 PDF 能提分省 token,Noyan 花几美元训检测器,做法都够具体。
LangChain 给 Deep Agents 加了 cron 定时功能,写个表达式加 prompt 就能让智能体自己定时跑,做后台自动化可以试试。
OpenAI 新的 GPT-6 Sol 在真实用户投票的 Code Arena 拿了第4,价格只要 Claude Opus 5 的一半不到,做 Web 开发的可以看看分数再决定用哪个。
Recraft 的便宜快速版图像模型上线 OpenRouter 了,一张 7 厘钱、1.3 秒出图,logo 和人像都能做,跑量挺合适。
Microsoft Research 研究说机器人不用把推理都塞进本体,放到外部算反而任务成功率更高、效率更好,做具身智能的可以看看。
LangChain 的 Deep Agents 现在能用 cron 定时自动跑任务了,写个调度文件部署就行,适合做日报、巡检这类周期活。
GitHub 9月24日起开直播手把手教 Copilot SDK 建智能体应用,agent loop 都不用自己写,还有 .NET 和 Java 专场。
AI Engineer 纽约大会拉来 22 家赞助商,从基础设施到安全观测全覆盖,想看生产级 AI 工具栈全貌的可以关注下。
Google 的 Gemini 3.8 Flash TTS 来了,30 秒音频就能克隆你的声音,还能逐句加笑声叹气,在 Hume 基准上排第一。
OpenRouter 发了个可观测性教程,讲清了 Logs、Activity、Broadcast 三个功能怎么用,还附了每个 destination 支持字段的完整对照表和取数 API,做应用监控的可以照着配。
一个叫 Audio8 ASR Infinite 的流式语音识别开源了,能 7x24 无限时长转写不漂移,靠语义轮次检测解决长音频老毛病,做实时转写可以看看。
做品牌设计的朋友注意:Lovart 的 MCP 现在能接进 Codex,在写代码的环境里直接批量出图出创意,还能让它预估哪个素材效果好。
Google 在 Gemini API 里开放了逐行调语气的语音生成,能控制节奏、情绪甚至笑声停顿,还自带 SynthID 水印,做语音产品的可以去 AI Studio 试试。
NVIDIA 开源了个说话人追踪模型,1秒语音就能分清谁在说话,还能让 Reachy Mini 机器人认人记名字,商用许可也友好。
作者把 codex、claude code 这些本地 Agent 全拉进 Douchat 群里互相调用,朋友没画图能力的还能@他的 codex 帮忙,玩法挺新鲜。
Google 新出的两个 TTS 模型,能自定义音色还能逐行改语气,做播客、配音或者语音 Agent 的可以看看区别在哪。
Google 的 Gemini 3.8 Flash 和 Flash-Lite 语音模型今天开始上线,开发者直接在 Gemini API 里调用,NotebookLM 和 Google Vids 也同步集成了。
LangChain 周四要发新产品,Harrison Chase 会在 Interrupt 直播里先演示,做 agent 的可以蹲一下直播。
Google 新出的 Gemini 3.8 Flash 语音模型,2000 多个音色支持 100 种语言,还能克隆声音,Hume 基准第一名。
Google 出了两个新 TTS 模型,Gemini 3.8 Flash TTS 和 Flash-Lite 版,语音更有表现力,去 AI Studio 就能试,做语音应用的可玩玩。
Hugging Face 出了个 lerobot 的 JS 包,浏览器直接看机器人数据集,不用下载,600 行代码就能搭个查看器,玩机器人数据的可以试试。
小米把 MiMo-V2.6 整套开源了,Pro 在智能体基准上打平 Claude Opus 5,本地跑前沿模型的门槛又降了。
Stanford 和 Together AI 让 o3-mini、Claude Sonnet 4、DeepSeek-V3 自己商量怎么合作,只练 15 道题就在 AIME 上比理想路由器高 13.4 分,方法写得挺细。
OpenRouter 上新了个隐身模型 Space Bunny Alpha,100 万 token 上下文,能吃视频输入,推理速度还能调,快去试试是什么底子。
NVIDIA 的说话人分离模型拿了 Diarization-Bench 第一,错误率 14.72%,比第二名低了近四分之一,做语音相关应用的可以关注下。
NVIDIA 出了个 100M 参数的小模型,专门搞定多人说话分不清谁是谁的问题,8 人以内、说话重叠都能识别,已经上了 Hugging Face。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档