Cognition 给 Devin 加了 Teams 原生支持和 Microsoft 365 集成,能直接连你的邮件、日历和文件干活,用微软全家桶的可以试试。
全部动态
Genspark 上线了 GenCode 编程智能体,Claude、GPT、DeepSeek 一个账号随便切,开源模型价格只要十分之一,适合想自己挑模型的开发者。
HEMA 用 Bedrock AgentCore 加 MCP 做了个内部助手 HAL,员工查文档不用再开一堆门户,安全走 Entra ID,方案细节写得很全。
AI Engineer 把 2026 大会的视觉 OCR 场次全放出来了,LlamaIndex 和 Hugging Face 的人都来讲实战,做文档和视觉应用的很值得刷一遍。
Fireworks 出了个 ARCv3 压缩器,能把 BF16 权重更新压小近一半,自己搭 trainer 跑 RL 的团队可以省不少跨区传输成本。
Vercel 给 Sandbox 加了外接硬盘 Drives,智能体的文件存储可以单独挂载,单 Drive 最大 16 TiB,跑云端智能体更省钱也更安全。
教你把开源的 OpenCode 接上 Bedrock 里的开源模型当编程智能体用,数据留在自己账户里,还讲了怎么给不同任务配不同模型。
Recraft 家最快的图像模型 V4.1 Flash 上 fal 了,出一张图只要 1.3 秒左右,调提示词试构图可以飞快迭代,做设计的可以去试试。
AWS 教你用 Strands Agents SDK 串起 Bedrock、Rekognition 和 Transcribe,直接用大白话问视频里发生了什么,几秒出答案,适合想搭视频分析工具的开发者。
一次看完五个视觉与 OCR 实战案例:Sarvam 读了 13 万亿 token,Reducto 解析 PDF 能提分省 token,Noyan 花几美元训检测器,做法都够具体。
OpenAI 给 ChatGPT 语音加上了邮件、日历和 Slack 权限,动动嘴就能发邮件、约会议,底层换成了新的 GPT-6 系列模型。
Anthropic 的 Claude 在自家湿实验室里自己发现了一套类似 Crispr 的酶系统,公司拿它当 AI 做科研的第一个实绩,还赶在上市前公布。
OpenAI 把智能体功能搬进手机了,Plus 和 Pro 用户在 Work 标签页里动嘴就能让 ChatGPT 干活,通勤路上也能用。
ChatGPT 语音模式升级了,能用日历、Slack 这些插件,还能靠说话直接在浏览器里做文档和表格,今天全球推送。
Google 新出的 Gemini 3.8 Flash TTS 能用一句话描述就造出音色,还能一段剧本生成双人对话,做播客和配音的可以试试。
LangChain 给 Deep Agents 加了 cron 定时功能,写个表达式加 prompt 就能让智能体自己定时跑,做后台自动化可以试试。
OpenAI 新的 GPT-6 Sol 在真实用户投票的 Code Arena 拿了第4,价格只要 Claude Opus 5 的一半不到,做 Web 开发的可以看看分数再决定用哪个。
Recraft 的便宜快速版图像模型上线 OpenRouter 了,一张 7 厘钱、1.3 秒出图,logo 和人像都能做,跑量挺合适。
Microsoft Research 研究说机器人不用把推理都塞进本体,放到外部算反而任务成功率更高、效率更好,做具身智能的可以看看。
LangChain 的 Deep Agents 现在能用 cron 定时自动跑任务了,写个调度文件部署就行,适合做日报、巡检这类周期活。
GitHub 9月24日起开直播手把手教 Copilot SDK 建智能体应用,agent loop 都不用自己写,还有 .NET 和 Java 专场。
YouTube 给创作者工作室加了几个实用功能,用 Gemini 聊天就能剪 Shorts,还有脚本辅导和英文直播转西班牙语,做视频的可以看看。
AI Engineer 纽约大会拉来 22 家赞助商,从基础设施到安全观测全覆盖,想看生产级 AI 工具栈全貌的可以关注下。
Google 的 Gemini 3.8 Flash TTS 来了,30 秒音频就能克隆你的声音,还能逐句加笑声叹气,在 Hume 基准上排第一。
Google 把加密内存搬到了服务器侧,模型能在云端处理你的私人数据但自己看不了,隐私派和端侧算力的折中方案。
OpenRouter 发了个可观测性教程,讲清了 Logs、Activity、Broadcast 三个功能怎么用,还附了每个 destination 支持字段的完整对照表和取数 API,做应用监控的可以照着配。
一个叫 Audio8 ASR Infinite 的流式语音识别开源了,能 7x24 无限时长转写不漂移,靠语义轮次检测解决长音频老毛病,做实时转写可以看看。
OpenAI 一次出了 GPT-6 Sol 和 Luna 两个模型,价格砍半还带新缓存,跑业务任务比 Claude Opus 5 便宜九成,做 API 应用的可以看看。
做品牌设计的朋友注意:Lovart 的 MCP 现在能接进 Codex,在写代码的环境里直接批量出图出创意,还能让它预估哪个素材效果好。
Google 在 Gemini API 里开放了逐行调语气的语音生成,能控制节奏、情绪甚至笑声停顿,还自带 SynthID 水印,做语音产品的可以去 AI Studio 试试。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档