Anthropic 的新 Opus 5.5 比上一代便宜四成、快三成,写代码和文字水平赶上 Fable 5.1,挑模型时可以对比看看。
全部动态
用了16年的Blue Yeti终于出二代了,Logitech G这次加了AI降噪和距离感应,人离得远近它自己调收音,播客和直播党可以看看。
NVIDIA 开源了个说话人追踪模型,1秒语音就能分清谁在说话,还能让 Reachy Mini 机器人认人记名字,商用许可也友好。
作者把 codex、claude code 这些本地 Agent 全拉进 Douchat 群里互相调用,朋友没画图能力的还能@他的 codex 帮忙,玩法挺新鲜。
Google 新出的两个 TTS 模型,能自定义音色还能逐行改语气,做播客、配音或者语音 Agent 的可以看看区别在哪。
Google 的 Gemini 3.8 Flash 和 Flash-Lite 语音模型今天开始上线,开发者直接在 Gemini API 里调用,NotebookLM 和 Google Vids 也同步集成了。
LangChain 周四要发新产品,Harrison Chase 会在 Interrupt 直播里先演示,做 agent 的可以蹲一下直播。
Google 新出的 Gemini 3.8 Flash 语音模型,2000 多个音色支持 100 种语言,还能克隆声音,Hume 基准第一名。
Google 出了两个新 TTS 模型,Gemini 3.8 Flash TTS 和 Flash-Lite 版,语音更有表现力,去 AI Studio 就能试,做语音应用的可玩玩。
谷歌新出的两款 TTS 模型能逐行控制台词语气,还能用 30 秒录音复制声音,做播客有声书的朋友可以去 AI Studio 试试。
Hugging Face 出了个 lerobot 的 JS 包,浏览器直接看机器人数据集,不用下载,600 行代码就能搭个查看器,玩机器人数据的可以试试。
小米把 MiMo-V2.6 整套开源了,Pro 在智能体基准上打平 Claude Opus 5,本地跑前沿模型的门槛又降了。
Stanford 和 Together AI 让 o3-mini、Claude Sonnet 4、DeepSeek-V3 自己商量怎么合作,只练 15 道题就在 AIME 上比理想路由器高 13.4 分,方法写得挺细。
Claude 写作为啥越来越怪?Anthropic 微调工程师亲口解释了原因,还透露 Opus 5.5 有改善,写作者值得看看。
OpenRouter 上新了个隐身模型 Space Bunny Alpha,100 万 token 上下文,能吃视频输入,推理速度还能调,快去试试是什么底子。
NVIDIA 的说话人分离模型拿了 Diarization-Bench 第一,错误率 14.72%,比第二名低了近四分之一,做语音相关应用的可以关注下。
NVIDIA 出了个 100M 参数的小模型,专门搞定多人说话分不清谁是谁的问题,8 人以内、说话重叠都能识别,已经上了 Hugging Face。
Anthropic 工程师亲口承认 Claude 新模型写得越来越怪,原因是训练偏重代码和数学,想写文案的可以看看 Opus 4.6 还是不是最优解。
YouTube Music 新加了个 Ask Music,用嘴说就能点歌找播客,还有个帮你排好的播客单,爱听播客的可以试试。
小米把 1M 长上下文的预填充成本砍掉 5 倍,KV 缓存也小了 4.5 倍,跑智能体任务的人可以看看这套 HySparse 2 架构。
Meta 又搞了个 Muse,一周就有 50 万用户,结果被扒出来文件名和开源项目 OpenClaw 几乎一样,连 OpenAI 都坐不住了
Latent Space 采访了 Radical Numerics 的 CEO,聊他们怎么用生物思维链和多模态感知做生物防御,还能设计新基因组,思路挺新鲜的。
Anthropic 出了份报告,讲有人拿代理偷偷转发用户 prompt 到 Claude API 蒸馏模型,还点出隐私风险,做 AI 产品的人都该看看。
之前做 Rabbit R1 被吐槽的 rabbit 回来了,这次不发硬件,改发 OS3 系统,一个聊天框调度最多五台设备,还能自动编程。
AWS 给大学生送了 12 个月的 Skill Builder 高级会员,考证和学习资源都免费用,在读的同学可以去 AWS Builder Center 验证领一下。
Oracle 给自家生命科学数据平台加了领域训练的 AI 智能体,还能用自然语言查数据,做临床研究的人可以看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档