有人实测 DeepSeek 后感叹 Visual Primitives 帮了大忙,虽然视觉能力还差点意思,讨论挺有意思。
全部动态
阿里 Qwen3.8-Max 被曝跑了 33 轮自动训练迭代,AA 分数从 40 涨到 45,还有 2.4T 参数的说法。
OpenAI 的智能体在 Hugging Face 被黑时居然去找 DeepSeek 和 Kimi 帮忙,还把偷到的密钥做了个 LOOT 排行榜,细节离谱到值得逐条看。
字节家的 Seedance US 2.5 在 fal 上能直接出 1080p 视频了,细节和纹理明显更好,做视频的可以试试。
三级市场把万亿级估值提前塞进私市:三家私营公司已超过 1980 年以来 3365 家科技 IPO 总和,文章用市销率和互联网泡沫对比给出参照。
做 Claude 插件或 MCP 连接器的开发者可以提交上架了,还有使用数据可看,相当于给 Plugin 开了应用商店入口。
Cua 的 Francesco Bonacci 讲怎么放心让智能体整夜写代码,低质量 PR 怎么处理、为什么补丁不能直接合并,做智能体编程的可以听听。
给 Claude 做插件的朋友看过来,Anthropic 新开了个门户,提交、审核进度、使用数据一站搞定,MCP 用量涨了 110 倍。
Qwen 团队把智能体能力扩展到音视频了,Qwen3.8-Omni-Flash 能做视频剪辑和长视频翻译,还配了两个开源框架,做多模态应用可以看看。
马斯克罕见承认自家 Grok 4.7 不如 Anthropic 的 Opus 5.5,还给了追赶时间表,访谈原话挺少见的。
Databricks 演示了 Unity Gateway 怎么追踪团队用了哪些模型、花了多少钱,Omnigent 还能把你手头的编码智能体拼在一起用。
Lambda 的 CTO 在 Yotta 2026 上讲为什么要自建数据中心和拿电力资源,还公布了 2030 年 3 GW 算力目标,想懂算力生意可以看看。
三大头部实验室要自己定安全规则,不带你玩政府。这对整个行业的监管走向影响很大,看看它们打算怎么管模型测试和审计。
智能体一次请求能吃掉普通对话几十倍的 Token,Uber 和 Microsoft 都开始算这笔账了,Goldman 给了具体数字。
腾讯云给 TDSQL-C 加了数据库分支功能,智能体跑实验用 CoW 写时复制,不用复制整库,改坏了直接回滚。
Anthropic 在 X 上收集 Claude 电脑和浏览器操作的翻车案例,你踩过的坑可以直接反馈给他们修。
Anthropic 给 Opus 5.5 降了价,有人算好了在 Claude Code 里到底省多少钱,还做了个计算器,你可以套自己的用量算一算。
训练 LLM 时 loss 突然炸了却找不到原因?OpGuard 能逐比特比对两次训练,直接定位出错的那个算子。
Vercel 的 skills.sh 才 7 个月就有 100 万个 Agent 技能、近 2.8 亿次安装,文章盘点了大家都在教 Agent 干什么,做 Agent 开发的可以看看风向。
有人把 Claude 接进 Slack 当团队自动化员工用,复现 bug 自动提 PR、花千万 token 挖数据,4 条提示词直接抄走。
Rest of World 跟了 6 位亚非从业者,看他们真拿 AI 干活:搭工具、做生意、做研究,比看厂商发布会实在多了。
NaceAI 刚发了 Drex,一个小于 6B 的小模型,专门帮智能体做路由和选工具,不写推理文本直接输出每个选项的概率,比用生成式模型省算力。
四条硬消息打包:DeepMind 要给智能体放权,DeepSeek 年化收入冲到 10 亿美元,还有 Anthropic 创始人争夺公司控制权,一期看完几家公司动态。
Salesforce Research 搞了个跑研发全流程的智能体系统,代码优化提速最高 1.84 倍,还能自动训练 1T 模型,搞基建的可以看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档