Simon Willison 演示了怎么用 datasette-mcp 让 ChatGPT 语音直接查自己博客的数据库,会玩 MCP 的可以照着搭一个。
全部动态
Hugging Face 老板在安理会讲自家被 AI 攻击的经过,闭源 API 拦着不让用,最后靠中国的开源模型 GLM 5.2 才防住,观点挺有意思。
有人把 fabel 5.1 换成了 Opus 5.5,说又快又便宜,跑长任务写代码像老工程师一样有条理,写代码的可以试试。
在 Hugging Face 跑 agent 的朋友看下,Agent Traces 现在每条 trace 都带 token、缓存命中和花费回执,排查成本很直观。
Fireworks 在 Kimi K3 上做了个减法:推理 token 少用 40% 但质量不掉,跑推理烧钱的朋友可以看看。
阿里把 Qwen3.8 Max 出了个高吞吐版 Prime,2.4T 参数、1M 上下文还能吃图和视频,已经能在 OpenRouter 直接调了。
Gemini 3.8 的语音合成变便宜了,能一次生成多人对话,2000 多种声音可选还能克隆,Simon Willison 已经拿来做 demo 玩了。
Cursor 团队把内部学到的省 token 方法打包成一个提示词,直接喂给你的 agent 就能系统性降成本,还有真实案例数据。
在洛杉矶的朋友可以关注,LangChain 线下活动讲 Deep Agents 和 LangSmith Engine,还有 ServiceTitan 分享真实落地经验。
Replit 的 CEO 和 a16z 办的新学校聊教育:学编程别报课,挑个自己想做的东西直接上手,AI 时代每人都做得到。
Claude Opus 5.5 和 GPT-6 Sol 都上了 Arena,可以直接并排看两个模型的输出,还能自己上手测。
Replit 的 CEO 和 HAA 创始人聊学习:别再上 Python 课,直接用 AI 做个自己想做的东西,比任何教程都管用。
腾讯混元做了个新基准 WebCraftBench,用 369 条真实需求测 AI 写网页到底靠不靠谱,测了 17 个模型,和 Code Arena 榜单相关性 0.89。
OpenRouter 让 8 个模型画同一张梗图,还把两个真人用户 P 进去,第二季 B 组投票开始了,去围观哪个模型最有梗。
Notion 官方宣布支持 Claude 直连,聊天时就能搜改你的 Notion 页面,还能顺带逛逛 Claude Marketplace 里的其他插件
Google 这篇论文值得做 Agent 的人细读:自动优化 harness 会让你 eval 分数涨但真实任务变差,RRSI 用双向正则化解决了这个问题。
Anthropic 给 Claude 开了个应用商店,里面能装 Slack、Notion 连接器,还能直接买 Cursor 和 CrowdStrike 做的 Agent,企业找服务商也行。
Anthropic 开了 Claude 官方应用市场,能在里面逛第三方工具和智能体,自己开发的话也能上架卖服务。
Anthropic 让 Claude 自己读文献、挖基因组数据还提出了验证实验,真发现了一个疑似新基因编辑机制,Dario 亲自发的长文,值得看看 AI 做科研到底走到哪一步了。
Bolt 公了一周真实用量:GLM 5.3 Flash 占 63%,DeepSeek Flash 17%,用户宁可要快的也不挑最大的,这个数据挺说明问题。
OpenAI 用树莓派加 GPT-Live-1 和 GPT-5.6 Luna 搭了个能边聊边干活的桌面小设备,对话和后台任务分开跑,方案挺有意思。
HeyGen 演示了一个省事玩法:花 2 分钟设置,一条 7 点定时提示词,数字人视频就自动生成还能翻成多语言,做内容号的可以照抄。
Cognition 给 Devin 加了 Teams 原生支持和 Microsoft 365 集成,能直接连你的邮件、日历和文件干活,用微软全家桶的可以试试。
Genspark 上线了 GenCode 编程智能体,Claude、GPT、DeepSeek 一个账号随便切,开源模型价格只要十分之一,适合想自己挑模型的开发者。
AI Engineer 把 2026 大会的视觉 OCR 场次全放出来了,LlamaIndex 和 Hugging Face 的人都来讲实战,做文档和视觉应用的很值得刷一遍。
Fireworks 出了个 ARCv3 压缩器,能把 BF16 权重更新压小近一半,自己搭 trainer 跑 RL 的团队可以省不少跨区传输成本。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档