Fireworks 在 Kimi K3 上做了个减法:推理 token 少用 40% 但质量不掉,跑推理烧钱的朋友可以看看。
全部动态
阿里把 Qwen3.8 Max 出了个高吞吐版 Prime,2.4T 参数、1M 上下文还能吃图和视频,已经能在 OpenRouter 直接调了。
Gemini 3.8 的语音合成变便宜了,能一次生成多人对话,2000 多种声音可选还能克隆,Simon Willison 已经拿来做 demo 玩了。
Cursor 团队把内部学到的省 token 方法打包成一个提示词,直接喂给你的 agent 就能系统性降成本,还有真实案例数据。
在洛杉矶的朋友可以关注,LangChain 线下活动讲 Deep Agents 和 LangSmith Engine,还有 ServiceTitan 分享真实落地经验。
Replit 的 CEO 和 a16z 办的新学校聊教育:学编程别报课,挑个自己想做的东西直接上手,AI 时代每人都做得到。
Claude Code 又更了一版,企业走 Bedrock 的能配 IAM 角色和 guardrail 了,还修了一堆会话恢复丢上下文的烦人 bug,天天用的人建议升。
Claude Opus 5.5 和 GPT-6 Sol 都上了 Arena,可以直接并排看两个模型的输出,还能自己上手测。
Google 新出的 TTS 模型支持 30 秒音频克隆音色,还能让多个角色用不同声音对话,生成 1 分多钟音频只要 2.74 美分。
Airbnb 把 GPT-6 Astra 开放给更多工程师,用来修 bug 和做系统设计,想看大公司怎么在工程流程里用 OpenAI 模型的可以看看。
Replit 的 CEO 和 HAA 创始人聊学习:别再上 Python 课,直接用 AI 做个自己想做的东西,比任何教程都管用。
一家做 AI 心脏超声引导的公司 UltraSight 拿了 2400 万美元 B2 轮,让非专科医生也能在床旁做心脏彩超,Mayo Clinic 还在跟投。
腾讯混元做了个新基准 WebCraftBench,用 369 条真实需求测 AI 写网页到底靠不靠谱,测了 17 个模型,和 Code Arena 榜单相关性 0.89。
OpenRouter 让 8 个模型画同一张梗图,还把两个真人用户 P 进去,第二季 B 组投票开始了,去围观哪个模型最有梗。
Notion 官方宣布支持 Claude 直连,聊天时就能搜改你的 Notion 页面,还能顺带逛逛 Claude Marketplace 里的其他插件
偏头痛患者可以看看,Nerivio 应用用 5.3 万人的数据训练模型,提前一天预测头痛,准确率 91%。
Google 这篇论文值得做 Agent 的人细读:自动优化 harness 会让你 eval 分数涨但真实任务变差,RRSI 用双向正则化解决了这个问题。
Anthropic 给 Claude 开了个应用商店,里面能装 Slack、Notion 连接器,还能直接买 Cursor 和 CrowdStrike 做的 Agent,企业找服务商也行。
Anthropic 开了 Claude 官方应用市场,能在里面逛第三方工具和智能体,自己开发的话也能上架卖服务。
Anthropic 让 Claude 自己读文献、挖基因组数据还提出了验证实验,真发现了一个疑似新基因编辑机制,Dario 亲自发的长文,值得看看 AI 做科研到底走到哪一步了。
OpenAI 做了个心理健康对话评测集,专门测模型遇到自伤、焦虑这类敏感问题时答得稳不稳,各家模型能拿它来横向对比。
Bolt 公了一周真实用量:GLM 5.3 Flash 占 63%,DeepSeek Flash 17%,用户宁可要快的也不挑最大的,这个数据挺说明问题。
一家用 AI 从天然分子里找药的生物公司 Enveda,刚融了 3.11 亿美元,估值 20 亿,已有皮肤病和 GLP-1 停药体重维持两条管线在临床。
OpenAI 用树莓派加 GPT-Live-1 和 GPT-5.6 Luna 搭了个能边聊边干活的桌面小设备,对话和后台任务分开跑,方案挺有意思。
客服公司 Ringg 把电话 Agent 换成 GPT-5.6,自动接了 65% 的来电,成本还比 GPT-4.1 便宜 90%,做客服自动化的可以看看。
HeyGen 演示了一个省事玩法:花 2 分钟设置,一条 7 点定时提示词,数字人视频就自动生成还能翻成多语言,做内容号的可以照抄。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档