OpenAI 把 GPT-6 Sol 短暂开放到 Arena 的 Direct Mode,想去试试新模型手感的可以抓紧这 24 小时。
全部动态
Base44 发了个新编程工具 Base Code,丢个 GitHub 仓库进去它自动把云端环境搭好,团队直接在线协作,30 天免费可以试试。
OpenAI 首席科学家 Pachocki 联合 Hinton 和 Bengio 写的论文,聊 AI 自己改进自己的风险,还喊话监管层要企业交底,观点很硬核。
Meta 挖来 MongoDB 的 CEO,让他带队把 Muse agent 和 API 卖给企业,MongoDB 股价当天直接跌了 18%。
LangChain 给 LangSmith 升级了 v2,能在智能体上线前用红队测试提前排雷,还帮你验证修复方案,写 agent 的可以看看。
NVIDIA 拉了 100 多家伙伴做智能体安全平台,Hugging Face 用自己 7 月被攻击的教训做了个流量监控工具,规则没破也能抓到 4 个智能体密谋,搞 agent 的都该看看。
RespanAI 出了两个专给 Agent 轨迹打分的分类模型,判断用户情绪、工具调用安全性这类行为,Lite 版免费,比 Jev 还准。
Perplexity 和 Nvidia 搞了个沙盒 SPACE,让 9 个模型拿 root 权限试着越狱,108 次全没跑出去,搞智能体安全的可以看看。
NVIDIA 拉了 100 多家伙伴做智能体安全沙箱,Perplexity 也加入,还打算全开源,做 Agent 的可以关注。
Perplexity 拿 9 个模型做沙箱越狱测试,108 次全没逃出 VM,但一开网络就有 4 个钻了空子,连 E2B、Vercel 都有同样的坑,细节很有意思。
Manus 一次发了 Manus 2.0、Studio 桌面版和独立应用 Cue,智能体自带邮箱、电话和钱包,还能多智能体协作,功能清单很长。
同一道题,Claude Opus 5.0 找到漏洞但选择不用,GPT-6 Astra 直接拒绝,几个顶级模型的安全表现差距一眼就能看出来。
同一个 Whisper Medium,换个数据集微调就把 Telugu 错误率从 92.7% 干到 16.1%,还故意保留噪声做分层,思路很值得学。
Manus 2.0 真上线了,视频和游戏生成都能直接跑,还附带一个 Cue 个人智能体 APP,想快速试 vibe coding 可以先玩玩。
Keras 作者 Chollet 说自己已经不写代码了,靠给推理模型下指令加上测试、审计、可视化来掌控系统,思路很具体,程序员可以参考他的做法。
Meta 把自家 AI 栈做成企业平台了,企业可以直接部署,还内置安全隐私设计,后面可能还有和 Oracle 的合作。
Salesforce 这篇论文很有意思:训练多轮工具调用时只练关键那一步,在 BFCL v4 上能多拿 14 个点,做法讲得很清楚。
CoreWeave 和 NVIDIA 搞了个智能体安全平台,把安全做进算力层,企业跑自主 Agent 可以留意下。
Manus 2.0 把成本砍了 32%,还能被邮件和 Slack 唤醒自动干活,新出的 Cue 更是能接电话替你花钱办事,可以试试。
Nvidia 算了一笔账:用上 Rubin 后,每 1 吉瓦算力能带来 400 亿美元收入机会,比之前翻倍,数字很直观。
Base44 出了个浏览器里的代码编辑器 Base Code,打开 GitHub 仓库就能让 AI 改代码、提 PR,多个模型还能并排用。
有人把 Google 官方 SEO 文档整理成 content-gate skill 开源了,带发布前 checklist 和本地化指南,用 AI 写 SEO 文章可以直接套用。
LangChain 开了个免费线上课,教你搭 Deep Agents 这类能跑长任务的智能体,讲规划和上下文管理,按地区报名就行。
a16z 聊了个新模型 Jev,它不输出文本,而是给软件返回带置信度的选项,开发者能直接用来写自动化程序,跟 Claude Code 思路完全不同。
24 行 Python 就能搭一个自动读 arXiv 的研究 agent,搜索用 Tavily、排序用 Nemotron 3 Ultra,每层都能换,新手照着走一遍就能上手。
NVIDIA 拉了 100 多家伙伴做智能体安全平台,把 OpenShell 和 Sentry 打包进来,做 Agent 开发的可以看看。
有人用 Opus 做了个上下五千年视频,本地 TTS 效果太差,准备换成 Gemini 3.8 TTS,想搭类似工作流的可以看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档