AI热报 · 今日精选 AI 资讯
vLLM 联合 KR Labs 出的 Vela 2.0,一次调用就能做安全检查、领域分类和 PII 识别,四个尺寸可选,Apache-2.0 开源。
有人 Vibe Coding 写出死循环被 Cloudflare 收了一万刀,作者分享了防坑规则,用 Durable Objects 的都该看看。
xAI 把 Grok API 能做的东西写成了 10 个能直接跑的开源示例,从打电话的语音机器人到 5 美元一支的短片,代码全在 GitHub 上,抄起来很方便。
手把手拆了一个数据分析 Agent 的三层架构,主模型只写 SQL,另一个模型负责审查,连 200 行限制和人工审批都写好了,做 Agent 的人直接抄作业。
用 Claude Code 做开发的朋友可以试试这个 html-plan 插件,计划文档变成能点能评论的 HTML 页面,审起来快多了。
搞推理部署的可以看看:B200 上 4:8 稀疏让 MoE 专家层快 1.35-1.65 倍,Kimi-K2.5 实测也有 1.18 倍。
有人把 Claude Code、Codex 这些 harness 全改成了 RL 环境,接 vLLM 就能自己设计奖励,训练后工具调用少了 31%。
一篇教代码智能体"怎么从自己的纠错里学到更多"的论文,在 DeepSeek/CodeARC 上把 Pass@1 从 15.0% 拉到 20.4%,做法挺有意思。
Apple 的论文,讲怎么在多个交互环境里同时训练一个 LLM 智能体,用 rubric 评分挑数据,全对全错的样本也能靠自蒸馏利用起来。
MIT 这节课把 1957 年的 FORTRAN 论文改几个词,就变成了对 Claude 写代码的预言,还讲清了 prompt 和编译器最关键的区别,讲义免费公开。
Google DeepMind 把多模态嵌入模型压缩到手机能跑的体积了,纯文本只占约 191MB 内存,还能搜代码和音视频,做端侧 RAG 的可以看看。
LlamaIndex 的 Logan 写了篇实操文:OCR 别再单次跑,改成布局感知、难元素路由、多轮自检的循环,能救回表格和图表。
做 RL 训练或大规模推理部署的可以看,DeepSeek-V3 权重同步直接从 5.78 秒砍到 2.77 秒,还是进 NCCL 的正经方案。
Simon Willison 用 GPT-6 Astra 写了个插件,把 OpenAI 新的 Decisions API 接进 llm 命令行,还能对图片做 yes/no 判断,比 Jev 贵但支持图像。
SemiAnalysis 实测了九家 AI 订阅套餐,发现 Claude 在中档模型上价值领先 OpenAI 5 倍,且 OpenAI 刚刚大幅削减了套餐额度。
OpenAI 上线了 Decisions API 公测版,能让应用实时自动选模型和工具,速度比走 Responses API 的 GPT-6 Luna 快 10 倍,做智能路由的可以试试。
Keras 之父 Chollet 抛了个有意思的问题:RLVR 只能拉高数学和代码,其他领域能不能跟着涨还不确定,这直接决定接下来模型能走多远。
DeepSpeed 常被当成只做 ZeRO 显存优化,这场演讲会讲它的自动张量、序列、专家并行,还带基准数据,做大模型训练的可以看看。
Stanford 拿 5 个模型实测发现,多个智能体抢共享资源时互相覆盖,Opus 5 团队只拿到 30% 价值,单智能体能拿 64%,做多智能体系统前建议先看看。
OpenAI 出了个 Decisions API 公测版,能让你的应用实时挑模型和工具,官方说比 GPT-6 Luna 快 10 倍,做智能体的可以试试。
智谱AI最近发布的GLM-Image确实在AI图像生成领域投下了一枚重磅炸弹。免费、无水印、中文文本渲染能力强,这三个特点组合在一起,足以让整个行业重新审视中国AI技术的实际进展。 国内AI图像生成工具一直面临着中文文本渲染的难题。Mid…
AI制药新玩家:Anthropic的"不盈利疾病"战略能否颠覆传统药物开发? Anthropic,这家以AI安全著称的公司,突然宣布进军药物发现领域。不是辅助工具,而是直接下场开发药物,而且专门瞄准那些传统制药巨头认为无利可图的疾病。这究…
1107 vs 303:谷歌这个开源模型,把大模型的“打字机”拆了 同一张 H100 显卡。同一个 26B 参数架构。303 那个还开启了多 token 预测加速。DiffusionGemma 跑出了 1107 token/s,是标准版…
DiffusionGemma:当扩散模型开始“写”字,自回归的统治还能撑多久? 过去一周,我的信息流里“DiffusionGemma”这个词反复出现。在AI圈,当一个技术名词开始密集出现在各个群聊和推文中,通常意味着两件事:要么是又一轮泡…
每秒 1107 个 token,但问题从来不只是速度 昨天,Google 开源了 DiffusionGemma。 一个 26B 参数的模型,在 H100 上跑到 1107 tokens/s。对比之下,传统自回归的 Gemma 4,哪怕开启…