技巧
Keras 作者 Chollet 说自己已经不写代码了,靠给推理模型下指令加上测试、审计、可视化来掌控系统,思路很具体,程序员可以参考他的做法。
LangChain 开了个免费线上课,教你搭 Deep Agents 这类能跑长任务的智能体,讲规划和上下文管理,按地区报名就行。
24 行 Python 就能搭一个自动读 arXiv 的研究 agent,搜索用 Tavily、排序用 Nemotron 3 Ultra,每层都能换,新手照着走一遍就能上手。
Modal 出了一份免费 GPU 术语手册,从 CUDA 执行模型到性能调优一条链讲清楚,想搞懂 GPU 编程的可以当教材啃
AI21 Labs 放出了两场演讲视频,一场讲 RAG 分块该更新打法了,一场用破案的方式带你排查 vLLM 问题,做工程的朋友可以看看。
Claude Code 作者本尊发话:别折腾微调和小模型,脚手架只提 10%-20%,下一代模型一发全白干,直接等新模型就行。
用 Magpie 加 DeepSeek 本来就便宜,再配 RTK 过滤 Bash 输出,token 直接省七成,搞 agent 的可以试试这套省钱组合。
rauchg 把自己的 Mini 浏览器从 Electron 迁到 Rust+Swift,还嵌了个 agent 进去,启动更快、更 Mac 原生,过程细节很实在。
有人把 Chrome 小恐龙变成了两个智能体的对局,一个跑本地一个走 API,延迟差异一目了然,代码也开源了,适合想学智能体部署的人看看。
Ben Thompson 这期播客信息密度很高,拿 Dropbox 类比 OpenAI 那段尤其精彩,还有台积电和资本泡沫的一手分析。
有人把 Jev 挂在 Agent 的代码编辑流程后当模糊 Linter 用,加了中置信度层后捕获量翻倍,做 Agent harness 的可以看看这套 setup。
Red Hat 的人在 PyTorch Conference 讲怎么用 vLLM 把智能体推理跑到 7x24 企业级,聊 KV cache、并发这些真问题,做后端的可以看看。
斯坦福把讲 Self-Improving AI Agents 的 9 讲视频全放出来了,主讲人做过 PaLM、Gemini、Claude,免费白嫖,适合假期补课。
CMU 的 Neubig 和 Fried 开了门 AI Agents 课程,视频已经放出 9 讲,资料免费公开,周末正好刷完。
宝玉把完整提示词贴出来了,让 Opus 5.5 用 Canvas 一句话画 App Icon、还能做出 62.5 秒带分镜的宣传视频,照抄就能试。
LangChain 创始人聊了个很实在的工程细节:让模型输出概率,设阈值、打日志、写测试,比直接说 LLM 决定的结果好上线多了。
有人把决策模型打包成了 Ollaya,本地跑 GLiClass、Laya 这些模型,还带 TypeSafe API,做分类和路由的可以试试。
有人拿自建 harness 实测了 Jev 路由,性能能追平 GPT-6 Astra low,代价是跑得更久。文章还讨论了为什么公开基准分数别太当真。
Raschka 又更新了,这期手把手教你用 PyTorch 算 token 概率给模型答案打分,还搭了一个 self-refinement 循环,最后跑 MATH-500 看效果。
Opus 5.5 跑 Agent 总干一半就停?其实是你的程序把进度汇报当成交差了。Anthropic 官方给了三招修法,还有迁移避坑清单。
有人把 APK 逆向经验做成开源 Skill,Claude Code 和 Codex 装上就能改 dex、过加壳、啃 Flutter,GitHub 已 1.4k 星。
Claude Code 团队成员自己写的 effort 档位指南,有实测数据:同一道题 low 档只过 1 次、xhigh 全过,还教了一套 low 起手、high 收尾的开发流程。
Claude Code 开发者用 Terminal-Bench 3.0 数据讲清了 effort 档位怎么选,还附了低档写代码、高档跑验证的工作流,写代码的人直接能用。
LangChain 团队聊 Jev 小模型怎么用在实时场景:流式内容过滤、无感 guardrails、低成本监控 agent 轨迹,做应用的可以听听思路。
智谱AI最近发布的GLM-Image确实在AI图像生成领域投下了一枚重磅炸弹。免费、无水印、中文文本渲染能力强,这三个特点组合在一起,足以让整个行业重新审视中国AI技术的实际进展。 国内AI图像生成工具一直面临着中文文本渲染的难题。Mid…
AI制药新玩家:Anthropic的"不盈利疾病"战略能否颠覆传统药物开发? Anthropic,这家以AI安全著称的公司,突然宣布进军药物发现领域。不是辅助工具,而是直接下场开发药物,而且专门瞄准那些传统制药巨头认为无利可图的疾病。这究…
1107 vs 303:谷歌这个开源模型,把大模型的“打字机”拆了 同一张 H100 显卡。同一个 26B 参数架构。303 那个还开启了多 token 预测加速。DiffusionGemma 跑出了 1107 token/s,是标准版…
DiffusionGemma:当扩散模型开始“写”字,自回归的统治还能撑多久? 过去一周,我的信息流里“DiffusionGemma”这个词反复出现。在AI圈,当一个技术名词开始密集出现在各个群聊和推文中,通常意味着两件事:要么是又一轮泡…
每秒 1107 个 token,但问题从来不只是速度 昨天,Google 开源了 DiffusionGemma。 一个 26B 参数的模型,在 H100 上跑到 1107 tokens/s。对比之下,传统自回归的 Gemma 4,哪怕开启…