微软开源了个跨三系统的沙箱库 MxC,专门解决给 agent 搭沙箱要各平台各搞一套的麻烦,写 agent 工具的可以看看。
#开源模型
在柏林的朋友可以看看,Together AI 拉上 n8n 和 NVIDIA 聊怎么用开源模型做开发,还管饭。
StepFun 把 Step 5 Preview 放上 OpenRouter 了,写代码跑 Agent 的朋友可以在 Cline、Kilocode 里免费用一周,顺便试试任务成本能省多少。
IBM 把自家 Spyre 芯片接进了 PyTorch,靠的是设备、内存、编译这些现成抽象层,想了解框架如何兼容多硬件的可以看看这篇官方博客。
Kokoro-82M 蒸馏出个 8M 参数的小模型,CPU 单线程就能实时跑语音,没 GPU 也能玩,还有在线试听。
Anthropic 放出了 Haiku 5.5,价格不变但据称跑赢了 GPT-6 Luna,想省钱跑高频任务的可以对比一下。
德国搜索引擎 Ecosia 嫌 Mistral 慢一年,改用 Qwen、GLM、Kimi,成本砍半性能还涨,欧洲也开始接中国开源模型了。
Perplexity 出了开源嵌入模型,小的 0.6B 能跑在边缘设备上,大的 9B 在 MADQA 拿了 92.4%,MIT 协议可以自己部署。
Novita Labs 在 SF Tech Week 办了场开源 AI Stack 活动,近千人报名,讲的就是模型之外推理和 Agent 那一整层怎么搭。
Liquid AI开源了两款小尺寸决策模型,最小只有600M还支持多模态,在边缘设备上几十毫秒就能出结果,做端侧Agent的可以试试。
AMD 给 RX 7000/9000 系显卡推了 ROCm 10.1 支持驱动,WSL2 还进了技术预览,想在 Windows 上跑计算的朋友可以看看。
Unsloth 给 Studio 加了运行前安检:代码指纹审批、权重拦截、CI 检查、沙箱运行,加载 Hugging Face 模型前可以先过一遍。
一篇做 Solidity 代码生成的训练方法论文,思路挺有意思:训练时检索、推理时不检索,再用语义扰动造 DPO 数据,Qwen2.5-Coder 等模型上验证有效。
这篇论文拿 Jev 和开源语言模型在 128 个真实故障日上跑九项压力测试,告诉你哪类 HVAC 故障能自动诊断、哪类还得靠人,做楼宇运维的可以看看。
研究者把自然语言接进船体设计:Chip 模型在 SDDBench 上答对 95.90% 的设计问题,NURBS 加 FFD 直接生成几何,代码数据集全开源,搞 CAD 或几何方向可以看看。
284B 的 DeepSeek V4 Flash 量化到 1.6 bit 只要 60GB,配 128GB 内存的 Surface Laptop Ultra 就能本地跑,视频都放出来了。
Liquid AI 把 d1-3B 和 d1-omni-600M 做成了 GGUF 量化包,最小 256 MB,笔记本就能跑,量化版还能保住 97.1% 的精度,本地部署决策模型可以试试。
Anthropic 把 Haiku 5.5 做到成本砍掉 75%,电脑操作跑分翻了几倍,跑批量和子智能体任务的成本党可以看看这个。
Together AI 拉上 IBM 和 NVIDIA,在 IBM Cloud 上搭了套专用 B300 集群跑开源模型推理,企业部署开源模型又多一个选择。
vLLM 花三周把 DeepSeek-V4.1-Flash 跑快了 1.9 倍,AgentX 上吞吐 5.3 倍,还附交互图表拆解过程,做部署的可以看看。
PyTorch 官方大会 10 月 20-21 日在圣何塞办,今年加了新手 track,还有卫星影像遥感的实战分享,做开发的话可以看看。
Mistral 的 Mistral Large 4 来了,1T 参数只激活 49B,权重月底开源,视频里直接和 GPT-6.1、Claude Opus 5.5 掰手腕,可以看看它到底排在哪一档。
Liquid AI 开源了两款不吐文字只给结构化判断的小模型,3B 版读图文、600M 版还能读音频,一次前向就出结果,适合做实时决策。
Cloudflare 的 Clef 27B 和 Clef Flash 9B 开源决策模型上了 OpenRouter,输入给文本或图片,直接回带概率的结构化答案,Flash 每百万 token 才 $0.09。
三条推文都叫 looped transformer 但完全是三种方案,选错能烧掉一周训练,这篇用 Nanbeige 4.2 实测数据帮你分清。
Mistral Large 4 预览版冲进 WebDev 榜第45名,价格只有 Claude Opus 4.8 的六分之一,10月底还会开源。