#开源模型
Unsloth 把 Laya 决策模型做到了 4GB 内存就能本地跑,还能无缝替换 Jev API。做分类决策类应用的朋友可以看看,文章里 confidence 和 probabilities 的坑讲得很实用。
IQuest 新出的 320B 编程模型 IQuest-Q1,vLLM 首日就能跑,上下文到 52 万 token,想本地部署智能体编程的可以看看。
MiniMax-H3 生成太慢太吃显存?这篇把云端和边缘两端都解决了,最快 30 倍提速,单张 DGX Spark 就能跑视频生成。
给符号回归套了个专用运行框架,同样的 DeepSeek 底座准确率从 62% 拉到 94%,还超过了 Codex,做 AI for Science 的可以看看。
Abstraction.ai 创始人 Bindu Reddy 出了个开源智能体网络,底层跑 DeepSeek Flash,带 100 多个连接器,智能体之间还能互相沟通干活。
一篇教你怎么把 MoE 和循环 Transformer 结合的论文,Foil 把专家层数减半、循环翻倍,同等算力下预训练损失更低,代码也开源了。
LangChain 和 NVIDIA 一起出了个开源智能体参考架构,号称推理成本降到十分之一,搞智能体开发的可以看看这套架构怎么搭。
NVIDIA 拉了 100 多家伙伴做智能体安全沙箱,Perplexity 也加入,还打算全开源,做 Agent 的可以关注。
小米把大模型负责人提到了公司最高职级,同天开源的 MiMo-V2.6-Pro 在 AA 指数上还压过了 Kimi K3 和 GLM-5.3,开源圈又多一个能打的选手。
月之暗面的 Kimi K3.1 被开发者从 API 后台挖出来了,100 万上下文加三档推理强度,定价可能和 K3 持平。
Cloudflare 出了个给 Astro 用的开源 CMS,插件跑在沙箱里,还专门考虑了让 AI 智能体来操作,做内容站的可以试试。
MiniCPM5-2B 出了 4-bit 量化版,权重才 1.61 GB,T4 上能跑 70 tokens/s,想在自己机器上跑小模型可以试试。
看图直接给候选动作打分的开源小模型,底座是 Qwen3.5-0.8B/2B,单步 122ms,做 GUI Agent 或机器人反射层挺合适。
AT&T 每天 450 亿 token 的账单太吓人了,他们要把开源模型占比拉到 70%,FT 这篇讲清了美国企业为什么开始算小账。