一篇改注意力机制的论文:value 不再做投影,改查 token 记忆表,推理还能省显存,做模型结构的可以看看。
#开源模型
Ornn 拉了三个月数据:OpenAI 降价 62%,DeepSeek 降 51%,但 B200 租金反涨 50%。想搞清楚钱最后流向谁的,看这篇。
TogetherAI 把 Qwen3.5 4B 微调成分类器,17 美元、25 分钟就能复现,数据和代码全开源,适合想上手微调的人照着跑一遍。
有人在 6GB 显存的笔记本上,用土耳其语 109 页报告实测了五款 7B-8B 开源模型,还顺手证明花哨检索方案打不过 TF-IDF,做 RAG 的可以看看。
小模型跑工具智能体老犯重复调用、提前写入这类错,这篇把失败经验做成异构图记忆来避免,τ-Bench 和 AppWorld 都验证有效,做本地部署的可以看看。
Wayve 这篇论文教你怎么用不到5%的语言标注训出能开车的VLA,Bench2Drive 上分数还超过全监督基线,做自动驾驶的值得看看方法细节。
阿里千问出的手机 Agent 三件套,规划、执行、创作分工明确,API 优先、点屏幕兜底,还把四套评测基准开源了,做手机智能体的可以看看。
Fireworks 在 Kimi K3 上做了个减法:推理 token 少用 40% 但质量不掉,跑推理烧钱的朋友可以看看。
阿里把 Qwen3.8 Max 出了个高吞吐版 Prime,2.4T 参数、1M 上下文还能吃图和视频,已经能在 OpenRouter 直接调了。
教你把开源的 OpenCode 接上 Bedrock 里的开源模型当编程智能体用,数据留在自己账户里,还讲了怎么给不同任务配不同模型。
一个叫 Audio8 ASR Infinite 的流式语音识别开源了,能 7x24 无限时长转写不漂移,靠语义轮次检测解决长音频老毛病,做实时转写可以看看。
NVIDIA 开源了个说话人追踪模型,1秒语音就能分清谁在说话,还能让 Reachy Mini 机器人认人记名字,商用许可也友好。
Hugging Face 出了个 lerobot 的 JS 包,浏览器直接看机器人数据集,不用下载,600 行代码就能搭个查看器,玩机器人数据的可以试试。
小米把 MiMo-V2.6 整套开源了,Pro 在智能体基准上打平 Claude Opus 5,本地跑前沿模型的门槛又降了。
NVIDIA 出了个 100M 参数的小模型,专门搞定多人说话分不清谁是谁的问题,8 人以内、说话重叠都能识别,已经上了 Hugging Face。
Qwen 一次发了五款语音模型,能识别方言、区分多个说话人还能标注情绪,价格还砍了 95%,做语音应用的可以看看。
阿里 Qwen 出了三个手机智能体,能规划任务、操作手机、一句话生图,还把测试基准开源了,做移动端 Agent 的可以看看。
Step 5 Preview 刚发布,作者拿发动机动画和3D抓娃娃机两个任务实测它,和 GLM-5.3、DeepSeek-V4.1-Flash、GPT-5.6 Sol 逐项对比耗时和成品质量,比看跑分实在。
蚂蚁百灵开源了两个 6B 的设计生图模型,能直接出 UI 和海报,还能把图拆成透明图层,评测里开源第一,OpenRouter 可免费试用两周。
科大讯飞发了 Spark-ASR-2.0,方言和嘈杂环境识别提升明显,成本只涨 10%,明天就能在讯飞输入法里用上。
Alibaba 在 Apsara 2026 透露 Qwen4 正在训练,后续 Qwen4.5、Qwen5 要做到 5–10T 参数,用 Qwen 的可以关注下节奏。
阿里这次一口气发了五款语音模型,方言识别和能自己生成配乐音效的 TTS-Next 都挺有意思,价格还砍了一波。
StepFun 把自家 Coding Agent 开源了,跑分还行,作者顺手整理了国内各家开源编程 Agent 的 GitHub 链接,选型可以直接抄。
藏师傅那个 1 万多 star 的中文去 AI 味工具更新了,吸收了上游迭代和 issue 里的反馈,写文案被 AI 味困扰的可以去试试
Qwen 的图像模型这次在 LMArena 两个榜单都是开源第一,图像编辑拿到 1367 分,总榜离 GPT-Image-1.5 只差 3 分,做图的朋友可以试试。
中国电信开源了个 29B 的 MoE 模型,只激活 4B 参数、支持 256K 上下文,全程在昇腾芯片上训练,权重挂在 Hugging Face 和 ModelScope 上可以直接下载。
低配显卡党福音:Unsloth 把 Qwen-Image-2.1 量化到 12GB 显存就能本地生图,6GB 显存走 FP8 offloading 也能跑,质量还对标 Nano Banana 2.0。
LlamaIndex 家的 PDF 转 Markdown 工具 LiteParse,一页只要 2.8ms,本地就能跑,做 RAG 解析文档的可以试试。
LlamaIndex 的 Jerry Liu 开源了 DocJev,扔几条自然语言规则就能给文档分类和拆分,速度还比 gpt-5.6-luna 快 6 倍,免费可用。
Anthropic 发了 Opus 5.5,能力跟 Fable 5.1 差不多但便宜四成,用 AI SDK 的可以直接接上试。
Anthropic 预告 Claude Sonnet 5.5 和 Haiku 5.5 几周内就来,主打性能、效率和安全三方面升级,用 Claude 的可以蹲一下。
小米的 MiMo v2.6 Flash 跑分接近 Grok 4.7,成本却只有 1/57,做 agent 的可以看看这份 60 任务实测。