用 Claude Opus 5.5 生成的 1000 多个视频被整理成了一份带链接的清单,想看这模型实际能做出什么画面的可以去翻翻。
#开源模型
Convai Innovations 在 Hugging Face 挂出了模型卡,想追开源新模型的话可以直接去页面看参数和用法。
Jev 发布才 7 天,开源多语言 System 1 决策模型就冲上 Hugging Face 趋势榜第一,GitHub 星标破 1.5 万,追开源动态的可以看看。
HuggingFace 开源了 5000 个数据科学 RL 任务,源自真实 Kaggle 笔记本,评分不用 LLM 判卷,还配了 SFT 轨迹和 Colab 脚本,想自己练小模型可以直接上手。
Hugging Face 开源了 5000 个可验证 RL 任务,专练小模型的代码和数据科学能力,环境和训练脚本全给你,想自己跑 RL 的可以看看。
Qdrant 开源了 Supernova 工具和一个 10B 的 FineWeb 数据集,做向量搜索调优和评测的人可以直接拿来用。
OpenRouter 把 Kev 的底细公开了:就是 Qwen3.5-4B-Base 上加了个 LoRA 和 pointer head,权重在 Hugging Face 上,想研究小型模型微调的可以拆开看看。
美团中秋半夜甩出 LongCat 2.5 预览版,16T 参数只激活 48,还有 1M 上下文和原生多模态,参数配置看着很猛,可以蹲一下实测成绩。
阿里 Qwen3.8-Max 被曝跑了 33 轮自动训练迭代,AA 分数从 40 涨到 45,还有 2.4T 参数的说法。
Qwen 团队把智能体能力扩展到音视频了,Qwen3.8-Omni-Flash 能做视频剪辑和长视频翻译,还配了两个开源框架,做多模态应用可以看看。
Edge0开源的流式语音识别模型,中英文都能转,延迟几百毫秒,显存占用恒定不爆内存,直播听写可以直接跑起来。
DeepSeek 和智谱都出了 Flash 版本,看来各家都在学 Google 那套分级打法,DeepSeek 可能还要出 Pro 和 Ultra。
有人扒到智谱 GLM-5.5 Flash、GLM-5.4 和 Kimi K4 的命名线索,猜 K4 激活参数比 K3 还少,吃瓜看看。
一个开源工具把 Claude Code、Codex 这些命令行编程智能体装进一个界面,会话不丢、能挂后台跑、手机审批,比自己开一堆终端省事多了。
把人类技能攻略变成训练环境喂给模型,微调后 35B 小模型在 SkillsBench 上跑赢了 Claude Sonnet 4.6,方法思路挺有意思。
Odyssey 的 Agora-2 能让最多20个人和 AI 进同一个 AI 实时生成的世界,靠看《暗黑破坏神 II》录像学会规则,思路挺特别。
DeepSeek 的 Agent 框架 dsh 出官方桌面版了,不用再装 Node.js 敲命令,Windows 和 M 系 Mac 都有下载,装完就能跑。
机电调试场景里怎么防大模型编造计划?这篇论文的做法挺有意思:小模型只管提候选,发布权交给外部验证层,21 个伪造计划全被拦下,但也暴露了防不住错误用户答案的短板。
TTLab 团队用 MARBERTv2 检测阿拉伯语机翻的错误片段,加了焦点损失和方言阈值,六款编码器里效果最好,在赛事拿了第三名。
Scale AI 的 Muse Spark 1.3 现在能在 Google Cloud 和 Oracle 上直接调用了,用这两家云的开发者可以试试。
Weights & Biases 创始人要在 Fully Connected 2026 聊开放智能这个话题,做 AI 基础设施的人可以看看。
DeepSeek Harness 出官方客户端了,没带浏览器插件,正好配这个开源的 OpenCLI-MCP,作者说体验能打平 codex 插件。