#多模态模型
Zai_org发布了GLM-5.3-Flash,首个GLM-5系列多模态模型,处理能力惊人,值得一试。
DeepSeek新模型DeepSeek-V4-Flash-Vision-Exp发布,性能接近Opus-4.8,值得尝试。
BFL 新出的 FLUX 3 图像生成超强,直接吊打 Seedance 2.0、Gemini Omni 和 Grok Imagine,还带了个机器人模型,快来看看。
Infinity-Parser2 用多任务强化学习搞定文档解析,开源了500万样本数据集,Pro版在OCR基准上刷新纪录,Flash版速度快3倍多。适合做文档智能处理的开发者。
多模态推理模型终于有了高效的开源选择——MiniMax M3 用 23B 激活参数实现长上下文多模态推理,做视频分析或长文档处理的团队可以直接在 NVIDIA 端点免费试,值得关注。
做绘本、PPT 或教程的创作者终于不用反复修图了——这个模型能保持角色和画风从头到尾一致,直接生成多页内容,建议试试。
全双工交互解决了 AI 对话中“你说我听”的延迟感,做实时语音/视频助手或协作工具的团队可以直接参考——Thinky 把自然交互和智能水平平衡好了。
小米把终端 AI 编程助手做成了开源产品,百万 token 上下文和自进化系统对处理大型项目的开发者很实用,兼容 Claude Code 让迁移几乎无感,建议试试。
神经科学和AI交叉领域的研究者会感兴趣——Topo-Omni用单一模型统一了多模态皮层地图,还能预测新脑区,做认知建模或脑启发AI的团队值得关注。
Google 一周内连发 6 项更新,覆盖企业智能体、科学推理、端侧模型和创意工具,做 AI 应用开发或科学研究的团队值得逐一了解,尤其是 Co-Scientist 和 Gemma 4 12B 的离线能力值得一试。
零蒸馏模型意味着更高的原始性能和可追溯性,做模型评估或对数据纯净度敏感的团队值得关注,可以直接在 Foundry 和 OpenRouter 上试用。
多模态模型本地运行门槛进一步降低,做 AI 应用或本地部署的开发者可以关注 Gemma 4 与 Qwen 的对比,评估是否值得迁移或尝试。
多模态模型终于能跑在普通笔记本上了,做本地 AI 应用或边缘计算的开发者可以直接下载试用,16GB 内存就能跑视觉+音频推理,开源许可也友好。
Gemma 4 12B 让中小团队也能用上原生音频多模态模型,16GB 内存门槛极低,做语音交互或视觉应用的开发者可以直接下载试试。
空间推理是多模态模型的短板,IPT 提供了一种不依赖文本思维链的监督方式,做视觉推理或空间理解的团队可以直接参考论文方法。
这篇综述为交通领域的从业者提供了LLM应用的完整地图——从传感器数据到决策支持,做智慧交通或城市管理的团队可以直接参考其中的案例和挑战,避免重复踩坑。
做视频理解或多模态应用的开发者,终于有了一个长上下文和深度理解兼得的开源模型,建议直接去 Hugging Face 下载试试。
视频创作者和剪辑团队终于有了能真正省时间的 AI 工具——粗剪效率提升 16 倍,建议做短视频或营销内容的直接试用。
做LLM智能体开发的团队终于有了计划表示的系统性对比——选对计划形式能直接提升任务成功率,建议做Web Agent的开发者点开看看具体指标差异。
做数字人、虚拟角色或交互式 AI 的团队终于有了一个统一框架——Archon 把文本、音频、动作、视频全打通了,不用再拼凑多个模型,做沉浸式体验的开发者可以直接参考其架构。