Video(视频)在AI领域特指由大模型生成或理解的多媒体内容,正成为继文本、图像之后人工智能突破的新前沿。近期多个团队和平台推出创新应用,使AI视频的生成、编辑和理解能力显著提升,竞争日益激烈。 AI视频技术近期进展 谷歌Gemini Omni Flash文生视频模型登顶Video Arena盲测榜:该模型在lmarena.ai的盲测中超越其他选手,排名第一,展现出强大的视频生成质量。(原文标题) browser-use团队开源video-use,让LLM通过转写文本理解视频并剪辑:该工具将视频内容转写为文本,供LLM理解并自动完成剪辑任务,拓展了大模型在视频处理中的应用。(原文标题) NotebookLM推出短视概览功能,将复杂来源转为60秒教育视频:用户可将文档、网页等内容一键生成为简洁的教育视频,降低视频制作门槛。(原文标题) Agnes AI推出免费视频创作平台Pavo,一句话生成视频:用户仅需自然语言描述即可获得完整视频,进一步简化创作流程。(原文标题) 当前焦点与观察点 当前AI视频技术焦点集中于生成质量、操控便利性和多模态融合。谷歌Gemini Omni Flash的领先地位表明头部玩家持续加码;而开源项目如video-use则推动技术民主化。同时,NotebookLM和Pavo等产品将AI视频引入教育、营销等垂直场景。争议点在于:生成视频的版权与真实性如何界定?模型是否会加剧深度伪造风险?此外,视频编辑的精确控制仍是难点。整体看,Video领域的AI应用正从“能生成”向“可用、好用”演进,未来一年或迎来更多行业落地。