13:26berryxia@berryxiaAether AI创始人黄碧薇教授指出,当前视频生成模型仅学习“手靠近杯子时杯子会动”的相关性,而非因果机制。其团队benchmark显示,因果结构可使机器人任务成功率提升25-50%,样本需求降低5-10倍。在物理世界如机器人、自动驾驶中,相关性模型易产生危险幻觉,因果世界模型旨在让AI理解机制而非表象。行业Aether AI因果模型机器人推荐理由:黄碧薇讲透了AI在物理世界的短板原文稍后读已读值得跟进有用关注 Aether AI
20:46IT之家(博客/媒体)字节跳动旗下火山引擎与香港电视广播有限公司(TVB)达成深度合作,将围绕豆包视频生成模型Seedance 2.0的应用落地,在影视内容智能化生产、短剧制作、IP商业化探索及云基础设施建设等方面展开合作。双方将协同TVB旗下FF工作室,以AI短剧为契机,利用Seedance 2.0的视频生成能力,探索AI在短剧创作和制作流程中的应用。此外,火山引擎还将为TVB提供虚拟机、对象存储、网络资源、云数据库、视频云、CDN内容分发等云产品与服务。这标志着视频生成模型在传统影视行业的首次大规模落地尝试。AI产品视频生成Seedance 2.0TVB推荐理由:传统电视台终于开始拥抱AI视频生成——TVB与火山引擎的合作让Seedance 2.0有了真实影视场景的落地机会,做短剧、影视内容的团队值得关注,看看AI能否真正改变制作流程。原文稍后读已读值得跟进有用关注 视频生成
09:25官方账号arXiv cs.AI@Jiwen Liu, Shujuan Li, Zhixue Fang, Xiaohan Li, Yan Zhou, Zijie Meng, Zhimin Zhang, Yawen Luo, Guoxin Zhang, Yu-Shen Liu, Pengfei WanOmniDirector 提出了一种通用相机运动表示方法,将相机参数编码为网格运动视频,从而支持多镜头视频生成。该框架在百万级相机网格-视频对上训练,能够协调角色、动作和相机,提供导演级别的控制。它设计了一种分层提示扩展代理,通过理解信号关系系统描述相机运动和视觉内容,实现不同控制信号的和谐集成。实验表明,OmniDirector 在复杂相机运动克隆任务上表现优异,解决了现有方法依赖配对数据且性能不佳的问题。论文相机运动克隆视频生成多镜头推荐理由:做视频生成和相机运动控制的团队终于有了一个无需配对数据就能克隆多镜头相机运动的方案——OmniDirector 用网格运动视频统一了相机表示,直接在百万级数据上训练,效果比依赖合成配对数据的方法好很多,做视频编辑和影视制作的开发者值得关注。原文稍后读已读值得跟进有用关注 相机运动克隆
01:05官方账号Logan Kilpatrick@OfficialLoganKGoogle的Gemini Omni Flash模型在图像生成视频、文本生成视频以及视频编辑三个任务上均达到最佳性能(SOTA)。该模型即将通过API向开发者开放。具体基准数据尚未公布。AI模型Gemini Omni FlashGoogle视频生成推荐理由:Google新视频模型SOTA原文稍后读已读值得跟进有用关注 Gemini Omni Flash
00:41lmarena.ai@lmarena_ai精选Gemini Omni Flash在Image-to-Video基准测试中与第一名并列。该成绩相比Veo 3.1实现了77个百分点的提升。该模型为Gemini系列最新成员,专注于多模态任务。AI模型Gemini Omni FlashVeo 3.1图像到视频推荐理由:新模型视频生成超Veo 3.1原文稍后读已读值得跟进有用关注 Gemini Omni Flash
00:19HeyGen@HeyGen_OfficialHeyGen 宣布其 AI 视频生成服务可通过 Stripe Projects 被 AI 代理自动发现、配置、存储凭证并支付,整个过程无需用户注册、粘贴 API 密钥或人工干预。这意味着开发者构建的 AI 代理现在能自主调用 HeyGen 生成视频,实现完全自动化的视频内容生产流水线。该集成降低了 AI 代理使用视频生成能力的门槛,为自动化营销、内容创作等场景提供了新可能。AI产品AI 代理Stripe ProjectsHeyGen推荐理由:做 AI 代理或自动化工作流的开发者终于可以省去手动配置 API 的麻烦——HeyGen 与 Stripe Projects 的集成让视频生成变成代理的自主能力,建议试试这个零人工介入的方案。原文稍后读已读值得跟进有用关注 AI 代理
04:19Paul Couvert@itsPaulAiHyperframes 现已正式成为 Claude 的官方连接器,用户无需任何技术操作,只需在 Claude 中提问即可生成视频。该工具以 MCP 方式运行,解决了传统 LLM 回答以密集文本呈现、用户不愿阅读的问题。通过与 Anthropic 合作,Hyperframes 将文档摘要转化为视频,让信息更易理解。演示视频已通过该工具生成,展示了其零门槛的使用体验。AI产品视频生成MCP/工具Claude10 个信源在谈事件专题推荐理由:做内容或文档的团队终于有了把 LLM 回答变成视频的捷径——不用写代码,直接连 Claude 就能用,建议试试。原文稍后读已读值得跟进有用关注 视频生成
03:48HeyGen@HeyGen_OfficialHeyGen 举办了一场面向开发者的线上研讨会,展示其 API 如何帮助团队自动化视频制作、个性化内容并规模化生产。活动涵盖了 API 功能、真实客户案例以及入门技巧。对于需要批量生成视频内容的企业和开发者来说,这是一个了解如何将 AI 视频生成集成到工作流中的机会。AI产品HeyGenAPI视频生成推荐理由:做视频内容自动化的团队可以直接用 HeyGen API 省掉大量人工剪辑时间,建议点开看看真实案例和入门技巧。原文稍后读已读值得跟进有用关注 HeyGen
03:40HeyGen@HeyGen_OfficialHyperframes 已正式成为 Claude AI 的官方 MCP 连接器,旨在解决 LLM 回答中文本密集、用户不读的问题。该工具与 Anthropic 合作开发,允许用户将 Claude 的文本回答自动转换为视频摘要,提升信息理解效率。Hyperframes 以 MCP 协议运行,用户可在工作流中直接使用,无需切换工具。官方演示视频展示了其将文档摘要转化为视频的能力,证明该方案可行。AI产品ClaudeMCP/工具视频生成10 个信源在谈事件专题推荐理由:Hyperframes 解决了 LLM 输出难以消化的问题,做知识管理或内容分发的团队可以直接用 Claude 生成视频摘要,省去手动制作时间。原文稍后读已读值得跟进有用关注 Claude
15:22IT之家(博客/媒体)精选谷歌将 Google AI Plus 订阅价格从每月 8 美元降至 5 美元,存储空间从 200GB 翻倍至 400GB。该订阅包含 Gemini 3 Pro、Nano Banana Pro 和 Deep Research 等功能,此前仅在更贵的 AI Pro 套餐中提供。新增权益包括 AI 邮件工具、Daily Brief 智能体以及视频生成模型 Gemini Omni,后者可从任何输入内容生成视频。现有订阅用户将在未来几天内获得新增存储空间并看到调整后的价格。AI产品GeminiGoogle AI PlusGoogle推荐理由:月费降3美元,存储翻倍原文稍后读已读值得跟进有用关注 Gemini
13:11官方账号arXiv cs.LG@Wayne King, Zeyue Xue, Yuxuan Bian, Jie Huang, Haoran Li, Yaowei Li, Yaofeng Su, Yuming Li, Haoyu Wang, Shiyi Zhang, Songchun Zhang, Yuwei Niu, Sihan Xu, Junhao Zhuang, Haoyang Huang, Nan DuanEcho-Memory 是一项针对动作条件世界模型中记忆机制的受控研究。这类模型根据首帧、文本提示和相机动作序列生成多段视频,但其主要失败点往往是记忆而非局部图像合成:当相机离开再返回时,场景或关键物体可能悄然改变。现有记忆设计难以比较,因为增益与骨干网络、训练、检索和评估差异纠缠不清。Echo-Memory 固定了动作到视频的接口,仅改变历史信息的存储和读取方式,在共享的视频扩散骨干、优化器、相机动作表示、采样器和评估流程下,比较了原始上下文、基于压缩的记忆、不同读取路径的空间摘要以及状态空间循环。研究通过三分支协议(回放质量、域内循环重访和开放域返回探测)评估记忆,发现回放保真度不足以作为记住世界的代理指标。主要结论包括:原始上下文是强大的容量基线,能显著提升开放域返回性能;紧凑性不能替代容量;块状状态空间循环是最强的开放域返回机制。论文世界模型记忆机制视频生成推荐理由:做视频生成或世界模型研究的团队,这篇论文帮你拆解了记忆机制中容量、压缩、读取和循环四个关键维度,看完能直接指导你的模型设计。原文稍后读已读值得跟进有用关注 世界模型
05:45HeyGen@HeyGen_Official精选HeyGen 在 X 上分享了一个完整的智能体反馈循环工作流,涵盖 lint、快照、渲染、ffmpeg 拉帧、发布和迭代。该流程强调只信任真实渲染或预览中的运动/视频/音频,并通过冻结已批准的剪辑、分支文件夹来重复迭代。这展示了 AI 视频生成中自动化质量控制和版本管理的实用方法,对从事视频生成和 AI 工作流的开发者有参考价值。AI产品智能体视频生成工作流推荐理由:做 AI 视频生成或自动化工作流的团队可以借鉴这个闭环设计——它解决了从生成到迭代的信任和版本控制痛点,直接照着思路优化自己的流程会很高效。原文稍后读已读值得跟进有用关注 智能体
07:43官方账号快手可灵 Kling@Kling_AIKling AI 在2026年6月6日庆祝成立两周年,宣布过去一年内完成了26次模型迭代,全球用户数突破1亿,企业客户接近5万家。该平台持续赋能各行业创作者,推动创意落地。Kling AI 强调其不断进化、扩展和创造的理念,感谢用户支持,并展望更多可能性。AI产品Kling AI视频生成模型迭代推荐理由:Kling AI 一年迭代26次,用户破亿,证明其视频生成能力持续领先。做内容创作或视频生成的团队,值得关注其最新进展。原文稍后读已读值得跟进有用关注 Kling AI
01:42HeyGen@HeyGen_OfficialHeyGen 在五月发布多项更新,包括 HyperFrames 升级、Avatar V 支持自然语言指令(英文),并开放 API 和实时使用。同时,HeyGen 新增与 Superhuman、Codex、Canva、Lovable 等工具的集成,并推出 Android 版应用。这些更新降低了 AI 视频生成的使用门槛,让用户更便捷地创建和定制数字人内容。AI产品HeyGen数字人API推荐理由:做视频内容或数字人应用的团队,现在可以用自然语言直接指挥 Avatar V,还能在常用工具里直接调用,建议试试。原文稍后读已读值得跟进有用关注 HeyGen
21:13IT之家(博客/媒体)快手旗下视频生成 AI 产品可灵 AI 在发布两周年之际宣布,全球用户已突破 1 亿,企业客户接近 5 万。过去一年,可灵完成了 26 次迭代,深入影视、广告、音乐 MV、游戏、电商、智能硬件等场景。同时,可灵 AI 正在进行分拆后的首轮融资,投前估值达 180 亿美元,并计划于 2027 年初提交港股上市申请。AI产品快手可灵 AI视频生成推荐理由:视频生成赛道竞争白热化,可灵 AI 用两年时间跑出 1 亿用户和 180 亿美元估值,做 AI 视频或内容创作的团队值得关注其迭代方向和商业化路径。原文稍后读已读值得跟进有用关注 快手
07:18rohanpaul_ai@rohanpaul_aiAI 工具分散在多个平台,用户需要在 ChatGPT、Claude、Gemini、Grok 等之间频繁切换,体验割裂。OverchatAI 发布了一款多模型 AI 应用,将聊天、图像生成和视频生成整合到统一界面中,旨在解决工具碎片化问题。该应用支持主流模型,让用户无需切换标签页即可完成多种任务。对于重度 AI 用户来说,这能显著提升工作效率,减少上下文切换成本。AI产品多模型聚合应用OverchatAI推荐理由:OverchatAI 解决了 AI 工具碎片化的痛点,经常在多模型间切换的创作者和开发者可以直接在一个界面里完成聊天、绘图和视频生成,省去来回跳转的麻烦。原文稍后读已读值得跟进有用关注 多模型
01:16HeyGen@HeyGen_OfficialHeyGen 发布了 Cinematic_avatar API,允许用户保留自己的肖像特征,同时增加电影级画质范围。该 API 支持通过编程代理(如 CLI + HyperFrames 技能)构建视频管线,用于创建类似官方发布的启动视频。开发者可以安装 HeyGen CLI 和 HyperFrames 技能来快速上手。这一更新为视频生成领域提供了更灵活、可编程的解决方案,尤其适合需要批量或定制化视频内容的团队。AI产品HeyGen视频生成API推荐理由:HeyGen 的 Cinematic_avatar API 让视频生成从“手动调参”进化到“代码驱动”,做视频管线或批量内容生产的团队可以直接用 CLI 集成,省去重复劳动。原文稍后读已读值得跟进有用关注 HeyGen
16:30官方账号Decoder@Matthias Bastian72°xAI 发布了 grok-imagine-video-1.5-preview,这是一个图像转视频模型,能将静态图片根据文本提示生成最高 720p 分辨率的电影感视频。用户还可以将多个片段拼接成更长的场景。该更新标志着 xAI 在视频生成领域的进一步扩展,为内容创作者提供了新的工具。AI产品xAIGrok Imagine图像转视频推荐理由:xAI 的 Grok Imagine 1.5 让静态图片秒变 720p 视频,做短视频或创意内容的团队可以直接拿来用,省去复杂后期。原文稍后读已读值得跟进有用关注 xAI
07:43Replicate@replicateReplicate 宣布与 xAI 合作,将其模型引入平台,并发布了针对最新视频模型 Grok Imagine Video 1.5 的终极提示指南。该指南旨在帮助用户更好地利用该模型生成高质量视频内容。此次合作使开发者能够更便捷地访问 xAI 的视频生成能力。对于从事 AI 视频创作的用户来说,这是一份实用的资源。AI产品视频生成Grok Imagine Video 1.5提示工程推荐理由:做 AI 视频生成的开发者可以直接用这份指南提升 Grok Imagine Video 1.5 的出片质量,值得收藏。原文稍后读已读值得跟进有用关注 视频生成
01:57Paul Couvert@itsPaulAiGoogle 发布了 frame.md,这是 design.md 的视频版本,旨在让 AI 代理能够根据品牌规范生成视频。design.md 此前已用于保持屏幕上的品牌一致性,但应用到视频时,代理会将其转回网页和幻灯片。frame.md 解决了这一问题,它教会代理如何制作品牌视频,用户只需将 design.md 转换为 frame.md 即可。这一创新有望简化视频内容创作流程,尤其适合需要大量品牌视频的团队。AI产品Googleframe.md视频生成推荐理由:做品牌视频的团队终于有了 AI 可读的规范——frame.md 让代理直接生成符合品牌调性的视频,省去反复调整的麻烦,建议内容创作者和营销团队点开看看。原文稍后读已读值得跟进有用关注 Google
22:39IT之家(博客/媒体)京东发布并开源了 JoyAI-Echo 长音视频生成框架,解决了长视频生成中角色身份、声音不一致和生成速度慢的行业难题。该框架内置记忆库,可在多镜头中保持角色外观和音色一致,实测 5 分钟视频无崩坏。通过 DMD 技术实现约 7.5 倍推理加速,并支持对话式编辑,用户可直接用自然语言修改镜头,无需重跑整条视频。京东官方称该框架已进入全球第一梯队,项目已开源在 GitHub。AI产品视频生成开源/仓库京东推荐理由:长视频生成领域终于有了能保持角色一致的开源方案,做视频生成、影视制作的团队可以直接拿来用,省去大量后期修复时间。原文稍后读已读值得跟进有用关注 视频生成
16:11IT之家(博客/媒体)字节跳动火山引擎的 MaaS 业务营收目标在 2026 年已上调至 150 亿元,是 2025 年实际营收的 10 倍。其中,视频生成模型 Seedance 2.0 单月营收已超过 10 亿元,且仍在增长,而该模型 API 尚未在海外全量上线。Seedance 2.0 在多项指标上超越海外顶尖视频模型,字节还计划发布质量提升 20% 的 2.1 版本。这一数据表明,字节在 AI 视频生成领域的商业化能力正在快速释放。AI产品字节跳动Seedance 2.0视频生成1 个信源在谈事件专题推荐理由:视频生成模型商业化迎来里程碑——Seedance 2.0 单月营收超 10 亿,说明 AI 视频 API 已从概念走向真金白银。做视频生成、内容创作或云服务的团队值得关注,字节的定价和增长策略可能成为行业风向标。原文稍后读已读值得跟进有用关注 字节跳动
17:46rohanpaul_ai@rohanpaul_ai76°LongCat 发布了 WBench,一个用于测试视频世界模型的基准,将测试重点从视觉质量转向控制、多轮记忆、指令遵循和物理合理性。WBench 包含 289 个案例、1058 次交互、20 个模型、5 个维度和 22 个自动指标,覆盖导航、主体动作、事件编辑、视角切换等。测试发现,没有模型在所有维度上占优,视觉质量与控制能力几乎无关。WBench 的设计将世界设置与用户动作分离,帮助研究者定位失败原因。这标志着视频世界模型评估从“视频好不好看”转向“模型能否维持可控世界”。论文视频生成世界模型基准测试推荐理由:做视频生成或世界模型的研究者终于有了正经的评估工具——WBench 把视觉质量和控制能力分开测,看完你会明白为什么很多漂亮视频其实不能当世界模型用。原文稍后读已读值得跟进有用关注 视频生成
12:10Latent.Space@latentspacepod精选Ethan He 在 Latent Space 播客中分享了对视频生成、世界模型、LLM、智能体和持续学习的看法。他认为视频模型的大部分智能来自语言而非视频数据,idea-to-code 的速度已经很快,瓶颈在于计算资源。他强调迭代速度在模型开发中几乎压倒一切,下一个飞跃将是视频智能体而非更好的视频模型。他还预测扩散模型将成为 AGI 的前端,LLM 作为后端,生成式 UI 将取代 HTML/CSS,物理具身可能成为强大 AI 的工具。AI模型视频生成世界模型智能体推荐理由:Ethan He 对 AI 前沿的预判直击要害,做视频生成、智能体或世界模型的开发者看完会有启发——尤其是关于迭代速度和智能体方向的洞察,值得点开细品。原文稍后读已读值得跟进有用关注 视频生成
11:11官方账号arXiv cs.AI@Jingyun Liang, Min Wei, Shikai Li, Yizeng Han, Hangjie Yuan, Lei Sun, Weihua Chen, Fan Wang该研究提出一种无需渲染的框架,通过将3D人体网格压缩为token,直接输入DiT架构的视频扩散模型,实现精确的人体运动控制。相比依赖2D渲染引导的现有方法,该方法避免了视角依赖伪影和轨迹-姿态不匹配问题。实验表明,该框架在人体运动控制基准上表现优异,证明视频扩散模型通过网格token化能更好地理解3D结构。这项工作为3D感知视频生成提供了新思路。论文视频生成3D人体运动控制网格token化推荐理由:做视频生成或3D人体动画的团队终于有了不依赖渲染的精准控制方案——直接压缩3D网格token,避免2D引导的伪影问题,建议做运动控制或虚拟人应用的开发者点开看看。原文稍后读已读值得跟进有用关注 视频生成
09:59LovartAI@lovart_aiLovart平台发布教程,展示如何结合OpenAI的GPT Image 2图像生成模型与Seedance 2.0视频生成工具,制作动漫风格的美食短视频。教程从生成静态美食图像开始,再通过Seedance 2.0将其转化为动态短片,实现从图片到视频的完整工作流。该方法降低了动漫风格视频创作的门槛,适合内容创作者和短视频爱好者快速产出高质量素材。Lovart作为集成平台,简化了多工具协作的流程,让用户无需编程即可完成创作。AI产品GPT Image 2Seedance 2.0Lovart10 个信源在谈事件专题推荐理由:想做动漫风美食短视频但不会画图?这个教程用GPT Image 2出图+Seedance 2.0动起来,两步搞定,内容创作者可以直接抄作业。原文稍后读已读值得跟进有用关注 GPT Image 2
09:53HeyGen@HeyGen_OfficialHeyGen 展示了一个 AI Agent 工作流,能够每周自动生成市场更新视频。该工作流通过 HeyGen CLI/MCP 生成脚本和 A-roll,利用 HyperFrames 模板更新最新数据并渲染最终视频。顾问只需专注于专业知识和分析,而 AI Agent 负责全部生产环节。结果是从同一可重复工作流中持续产出客户就绪的视频更新。该模板可在几分钟内复现,适合需要定期制作视频内容的团队。AI产品AI Agent视频生成工作流自动化推荐理由:这个工作流解决了视频内容生产的重复劳动问题,做市场更新或客户报告的团队可以直接复制,每周省下几小时制作时间。原文稍后读已读值得跟进有用关注 AI Agent
17:51官方账号NVIDIA AI@NVIDIAAINVIDIA 展示了其 Cosmos 3 模型的图像转视频生成能力。用户输入一张从仪表盘视角拍摄的 F1 赛车图片,并提示“高速赛车在多个弯道中行驶”,模型生成了连贯且逼真的赛车视频。该演示强调了 Cosmos 3 在视频生成领域的进展,尤其擅长处理动态场景和复杂运动。这一技术有望在影视制作、自动驾驶仿真和游戏开发中发挥重要作用。AI产品NVIDIACosmos 3图像转视频10 个信源在谈事件专题推荐理由:NVIDIA 的 Cosmos 3 让图像转视频生成达到了新高度,做影视特效或自动驾驶仿真的团队值得关注,直接看效果比读论文更直观。原文稍后读已读值得跟进有用关注 NVIDIA
10:31官方账号arXiv cs.AI@Ruotong Liao, Guowen Huang, Qing Cheng, Guangyao Zhai, Lei Zhang, Xun Xiao, Thomas Seidl, Daniel Cremers, Volker TrespTunerDiT 提出了一种无需额外训练的多事件视频生成方法,通过分析扩散变换器(DiT)的去噪轨迹,发现文本条件从全局布局到细节的转变点。该方法包含两个关键组件:事件分区掩码(强制事件边界并允许过渡带)和跨事件提示融合(注入相邻事件语义进行后期细化)。在自建的多事件基准测试 Meve 上,TunerDiT 在 8 个指标上达到最优,并能在视频一致性和事件分离之间进行可调权衡。随着事件数量增加,文本对齐性能提升,显示出扩展潜力。论文扩散模型视频生成多事件生成推荐理由:做视频生成的研究者或开发者,如果被长视频多事件生成的一致性困扰,TunerDiT 的零训练方案直接可用,值得关注其事件边界控制与提示融合的设计。原文稍后读已读值得跟进有用关注 扩散模型
10:29官方账号arXiv cs.AI@Jiazheng Xing, Hangjie Yuan, Lingling Cai, Xinyu Liu, Yujie Wei, Fei Du, Hai Ci, Tao Feng, Jiasheng Tang, Weihua Chen, Fan Wang, Yong LiuLumos-Nexus 是一种训练高效的统一视频生成框架,解决了将高保真生成器集成到统一训练循环中计算成本过高的问题。它采用两阶段设计:训练时仅用轻量级生成器与理解模块对齐,学习推理驱动的语义控制;推理时通过统一渐进频率桥接(UPFB)在共享潜在空间中将生成任务逐步交给高容量预训练生成器,实现从粗到细的优化,生成高保真视频而不牺牲推理质量。为填补推理驱动视频生成基准的空白,团队引入了 VR-Bench 评估模型将推断意图转化为连贯视频的能力。实验表明,Lumos-Nexus 在 VBench 上显著提升了视觉真实感和时间连贯性,在 VR-Bench 上展示了强大的推理生成性能。代码和模型已开源。论文视频生成统一模型推理驱动推荐理由:视频生成领域终于有了兼顾推理能力和视觉保真度的方案,做视频理解与生成统一模型的团队可以直接参考其两阶段设计,省去大量训练成本。原文稍后读已读值得跟进有用关注 视频生成
08:33berryxia@berryxia一条推文指出,许多每月付费的AI工具、Bloomberg终端、交易系统等,本质是资本维持稳定收入的机制。GitHub上已有10个开源项目可替代这些付费产品,涵盖对冲基金、交易系统、金融终端、AI聊天、视频工作室、虚拟主播、广告生成、邮件管理、浏览器和视频制作。这些项目免费、功能强大、支持自托管,让用户完全掌握数据和控制权。例如,Fincept Terminal可替代Bloomberg,LibreChat可自托管多模型AI聊天,Open Higgsfield AI集成多种图像和视频生成模型。AI产品开源/仓库金融工具AI聊天推荐理由:想省掉每月订阅费、又不想被厂商锁定的开发者和金融从业者,这10个开源项目直接给你机构级工具,建议收藏试玩。原文稍后读已读值得跟进有用关注 开源/仓库
23:09AI Will@FinanceYF572°xAI 发布 Grok-Imagine-Video-1.5-Preview(720p),在 Image-to-Video Arena 排行榜上夺得第一。相比前代 Grok-Imagine-Video,新模型评分大幅提升 52 分,超越了 Seedance-2.0 和 HappyHorse 等竞品。这标志着 xAI 在视频生成领域的快速进步,也展示了同一家公司内部迭代的巨大潜力。AI产品视频生成Grok-Imagine-VideoxAI推荐理由:xAI 用一代产品就追平甚至超越头部视频模型,做视频生成的团队值得关注这个新晋选手,看看它能否持续迭代。原文稍后读已读值得跟进有用关注 视频生成
16:38AI Will@FinanceYF572°Arena.ai 宣布 Grok-Imagine-Video-1.5-Preview (720p) 在 Image-to-Video Arena 中排名第一,相比前代 Grok-Imagine-Video (720p) 提升了 52 分,超越了 Seedance-2.0 和 HappyHorse 等顶级模型。这是 xAI 在视频生成领域的重要突破,展示了 Grok 系列模型的持续进化能力。该模型在图像到视频的转换质量上取得了显著进步,为 AI 视频生成树立了新标杆。AI模型GrokxAI视频生成推荐理由:xAI 的视频模型首次登顶 Arena,做 AI 视频生成或内容创作的团队值得关注这个新选择,看看它能否在效果和速度上带来惊喜。原文稍后读已读值得跟进有用关注 Grok
09:03lmarena.ai@lmarena_ai72°xAI 的 Grok-Imagine-Video-1.5-Preview 在图像转视频竞技场中排名第一,相比前代 Grok-Imagine-Video 提升了 52 分,超越了 Seedance-2.0 和 HappyHorse 等顶级模型。该模型支持 720p 分辨率输出,标志着 xAI 在视频生成领域的重大突破。这一进展表明 AI 视频生成竞争正加速,xAI 已跻身第一梯队。AI模型xAIGrok视频生成推荐理由:做视频生成或关注多模态模型的开发者值得关注——Grok 视频模型首次超越主流竞品,意味着又多了一个高性价比选择,建议去竞技场实测对比效果。原文稍后读已读值得跟进有用关注 xAI
11:04Google Gemini App@GeminiAppGoogle 的 Gemini Omni 模型展示了从屏幕视频输入到现实物理模拟的端到端能力。用户只需一个提示词,模型就能理解视频内容,应用物理规则并生成无缝的新运动。该功能将视频理解与物理仿真结合,为创意内容生成和交互式应用开辟了新可能。目前已在 X 平台开放试用,用户可分享自己的实验案例。AI产品Gemini Omni视频生成物理模拟推荐理由:视频创作者和 AI 应用开发者可以直接用 Gemini Omni 把屏幕内容变成物理模拟视频,省去传统 3D 建模和动画流程,值得一试。原文稍后读已读值得跟进有用关注 Gemini Omni
10:12lmarena.ai@lmarena_ai精选78°阿里Wan团队开发的Wan2.7-t2v-2026-04-25模型在Text-to-Video Arena中排名第三。该模型不仅是一个视频生成器,更是一套导演级工具套件,支持通过文本、图像、音频和视频进行多模态控制,可定制多达5个角色参考输入和语音配置,并具备视频编辑、克隆、重风格化、续写等全栈创作能力。在视觉保真度、运动稳定性和提示遵循方面有持续改进。这一成绩标志着中国团队在AI视频生成领域的重要突破。AI产品视频生成多模态控制阿里Wan推荐理由:阿里Wan2.7把视频生成从单一工具升级为导演套件,做视频创作、影视后期或AI内容生产的团队可以直接拿来用,多模态控制和角色定制功能尤其实用。原文稍后读已读值得跟进有用关注 视频生成
02:18官方账号Decoder@Matthias BastianGoogle 修复了 Gemini 应用中的一个 Bug,该 Bug 导致仅上传一两个 Omni 视频就消耗完整个使用配额。修复后,Ultra 会员的视频生成次数翻倍,且失败的请求不再计入配额。Google 还计划增加其他使用情况的透明度。这一更新解决了用户因配额快速耗尽而无法正常使用的问题。AI产品GeminiBug修复配额优化推荐理由:Gemini 重度用户终于不用再为几个视频就耗尽配额而烦恼了,Ultra 会员还能获得双倍生成次数,建议立即更新应用体验。原文稍后读已读值得跟进有用关注 Gemini
00:08AK@_akhaliq精选minWM是一个全栈开源框架,专门用于构建实时交互式视频世界模型。该框架提供了从模型设计到部署的完整工具链。开发者可以利用minWM创建能够实时响应输入的环境模拟。AI模型minWM世界模型视频生成推荐理由:开源实时视频世界模型框架原文稍后读已读值得跟进有用关注 minWM
11:42Ate-a-Pi@svpino72°一位技术博主分享了一种新颖的视频生成模型训练方法,团队没有使用大型互联GPU集群,而是用多个小型、独立的GPU集群分别训练不同的“专家”模型。这些专家模型在训练时无需通信,训练完成后通过一个智能路由器在推理时动态组合,协同工作。这种方法降低了硬件门槛,且效果出色。论文链接已附,值得技术爱好者深入阅读。技巧视频生成分布式训练专家模型推荐理由:这种分布式训练思路颠覆了传统大模型训练范式,做模型训练或视频生成的开发者可以看看论文,或许能启发新的低成本训练方案。原文稍后读已读值得跟进有用关注 视频生成
11:07官方账号arXiv cs.AI@Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang精选浙江大学团队提出 Archon,一个完全预训练的统一多模态模型,用于生成包含文本、音频、动作和视觉内容的完整数字人。该模型通过模态专用分词器和原生自回归架构,统一了七种模态,并在 72 个任务上预训练以建模联合分布。为解决高保真对话视频中的 token 爆炸问题,Archon 引入了一种内存高效的语义视频重参数化方法,实现 4 倍 token 压缩同时保留精细动态,并配合语义驱动的视频扩散解码器。此外,提出的“模态思考”机制将模糊的跨模态任务分解为逐步推理,提升了生成保真度和可控性。实验表明,Archon 在多种数字人生成任务上达到或超越现有水平。论文数字人多模态模型视频生成推荐理由:做数字人、虚拟角色或交互式 AI 的团队终于有了一个统一框架——Archon 把文本、音频、动作、视频全打通了,不用再拼凑多个模型,做沉浸式体验的开发者可以直接参考其架构。原文稍后读已读值得跟进有用关注 数字人