00:14rohanpaul_ai@rohanpaul_ai76°中国 AI 实验室商汤开源了 SenseNova U1,这是一个统一的多模态模型,能在单一模型中理解、推理并生成图像和文本。其架构去除了传统的视觉编码器和变分自编码器,在共享表示空间中处理图像和语言,减少了模块间切换和信息损失,提升了生成一致性。该模型在生成信息图、指南、海报、漫画等密集视觉内容时表现出色,据客户基准测试,生成信息图的速度约为 Qwen-Image-2.0 / Seedream-4.5 的两倍,且质量相当。AI模型商汤SenseNova U1多模态模型推荐理由:商汤的架构创新解决了多模态模型常见的模块间信息丢失问题,做视觉内容生成或信息图设计的团队可以直接用这个开源模型,生成效率翻倍值得一试。原文稍后读已读值得跟进有用关注 商汤
12:10OpenRouter@OpenRouterAIxAI 的 Grok 创意套件新增三个模型,已在 OpenRouter 平台上线。Grok Imagine Image Quality 支持照片级图像生成与编辑;Grok Imagine Video 可从文本、图像或参考素材生成短视频;Grok Voice TTS 1.0 提供 5 种语音、覆盖 20 多种语言。这些模型扩展了 Grok 在图像、视频和语音合成方面的能力,为开发者和创作者提供了更多选择。AI产品Grok图像生成视频生成推荐理由:xAI 一口气推出图像、视频、语音三款模型,做内容创作或 AI 应用的开发者可以直接在 OpenRouter 上调用,省去部署成本,建议试试。原文稍后读已读值得跟进有用关注 Grok
02:19rohanpaul_ai@rohanpaul_ai76°HiDream 开源了 8B 参数的图像模型 HiDream-O1-Image,声称性能与 27B 的 Qwen-Image 等更大模型持平。该模型采用像素级统一 Transformer,无需 VAE 和文本编码器,直接在原始像素上端到端处理。它支持文生图、长文本渲染、指令编辑、主体个性化及故事板生成等多种任务。内置推理驱动的提示代理,能先理解用户意图再生成,在长文本渲染基准上接近 200B+ 模型的表现。这暗示传统扩散管线可能不再是唯一的主流路径。AI模型HiDreamHiDream-O1-Image图像生成推荐理由:HiDream 用 8B 参数挑战了传统扩散架构的统治地位,做图像生成或研究的开发者值得关注——它可能改变你对模型效率与架构的认知。原文稍后读已读值得跟进有用关注 HiDream
20:06Recraft@recraftaiRecraft AI 发布 V4.1 模型,并与 GPT Image 2 High 进行直接对比。同一提示词下,两个模型在氛围、构图、色彩处理和细节表现上差异显著。Recraft V4.1 在艺术风格和细节丰富度上表现突出,而 GPT Image 2 High 更注重写实和一致性。该对比展示了不同 AI 图像生成模型在创意输出上的独特取向,对设计师和内容创作者选择工具具有参考价值。更多对比结果可在 Recraft 博客中查看。AI产品Recraft V4.1GPT Image 2 High图像生成推荐理由:做视觉设计和内容创作的团队,选模型前先看对比——同一提示词下风格差异巨大,直接帮你判断哪个更适合你的项目。原文稍后读已读值得跟进有用关注 Recraft V4.1
12:06Paul Couvert@itsPaulAiHiDream-O1-Image 作为 Nano Banana 的开源替代品正式发布,采用 MIT 许可证,支持文本到图像、图像编辑、故事板生成等功能。该模型在文本渲染方面表现突出,提供 Hugging Face 模型和在线演示。这是开源社区在图像生成领域的重要进展,为开发者和创作者提供了更自由的选择。AI模型开源/仓库图像生成文本渲染推荐理由:图像生成领域终于有了 MIT 许可证的开源强模型,做创意工具或需要文本渲染的开发者可以直接上手试试。原文稍后读已读值得跟进有用关注 开源/仓库
12:05Paul Couvert@itsPaulAiHiDream-O1-Image 是一款开源图像生成模型,在多数使用场景下表现出色,足以替代闭源替代品。它在照片级真实感、长文本渲染、图像编辑(添加/替换/移除元素)以及提示词遵循度方面均有优异表现。其 8B 变体在所有开源基线中领先,性能与 Nano Banana 相当,而 200B 版本则达到当前最优水平。该模型为开发者提供了高性价比的闭源替代选择。AI模型图像生成开源模型HiDream-O1-Image推荐理由:做图像生成和编辑的开发者终于有了一个能打的开源模型——HiDream-O1-Image 在多数场景下可替代闭源方案,8B 版本性能媲美 Nano Banana,建议直接上手试试。原文稍后读已读值得跟进有用关注 图像生成
12:05Paul Couvert@itsPaulAi72°HiDream AI 与 Vivago AI 联合开源了 HiDream 图像生成模型,该模型在性能上可与闭源商业模型竞争。模型权重、技术报告和在线试用空间均已发布在 Hugging Face 和 GitHub 上。开源社区对此反应热烈,认为这是开源图像模型的重要里程碑。用户可以直接下载模型或在线体验,无需等待。AI模型HiDream图像生成开源/仓库推荐理由:开源图像模型终于有了能打闭源方案的选手,做图像生成或 AI 绘画的开发者可以直接下载模型或在线试用,值得立刻体验。原文稍后读已读值得跟进有用关注 HiDream
20:04OpenRouter@OpenRouterAIRecraft AI 在 OpenRouter 上发布了 V4.1 系列六款新图像生成模型,包括主打高美学的 V4.1 和 V4.1 Pro、专为 SVG 插画设计的 V4.1 Vector 和 V4.1 Pro Vector,以及面向产品图像的 V4.1 Utility 和 V4.1 Utility Pro。新模型在照片真实感、渐变平滑度和短提示命中率上均有显著提升,用户无需过多提示工程即可获得高质量结果。这一更新为设计师和开发者提供了更多专业选择,可直接通过 OpenRouter API 调用。AI产品图像生成RecraftOpenRouter推荐理由:Recraft V4.1 系列覆盖了从高美学到矢量插画、产品图等多个细分场景,做设计或 AI 应用的团队可以直接在 OpenRouter 上试用,短提示效果提升明显,值得一试。原文稍后读已读值得跟进有用关注 图像生成
19:31Recraft@recraftaiRecraft AI 在 X 上发布了其 V4.1 模型与 Midjourney V8.1 的对比评测。使用完全相同的提示词,两个模型在构图、情绪、纹理和细节上展现出截然不同的创意选择。该对比展示了当前顶级 AI 图像生成模型在风格和美学上的差异,帮助用户理解不同模型的擅长领域。更多与其他模型的对比结果可在 Recraft 的博客中查看。AI产品Recraft V4.1Midjourney V8.1图像生成推荐理由:做 AI 视觉设计或内容创作的团队,可以通过这个对比快速判断哪个模型更符合自己的审美偏好,值得点开看看差异。原文稍后读已读值得跟进有用关注 Recraft V4.1
19:03Guillermo Rauch@rauchgVercel CEO 展示新工具 ai-cli,允许用户在终端中直接渲染图片,例如通过 `npx ai-cli image 'a vercel ai sdk diagram'` 命令。该工具安装简单(`npm i -g ai-cli`),并可通过 Vercel AI Gateway 即时访问所有图像、视频和文本模型。这一功能将终端变为多模态交互界面,简化了开发者的工作流。AI产品VercelAI CLI终端工具推荐理由:终端直接渲染图片解决了开发者频繁切换工具查看 AI 生成内容的痛点,做 AI 应用或 CLI 工具的团队值得一试,安装即用。原文稍后读已读值得跟进有用关注 Vercel
14:51官方账号Midjourney@midjourney73°Midjourney 宣布开始测试其 V8 模型的早期版本,面向社区开放。新模型在提示跟随能力上大幅提升,生成速度提高了 5 倍,并支持原生 2K 分辨率模式。此外,文本渲染得到改进,个性化、风格参考和情绪板功能也达到最佳性能。这标志着 Midjourney 在图像生成质量和效率上的重要升级。AI产品MidjourneyV8模型图像生成推荐理由:Midjourney V8 的 5 倍速度和原生 2K 模式对设计师和创意工作者是直接利好,提示跟随的改进能减少反复调参的烦恼,建议有 AI 绘图需求的用户第一时间体验。原文稍后读已读值得跟进有用关注 Midjourney
13:36官方账号xAI@xaixAI 宣布其 API 上线了图像生成质量模式(Image Generation Quality Mode),该模型已在 Grok 上驱动超过 3 亿张图像的生成。新模式提升了图像的真实感、文本渲染能力以及创意控制,特别面向商业专业人士。这意味着开发者现在可以通过 API 调用更高质量的图像生成能力,用于营销、设计等场景。AI产品xAI图像生成API推荐理由:xAI 把 Grok 上验证过的图像生成能力开放给 API 用户,做商业设计或内容生成的团队可以直接集成,提升出图质量和可控性。原文稍后读已读值得跟进有用关注 xAI
21:55AK@_akhaliq阿里发布Qwen-Image-2.0技术报告,介绍了新一代多模态图像生成模型。该模型在文本到图像生成、图像编辑和风格迁移等任务上表现出色,支持高分辨率输出和细粒度控制。报告详细阐述了模型架构、训练方法和性能评估,表明其在多项基准测试中达到领先水平。这对于推动多模态AI发展和实际应用具有重要意义。论文多模态图像生成Qwen推荐理由:Qwen-Image-2.0的发布展示了阿里在多模态生成领域的持续进步,为图像生成任务提供了新的基准和工具,值得相关从业者关注。原文稍后读已读值得跟进有用关注 多模态
17:19官方一手歸藏(guizang.ai)@op7418OpenAI 推出了GPT-image-2.0图像生成模型,同时Seedance 2.0也发布了更新。GPT-image-2.0在图像生成质量、多样性和控制能力上有了显著提升,支持更精细的文本到图像生成。Seedance 2.0则侧重于视频生成领域的改进。这两个模型的发布进一步推动了AI多模态生成技术的发展,为创意行业和内容生产提供了更强大的工具。AI模型图像生成视频生成GPT-image-2.03 个信源在谈事件专题推荐理由:对于AI生成领域从业者,GPT-image-2.0和Seedance 2.0的发布代表了图像和视频生成技术的最新进展,值得关注其在实际应用中的表现和潜在影响。原文稍后读已读值得跟进有用关注 图像生成
00:01岚叔@LufzzLiz一位用户利用GPT Image 2生成角色参考图,展示同一角色的多角度姿态,包括正面特写、站姿、背对、蹲姿和跪姿。帖子强调在提示词末尾添加了十个字的关键词,并邀请读者猜测这些词。这体现了GPT Image 2在图像生成中的控制能力和创意边界探索。AI产品图像生成GPT Image 2提示词工程推荐理由:此帖展示了如何通过提示词技巧扩展AI图像生成边界,对理解GPT Image 2的潜力有参考价值。原文稍后读已读值得跟进有用关注 图像生成
22:18岚叔@lufzzliz用户反映OpenAI的GPT image 2在生成某些图像时存在较多限制,导致特定内容难以生成。但发现通过Hermes或flowith等第三方工具仍可生成受限图像。用户计划进一步探索GPT image 2的生成尺度。这一现象表明不同工具对内容审核策略存在差异,可能影响用户选择。AI产品图像生成GPT image 2内容审核2 个信源在谈事件专题推荐理由:展示了当前AI图像生成工具在内容审核上的不一致性,对需灵活生成内容的用户有参考价值。原文稍后读已读值得跟进有用关注 图像生成
22:17岚叔@lufzzliz用户使用仅13字提示词“电商详情页截图:介绍情趣内衣”,成功生成逼真图片,展示GPT Image 2的图像生成能力。该工具可快速产出符合电商场景的图片,评论区补充了日韩和欧美风格变体。此实验表明模型对简短模糊指令的响应质量高,可能降低电商内容创作门槛。AI产品GPT Image 2图像生成电商推荐理由:该案例直观凸显GPT Image 2在电商视觉生成领域的潜力,对营销人员与内容创作者有实操参考价值,提示行业关注多风格适配能力。原文稍后读已读值得跟进有用关注 GPT Image 2
22:17岚叔@lufzzliz用户通过推特分享了对GPT Image 2的第三次测试,重点展示其生成高级时尚摄影图像的能力。输入提示词为“优雅的韩国女模特穿着淡粉色缎面吊带裙,在落地窗前摆出优雅的过肩姿势,黄金时段背光营造柔和光芒,Vogue韩国风格时尚摄影”。该测试对比了模型生成的左右两张图片,以呈现不同输出结果。这体现了GPT Image 2在生成专业级、高美学要求图像方面的潜力。AI产品图像生成GPT Image 2时尚摄影推荐理由:该测试直观展示了GPT Image 2在时尚摄影领域的生成质量,对创意从业者和AI图像生成应用开发者具有参考价值,有助于评估模型在实际场景中的表现。原文稍后读已读值得跟进有用关注 图像生成
22:17官方账号百度 AI Baidu@Baidu_Inc百度用其AI图像生成模型ERNIE-Image,将母亲节经典唠叨翻译成“真正含义”,并通过趣味图片展示。例如,“有空打电话”可能意味着“想你了”。该活动利用AI技术进行创意表达,旨在传递情感而非仅仅文字表面意思。百度借此展示其多模态AI能力,同时庆祝母亲节。AI产品图像生成ERNIE-Image百度推荐理由:此为百度营销活动,展示ERNIE-Image的创意应用。对行业而言,表明AI图像生成正从技术展示转向情感化、场景化的用户体验设计。原文稍后读已读值得跟进有用关注 图像生成
22:16AK@_akhaliqMARBLE(Multi-Aspect Reward Balance for Diffusion RL)提出了一种新方法,旨在解决扩散模型强化学习中多个奖励信号之间的平衡问题。通过动态调整不同奖励方面的权重,该方法能在图像生成等任务中同时优化多个目标,如质量和多样性。论文展示了在多个基准测试上的改进效果,表明该方法能有效提升生成质量并减少模式崩溃。这对扩散模型的微调和可控生成具有实际意义。论文扩散模型强化学习多目标优化推荐理由:该方法直接回应了扩散模型RL中多目标优化的核心挑战,为提升生成质量和多样性提供了一种实用平衡策略。原文稍后读已读值得跟进有用关注 扩散模型
22:16AK@_akhaliq该研究提出了一种连续时间分布匹配方法,用于改进扩散模型的蒸馏效率。传统扩散模型需要多步采样,而该方法通过优化连续时间分布匹配损失,实现了仅需几步即可生成高质量样本。实验表明,该方法在图像生成任务上显著加速推理,同时保持生成质量,对实时应用场景具有重要意义。论文提供了理论分析和实验结果。论文扩散模型蒸馏图像生成推荐理由:该方法为扩散模型加速推理提供了新思路,可能降低生成式AI的部署成本,值得关注后续应用拓展。原文稍后读已读值得跟进有用关注 扩散模型
11:43官方账号arXiv cs.LG(学术论文)STARFlow2提出了一种基于自回归归一化流(TarFlow)的统一多模态生成框架,用于处理交错的文本-图像序列。它通过在Pretzel架构中垂直交错预训练VLM流和TarFlow流,并采用深度-浅层流设计和统一的FAE潜空间,实现了文本和视觉输出的缓存友好型生成。实验表明,STARFlow2在图像生成和多模态理解基准上表现强劲,证明了自回归流可以替代扩散模型作为统一多模态建模的基础。这项工作解决了因果文本生成和迭代视觉去噪之间的结构不匹配问题,为更自然的统一生成提供了新范式。论文多模态自回归流图像生成推荐理由:STARFlow2展示了自回归归一化流在多模态统一生成中的潜力,为替代基于扩散的图像生成方法提供了新思路,对多模态模型的设计和效率优化有参考价值。原文稍后读已读值得跟进有用关注 多模态
11:43官方账号arXiv cs.AI(学术论文)本文提出SCOPE框架,将复杂的图像生成要求形式化为语义承诺,通过结构化规范持续追踪这些承诺的状态,并条件式调用检索、推理和修复技能以解决未满足的承诺。研究指出当前模型生成中存在的“概念鸿沟”问题,即承诺在生成生命周期中可能被局部解决但无法作为统一操作单元被追踪。为评估承诺级意图实现,作者引入人类标注基准Gen-Arena和实体级通过率指标EGIP,SCOPE在该基准上达到0.60 EGIP,显著优于所有基线,并在WISE-V(0.907)和MindBench(0.61)上表现优异,证明持续承诺追踪对复杂图像生成有效。论文图像生成语义承诺结构化解耦推荐理由:该工作首次系统定义了图像生成中的语义承诺概念及其生命周期断裂问题,并提供了可操作的框架和评估基准。对追求高可控性图像生成的从业者来说,SCOPE展示了结构化规范追踪如何提升复杂交互场景下的生成质量。原文稍后读已读值得跟进有用关注 图像生成
11:42官方账号arXiv cs.AI(学术论文)精选80°Flow-OPD提出首个将在线策略蒸馏(OPD)集成到Flow Matching模型中的统一后训练框架,有效解决了多任务对齐中的奖励稀疏和梯度干扰问题。该框架采用两阶段对齐策略:先通过单奖励GRPO微调培养领域专用教师模型,再通过Flow冷启动、在线策略采样、任务路由标注和密集轨迹监督将异构专业知识整合到单个学生模型中。研究者还引入了流形锚点正则化(MAR),利用任务无关教师提供全数据监督,避免RL驱动对齐中常见的美学退化。在Stable Diffusion 3.5 Medium上的实验显示,GenEval分数从63提升至92,OCR准确率从59%提升至94%,整体提升约10个百分点,且保持图像保真度和人类偏好对齐,并出现“超越教师”效应。该工作为构建通用文本到图像模型的可扩展对齐范式奠定了基础。论文图像生成Flow Matching在线策略蒸馏推荐理由:该工作针对现有多任务对齐中指标相互制约和奖励欺骗的痛点,将LLM领域成熟的OPD方法成功迁移至图像生成领域,并通过冷启动、任务路由和正则化创新提升了效果。实验在关键指标上大幅领先现有方法,对业界构建高性能通用文生图模型具有直接参考价值。原文稍后读已读值得跟进有用关注 图像生成