05:12@elonmusk@elonmuskGrok将能在智能体模式下调用Imagine工具进行图像和视频生成。Imagine是独立的图像/视频生成工具,正持续改进。这一能力对游戏开发者尤其有吸引力,可以快速生成游戏素材。AI产品GrokImaginexAI推荐理由:Grok可以直接调Imagine生成图片和视频了,游戏开发者做素材会更方便。原文稍后读已读值得跟进有用关注 Grok
23:36官方一手歸藏(guizang.ai)@op7418Seedream 5.0 的图像模型上线,作者测试了几张图,包括生成游戏截图、科普图、UI 设计稿和剧情介绍图。模型支持 2K 分辨率,比 GPT-4o 更高,但文字细节方面,多文字时仍存在模糊问题。整体进步明显,比之前的图像模型提升较大。AI模型Seedream 5.0GPT-4o图像生成推荐理由:Seedream 5.0 图像模型刚上线,能生成 2K 分辨率图片,比 GPT-4o 清晰,但文字多时会糊。想试试新模型可以看看这些例子。原文稍后读已读值得跟进有用关注 Seedream 5.0
23:25The Rundown AI@therundownai字节跳动发布了Seedream 5.0 Pro,这是一个声称超越简单图像生成、能“理解设计”的AI模型。该模型在文本渲染、结构和对齐方面有改进,能生成高质量信息图和原型。它支持精确编辑,包括图层分离和多个图像组合。在写实度、光照和皮肤纹理上也有升级,并支持多语言输入和生成。AI模型Seedream 5.0 ProByteDance图像生成2 个信源在谈事件专题推荐理由:字节跳动的Seedream 5.0 Pro不仅能画图,还能分层编辑、组合多图,设计能力更强。原文稍后读已读值得跟进有用关注 Seedream 5.0 Pro
19:31官方账号Decoder@Maximilian Schreiner71°Meta旗下Superintelligence Labs推出首个图像生成模型Muse Image。该模型类似OpenAI的GPT Image 2,能通过代码执行和网页搜索等工具自主优化生成结果。其@-mention功能允许用户基于他人公开的Instagram照片生成图像,无需对方同意。这种opt-out模式可能违反GDPR和欧盟AI法案。技术亮点与隐私争议并存。AI模型Muse ImageMetaInstagram10 个信源在谈事件专题推荐理由:Meta新出的Muse Image能像GPT Image 2一样调用工具自动改图,但争议点在于它能拿你Insta照片生成别人头像,隐私风险很大。原文稍后读已读值得跟进有用关注 Muse Image
09:07@koltregaskes@koltregaskes用户Koltregaskes在X上分享了对一个未具名图像生成模型的快速测试,使用包含42岁东亚女性、f/1.8光圈、85mm镜头、黄金时刻等详细参数的提示词,生成的照片在皮肤纹理、光影和衣物褶皱上表现逼真。他还贴出了Gemini和GPT的生成结果作为对比,显示出该模型在摄影写实方面稍有优势。测试仅基于单一样例,但提示词复杂度和输出质量值得关注。AI模型GeminiGPT提示词工程推荐理由:看这个用户用详细提示词测新模型,效果很真实,还对比了Gemini和GPT的结果,挺有意思的。原文稍后读已读值得跟进有用关注 Gemini
06:31官方账号Meta AI@AIatMetaMeta 的 Muse Image 模型在强化学习训练中涌现出思维链内的自我改进行为,能够自适应地选择执行局部编辑、完全重新生成或调用外部工具。该行为未经显式编程,而是模型为优化图像质量和最大化奖励而产生的策略。实验显示这一涌现能力显著提升了图像生成效果。AI模型Muse ImageMeta强化学习推荐理由:Meta 的 Muse Image 在强化学习下自己学会了边画边改,能局部修也能重画,效果比直接生成更好,值得看看原文稍后读已读值得跟进有用关注 Muse Image
06:27官方账号Meta AI@AIatMeta83°Meta 超级智能实验室推出首款媒体生成模型 Muse Image 和 Muse Video。Muse Image 能忠实遵循指令、精确编辑、从多个参考合成图像,并利用 Instagram 社交上下文。它集成了智能体工具能力,与 Muse Spark 配合,可在 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 中试用。Muse Video 基于相同预训练基础,支持原生音频并实现高视觉保真度。AI模型Muse ImageMuse VideoMeta推荐理由:Meta 发了两个新模型 Muse Image 和 Muse Video,一个能画图还能编辑,一个能生成视频带声音,可以在 Instagram 里直接用了。原文稍后读已读值得跟进有用关注 Muse Image
06:21techcrunch@Lucas RopekMeta发布了名为Muse的新型AI图像生成模型。该模型可应用于广告设计、装饰和创作者内容生成。目前Muse的具体性能参数和开源状态尚未公开。AI模型MuseMeta图像生成推荐理由:Meta出了个新图像生成器Muse,能帮你快速做广告图、装饰图和创作素材,实用性强。原文稍后读已读值得跟进有用关注 Muse
04:36lmarena.ai@lmarena_ai73°Meta 的 Muse Image 在 Image Arena 基准中升至第二,仅次于 OpenAI 的 GPT Image 2。它超越了 Nano Banana、Grok Imagine、MAI Image 等模型。在文本到图像、单图像编辑和多图像编辑三个子类别中均排名第二。Muse Image 支持指令遵循、精确编辑、多参考合成,并集成 Instagram 社交上下文。AI模型Muse ImageMetaGPT Image 210 个信源在谈事件专题推荐理由:Meta 的新图像模型 Muse Image 在权威榜单排第二,仅次于 GPT Image 2,能精准编辑和参考多张图合成,试试看原文稍后读已读值得跟进有用关注 Muse Image
03:18The Rundown AI@therundownai73°Meta发布了Muse Image,这是其MSL部门推出的首个图像生成模型。该模型采用代理式设计,与Muse Spark协作,在生成前先推理用户提示、搜索网络并规划。目前已集成到Meta AI应用、Instagram Stories和WhatsApp聊天中,但未公布任何基准测试成绩。AI模型Muse ImageMuse SparkMeta推荐理由:Meta新出的Muse Image,能先推理再画图,第一次就让你满意。已经能在Instagram和WhatsApp里直接用了。原文稍后读已读值得跟进有用关注 Muse Image
16:39官方一手Pandaily@contact@pandaily.com (Pandaily)智谱AI推出免费AI图像生成模型GLM-Image,可在image.z.ai直接使用。该模型支持中文文本渲染,在中文场景下表现优于Midjourney等国外工具。目前GLM-Image完全免费且无水印,用户可生成带有中文文字的图片。AI模型Zhipu AIGLM-ImageMidjourney1 个信源在谈事件专题推荐理由:智谱AI出了个免费AI生图工具GLM-Image,写中文文字比Midjourney还强,而且没水印,直接用就行。原文稍后读已读值得跟进有用关注 Zhipu AI
17:00官方一手pandaily@contact@pandaily.com (Pandaily)Midjourney、Google、字节跳动、快手、智谱AI、腾讯等多家公司在H1 2026推出了新一代图像与视频生成模型。Midjourney旗舰模型在图像质量和风格控制上进一步提升。Google的Veo系列在长视频生成和物理一致性上取得突破。字节跳动的MagicVideo系列在生成速度和分辨率上优化。快手可灵支持了更长的视频输出并改善了运动连贯性。智谱AI的GLM-4V实现了图像与视频的多模态深度融合。AI模型MidjourneyGoogleByteDance推荐理由:这篇文章一口气总结了六家公司的图像和视频模型新进展,想快速了解上半年谁家出了什么、强在哪,看这篇就够了。原文稍后读已读值得跟进有用关注 Midjourney
00:34berryxia@berryxiaOsaurus是一款基于Swift开发的Mac端AI工作台,完全本地运行无需联网。它能在用户生成图片时自动卸载当前聊天模型,加载任意MLX图像模型,在GPU上生成真实文件后再切回聊天模型。项目已获6k GitHub Stars和15.5万次下载,采用MIT开源协议。AI产品OsaurusMacMLX推荐理由:Mac用户去试试Osaurus,真正的本地AI工作台,不联网就能在GPU上生成图片,切换模型丝滑,还免费开源。原文稍后读已读值得跟进有用关注 Osaurus
08:29官方账号Allen AI (Ai2)@allen_ai艾伦人工智能研究所发布了DiScoFormer模型,用于更精确地估计评分函数(score function)。该评分函数指引AI图像生成器朝向概率更高的图像,类似于贝叶斯采样和等离子体物理中的原理。DiScoFormer在处理复杂数据时显著优于现有方法,提升了生成质量。AI模型DiScoFormerAllen AI评分函数推荐理由:艾伦AI发了DiScoFormer,能更准地估计评分函数,处理复杂数据比之前强,适合搞图像生成的看看。原文稍后读已读值得跟进有用关注 DiScoFormer
08:00IT之家(博客/媒体)谷歌发布Nano Banana 2 Lite图像生成模型,4秒内可生成一张图像。每生成1000张图像收费0.034美元(约合0.23元人民币),成本低于标准版Nano Banana 2。该模型强调速度和批量处理能力,已登陆谷歌AI Studio、Gemini API等平台,并取代初代Nano Banana。谷歌还扩大了Gemini Omni Flash的开放范围,其视频生成收费标准为每秒0.10美元。AI模型Nano Banana 2 Lite谷歌图像生成10 个信源在谈事件专题推荐理由:谷歌新出的Nano Banana 2 Lite,4秒出一张图,一千张才两毛三,做批量生图效率高又省钱。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
07:19官方账号Simon Willison’s Weblog(博客/媒体)Google 发布了 Nano Banana 2 Lite,即 Gemini 3.1 Flash Lite Image 图像模型,声称是“最快最便宜的 Gemini 图像模型”。作者在 AI Studio 用提示词生成了“寻找拿着火腿收音机的浣熊”风格的图片,效果优于4月时其他 Nano Banana 模型的尝试。模型在生图时出现了两处拼写错误(如“Forest Festival”拼错)。该模型专为高速度和大规模部署设计,API 名称为 gemini-3.1-flash-lite-image。AI模型Nano Banana 2 LiteGemini 3.1 Flash Lite ImageGoogle10 个信源在谈事件专题推荐理由:Google 出了个 Nano Banana 2 Lite 图像模型,最快最便宜,能生成沃尔多风格找图,比上一版好但拼写会错。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
03:51官方账号Google AI@GoogleAI精选Google推出Nano Banana 2 Lite,这是其最快且成本最低的Gemini图像模型,文本转图像仅需不到4秒,已通过Gemini API和Google AI Studio提供。同时公开预览Gemini Omni Flash,这是一款原生多模态模型,用于高效视频生成和对话式编辑,可通过API和Enterprise Agent Platform使用。两者结合可快速生成图像并即时动画化,室内设计demo展示上传照片后生成定制概念并转化为动态视频。AI模型Nano Banana 2 LiteGemini Omni FlashGoogle10 个信源在谈事件专题推荐理由:Google一口气发了两个模型:一个4秒出图,一个直接生成视频,还能连起来用,成本还低,搞创作的可以试试。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
03:08techcrunch@Lucas RopekGoogle发布了Nano Banana 2 Lite图像生成模型。该模型在生成速度上进行了优化,比前代更快。同时降低了计算成本,更适合大规模使用。面向创作者,可用于快速生成AI图像内容。AI模型GoogleNano Banana 2 Lite文生图10 个信源在谈事件专题推荐理由:Google出了个新图生模型Nano Banana 2 Lite,更快更便宜,做AI内容的朋友可以关注。原文稍后读已读值得跟进有用关注 Google
03:07The Rundown AI@therundownai精选73°Google今天发布两个新模型:Nano Banana 2 Lite用于图像生成,Gemini Omni Flash用于视频生成。Lite可在4秒内生成一张图像,价格为每千张0.034美元,适合高吞吐低成本任务。Omni Flash在LMArena文本到视频排行榜排名第一,在图像到视频和视频编辑中位列前二,仅次于Seedance 2.0,价格为每秒0.10美元。OpenAI的gpt-image-2仍在图像排行榜上保持领先。AI模型Nano Banana 2 LiteGemini Omni FlashGoogle10 个信源在谈事件专题推荐理由:Google新出了两个模型:Lite低成本快速出图(4秒/张,千张34美元),Omni Flash视频生成在LMArena登顶,性价比不错。想省钱做图或搞视频的可以关注。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
01:53elvis@omarsar0Google发布两款新生成式媒体模型:Nano Banana 2 Lite和Gemini Omni Flash。Nano Banana 2 Lite生成单张图像速度小于4秒,价格为每千张0.034美元。Gemini Omni Flash在视频编辑任务上达到SOTA,每小时成本0.10美元,与Veo 3.1 Fast相同。这些定价远低于行业平均水平,有助于降低开发者构建AI应用的门槛。AI模型Nano Banana 2 LiteGemini Omni FlashGoogle10 个信源在谈事件专题推荐理由:Google把图像生成价格打到每千张3分钱,速度不到4秒,还能编辑视频,做教育科研的可以试试。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
01:34官方账号Decoder@Matthias BastianGoogle发布两个新生成式AI模型:Nano Banana 2 Lite可在4秒内生成图像,每张成本0.034美元。Gemini Omni Flash首次通过API支持文本提示生成和编辑视频。Google建议将两个模型串联,从静态图像转换为动画视频。AI模型Nano Banana 2 LiteGemini Omni FlashGoogle10 个信源在谈事件专题推荐理由:Google新出两个模型:一个4秒出图只要3分钱,另一个能文字生成视频,还能链着玩。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
00:52官方账号Logan Kilpatrick@OfficialLoganK精选Google 发布两款新生成式媒体模型 Nano Banana 2 Lite 和 Gemini Omni Flash,集成在 Gemini API 和 AI Studio 中。Nano Banana 2 Lite 图像生成速度低于 4 秒,成本仅 $0.034/千张。Gemini Omni Flash 在视频编辑任务上达到 SOTA,定价 $0.10/秒,与 Veo 3.1 Fast 相同。两者均强调高效与低成本。AI模型Nano Banana 2 LiteGemini Omni FlashGoogle10 个信源在谈事件专题推荐理由:Google 发了两款新模型:一个 4 秒出图、千张只要 3 分 4;另一个视频编辑达到 SOTA 且和 Veo 3.1 Fast 一样便宜。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
07:39IT之家(博客/媒体)72°谷歌宣布,Gemini应用的Nano Banana驱动个性化图像生成功能对全美免费用户开放。该功能基于用户授权连接的Gmail、谷歌相册、YouTube和谷歌搜索获取偏好。用户只需简单提示如“创作一幅包含我和个人爱好的插画”,Gemini即可自动判断元素并生成图像。用户可开启或关闭“个性化智能”,并自行选择Gemini可访问的应用。谷歌此前披露Gemini月活跃用户已突破7.5亿。AI产品GeminiNano Banana谷歌推荐理由:谷歌把Gemini的个性化生图免费开放了,它能根据你的相册和搜索记录自动生成贴合爱好的图像,不用写详细提示词了。原文稍后读已读值得跟进有用关注 Gemini
04:20techcrunch@Lauren Forristal谷歌宣布,其Gemini聊天机器人的个性化AI图像生成功能现已向符合条件的美国免费用户开放。该功能允许Gemini根据用户兴趣及来自谷歌应用(如Gmail、日历)的数据生成定制图像。此举将原本仅限付费用户的功能扩展到免费层。用户可在对话中直接要求Gemini生成反映个人风格的图片。AI产品GeminiGoogle图像生成推荐理由:谷歌把Gemini的个性化生图功能免费开放给美国用户了,能根据你存的数据生成专属图片,试试看。原文稍后读已读值得跟进有用关注 Gemini
15:41@koltregaskes@koltregaskes商汤推出了U1 Pro图像思考模型,该模型在图像生成能力上与GPT Image 2持平甚至更优。U1 Pro支持高达8K分辨率输出,专为设计场景优化。内部测试将于7月启动,之后计划公开发布。AI模型U1 ProSenseTimeGPT Image 2推荐理由:商汤新模型U1 Pro据说能和GPT Image 2比一比,还支持8K图,设计师7月就能内测了。原文稍后读已读值得跟进有用关注 U1 Pro
13:49官方账号Microsoft AI@MicrosoftAI微软的 MAI-Image-2.5 在 Artificial Analysis 的文本到图像榜单中排名第2,图像编辑排名第3。该模型能对图像进行精确编辑,例如将雨窗模糊场景转换为清晰街景,同时保持物体一致性、光照、反射和场景几何。模型现已通过 Foundry API、MAI Playground 和 OpenRouter 提供使用。AI模型MAI-Image-2.5Microsoft图像生成1 个信源在谈事件专题推荐理由:微软 MAI-Image-2.5 图像生成排第2、编辑排第3,还能把雨窗变清晰,想用去 Foundry API 或 OpenRouter 试试。原文稍后读已读值得跟进有用关注 MAI-Image-2.5
10:09官方账号arXiv cs.AI@Guanbo Huang, Jingjia Mao, Fanding Huang, Fengkai Liu, Xiangyang Luo, Yaoyuan Liang, Jiasheng Lu, Xiaoe Wang, Pei Liu, Ruiliu Fu, Ruqi Huang, Shao-Lun Huang流匹配(Flow Matching)存在暴露偏差,现有缓解方法依赖静态约束。本文提出DEFAR框架,包含抗漂移修正(ADR)和频率补偿(FC)两个组件。ADR利用推理时漂移信号学习将偏离状态拉回目标方向,FC基于偏差自反馈权重增强缺失的低频成分。在CIFAR-10、CelebA-64、ImageNet-256/512上,DEFAR优于先前基线,且具有良好的可扩展性与推理鲁棒性。论文Flow MatchingDEFAR暴露偏差推荐理由:这篇论文让模型靠偏差自己修正偏差,DEFAR在CIFAR和ImageNet上都能超过之前的方案,还更稳。原文稍后读已读值得跟进有用关注 Flow Matching
08:15AK@_akhaliqDiffusionBench是一个专门针对扩散变换器(Diffusion Transformers)的全面评估基准。它涵盖了生成质量、推理效率、模型鲁棒性等多个关键维度。该基准基于ImageNet等公开数据集提供了标准化测试协议。它为不同扩散变换器架构的性能比较建立了统一框架。AI模型DiffusionBench扩散变换器评估基准推荐理由:想了解不同扩散变换器到底谁更强?试试这个新基准DiffusionBench,评估维度很全,结果很直观。原文稍后读已读值得跟进有用关注 DiffusionBench
18:00AI Will@FinanceYF5一位独立研究者(沃尔玛应届程序员)用单张RTX 3090 Ti、零经费完成两项扩散模型研究,被SIGGRAPH 2026录用。InfiniteDiffusion实现无限图像生成,支持随机访问、可复现、可并行、零存储。Terrain Diffusion是首个学习型程序化地形生成器,单卡速度比卫星飞行快9倍,仅需1.5GB显存。该研究已发布Minecraft mod,代码已开源。AI模型InfiniteDiffusionTerrain Diffusion图像生成推荐理由:一个人用一张3090 Ti发SIGGRAPH,InfiniteDiffusion无限图像生成、Terrain Diffusion比卫星快9倍,代码开源,快去试试Minecraft mod。原文稍后读已读值得跟进有用关注 InfiniteDiffusion
10:47官方账号arXiv cs.LG@Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu, Tat-Seng Chua针对文本到图像(T2I)、局部编辑和全局编辑等能力难以统一且相互冲突的问题,论文提出DanceOPD框架。该框架基于流匹配模型,采用策略生成场蒸馏,将每个样本路由至对应能力场,并查询低噪声的学生诱导状态,用速度MSE目标训练。在T2I、编辑、真实性场吸收和CFG吸收等实验上,DanceOPD改善了多能力组合效果,增强了目标能力同时保持基准生成质量。论文DanceOPD流匹配模型图像生成推荐理由:这篇论文用DanceOPD把T2I、局部编辑和全局编辑统一到一个模型里,解决了相互干扰的问题,效果显著提升。原文稍后读已读值得跟进有用关注 DanceOPD
02:54官方一手Midjourney: Updates@CalebMidjourney 在 V8.1 的 draft mode 中新增 --sref random 参数,使用后一次可生成 24 张不同风格的图像。用户只需在提示词中加入 --draft(或点击闪电图标)进入草稿模式,再添加 --sref random 即可随机混合多种风格。该功能旨在帮助用户快速探索和发现喜欢的视觉风格,无需手动指定样式参考。AI产品MidjourneyV8.1draft mode推荐理由:想快速试不同画风?现在 Midjourney 草稿模式下加个参数,一次出 24 种随机风格,比手动换 sref 方便多了。原文稍后读已读值得跟进有用关注 Midjourney
00:54techcrunch@Russell Brandom前Databricks AI负责人创立新公司,声称其技术可将AI系统电力消耗降低1000倍。该公司首个产品是图像生成系统Un0,能复现传统AI模型的功能但能耗极低。该声称基于硬件与算法协同优化,但尚未有第三方验证数据。若属实,可能大幅降低大规模AI部署的运营成本。行业DatabricksUn0图像生成推荐理由:前Databricks AI老大搞了个新公司,说能让AI耗电降到原来的千分之一,他们先做了个图像生成系统Un0,如果真能兑现,那AI成本得崩盘。原文稍后读已读值得跟进有用关注 Databricks
16:06IT之家(博客/媒体)精选商汤科技正在研发代号U1 Pro的多模态模型,聚焦设计场景,对标OpenAI GPT-Image 2。该模型由联合创始人林达华牵头,属于日日新家族,预计7月启动内部邀请测试。支持8K分辨率输出,能实现设计-生成-评审长程循环。内部评测显示,相同提示词下U1 Pro生成图片质量接近甚至优于GPT-Image 2。LMSYS Chatbot Arena中GPT-Image 2文生图评分领先谷歌Nano Banana 2。AI模型商汤科技U1 ProGPT-Image 210 个信源在谈事件专题推荐理由:商汤新模型U1 Pro专攻设计,对标GPT-Image 2,内部评测更优,支持8K输出,7月内测。原文稍后读已读值得跟进有用关注 商汤科技
23:23OpenRouter@OpenRouterAIOpenRouter 发布全新专用 Image API,支持类型化动态能力。该 API 统一接入来自 Google、OpenAI、Black Forest Labs、Recraft、ByteDance、Sourceful、Microsoft 和 xAI 共8家提供商的30多个图像生成模型。开发者可通过单一接口调用多种模型,简化多模型集成流程。AI产品OpenRouterImage API图像生成10 个信源在谈事件专题推荐理由:OpenRouter 把30多个图像生成模型集中到一个API里,开发者不用挨个对接不同的服务商,省事多了。原文稍后读已读值得跟进有用关注 OpenRouter
01:01官方账号LMSYS Org (SGLang)@lmsysorg精选Krea 2 是由 Krea AI 推出的开源文本到图像模型,在独立评测机构 Artificial Analysis 上排名第一。它包含两个版本:RAW 为未蒸馏基座检查点,适合微调和 LoRA 训练;Turbo 为 8 步蒸馏检查点,实现快速高质量生成。用户可在 RAW 上训练 LoRA,在 Turbo 上进行推理,并已获得 SGLang 的 Day-0 支持。AI模型Krea 2SGLangRAW推荐理由:Krea 2 开源了双版本,RAW 用来训练 LoRA,Turbo 跑推理,直接用 SGLang 就能跑,比闭源模型更灵活。原文稍后读已读值得跟进有用关注 Krea 2
17:27AI Will@FinanceYF5Midjourney在创作奇特、氛围感十足的图片和短动画上依然独一无二。Ethan Mollick用相似提示词生成的奇异城市呈现完全不同的风格。AI产品Midjourney图像生成创意工具推荐理由:Midjourney还是那个Midjourney,玩氛围感图片和短动画没对手,其他模型就是学不来那种调调。原文稍后读已读值得跟进有用关注 Midjourney
14:09shao__meng@shao__meng72°字节跳动在火山引擎 FORCE 2026 原动力大会上发布 Seedream 5.0 Pro 图像生成模型和 Seedance 2.5 视频生成模型。OpenAI Sora 已关停,Google Veo 尚未更新,目前图像与视频生成赛道主要由中国厂商竞争,包括字节跳动、阿里巴巴、快手等。新模型在图像理解和视频生成能力上进一步升级。AI模型Seedream 5.0 ProSeedance 2.5字节跳动10 个信源在谈事件专题推荐理由:字节跳动刚发了两个新模型,图像和视频生成都升级了,中国大厂继续内卷,可以看看原文稍后读已读值得跟进有用关注 Seedream 5.0 Pro
13:17官方账号arXiv cs.AI@Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or该论文提出一种名为Semantic Browsing的方法,解决文本到图像模型生成样本多样性不足的问题。传统方法依赖随机噪声产生无意义变化,而Semantic Browsing通过Vision Language Model(VLM)在文本层面施加结构化语义变异。用户可沿可解释的语义轴(如物体属性、场景布局)导航图像集,每个变体对应一个具体可理解的语义决策。实验表明该方法能生成多样且可浏览的设计空间。论文Semantic Browsing文本到图像Vision Language Model推荐理由:想要生成同一主题下不同设计的图像?这篇论文教你用VLM在文本层面控制多样性,比随机抽噪声靠谱多了。原文稍后读已读值得跟进有用关注 Semantic Browsing
00:50官方一手AWS Machine Learning Blog@Nick Biso精选本文介绍了如何通过Amazon SageMaker AI处理作业部署ComfyUI工作流,实现单次批量生成数百张高质量图像。使用AWS CDK配置基础设施,利用GPU加速处理自动执行图像生成。该方案可适配自定义ComfyUI工作流,适用于规模化创意流水线。技巧ComfyUIAmazon SageMaker AI图像生成推荐理由:AWS官方教你用ComfyUI和SageMaker AI批量跑图,省时省GPU钱,适合需要自动生成大量图像的团队。原文稍后读已读值得跟进有用关注 ComfyUI
03:05官方账号Together AI@togethercompute88°OpenAI 的 GPT Image 2 模型现已在 Together AI 的 Serverless Inference 服务中上线。开发者可通过该接口将图像生成与编辑功能集成到多模态应用中。模型支持精准布局控制、可读文本生成以及参考图像引导生成。Together AI 提供无服务器推理能力,无需管理基础设施即可调用。AI模型GPT Image 2OpenAITogether AI10 个信源在谈事件专题推荐理由:OpenAI 的新图像模型 GPT Image 2 现在能用 Together AI 的无服务器接口调用了,做多模态应用时直接用它生成和编辑图片,支持布局和文字控制,挺方便。原文稍后读已读值得跟进有用关注 GPT Image 2