7月9日
05:12
7月8日
23:36
23:36官方一手歸藏(guizang.ai)@op7418
Seedream 5.0 的图像模型上线,作者测试了几张图,包括生成游戏截图、科普图、UI 设计稿和剧情介绍图。模型支持 2K 分辨率,比 GPT-4o 更高,但文字细节方面,多文字时仍存在模糊问题。整体进步明显,比之前的图像模型提升较大。

推荐理由:Seedream 5.0 图像模型刚上线,能生成 2K 分辨率图片,比 GPT-4o 清晰,但文字多时会糊。想试试新模型可以看看这些例子。
19:31
19:31官方账号Decoder@Maximilian Schreiner
71°
Meta旗下Superintelligence Labs推出首个图像生成模型Muse Image。该模型类似OpenAI的GPT Image 2,能通过代码执行和网页搜索等工具自主优化生成结果。其@-mention功能允许用户基于他人公开的Instagram照片生成图像,无需对方同意。这种opt-out模式可能违反GDPR和欧盟AI法案。技术亮点与隐私争议并存。
事件专题

推荐理由:Meta新出的Muse Image能像GPT Image 2一样调用工具自动改图,但争议点在于它能拿你Insta照片生成别人头像,隐私风险很大。
06:21
03:18
7月7日
16:39
16:39官方一手Pandaily@contact@pandaily.com (Pandaily)
智谱AI推出免费AI图像生成模型GLM-Image,可在image.z.ai直接使用。该模型支持中文文本渲染,在中文场景下表现优于Midjourney等国外工具。目前GLM-Image完全免费且无水印,用户可生成带有中文文字的图片。
事件专题

推荐理由:智谱AI出了个免费AI生图工具GLM-Image,写中文文字比Midjourney还强,而且没水印,直接用就行。
7月2日
00:34
7月1日
03:08
01:34
01:34官方账号Decoder@Matthias Bastian
Google发布两个新生成式AI模型:Nano Banana 2 Lite可在4秒内生成图像,每张成本0.034美元。Gemini Omni Flash首次通过API支持文本提示生成和编辑视频。Google建议将两个模型串联,从静态图像转换为动画视频。
事件专题

推荐理由:Google新出两个模型:一个4秒出图只要3分钱,另一个能文字生成视频,还能链着玩。
00:52
00:52官方账号Logan Kilpatrick@OfficialLoganK
精选
Google 发布两款新生成式媒体模型 Nano Banana 2 Lite 和 Gemini Omni Flash,集成在 Gemini API 和 AI Studio 中。Nano Banana 2 Lite 图像生成速度低于 4 秒,成本仅 $0.034/千张。Gemini Omni Flash 在视频编辑任务上达到 SOTA,定价 $0.10/秒,与 Veo 3.1 Fast 相同。两者均强调高效与低成本。
事件专题

推荐理由:Google 发了两款新模型:一个 4 秒出图、千张只要 3 分 4;另一个视频编辑达到 SOTA 且和 Veo 3.1 Fast 一样便宜。
6月29日
15:41
10:09
10:09官方账号arXiv cs.AI@Guanbo Huang, Jingjia Mao, Fanding Huang, Fengkai Liu, Xiangyang Luo, Yaoyuan Liang, Jiasheng Lu, Xiaoe Wang, Pei Liu, Ruiliu Fu, Ruqi Huang, Shao-Lun Huang
流匹配(Flow Matching)存在暴露偏差,现有缓解方法依赖静态约束。本文提出DEFAR框架,包含抗漂移修正(ADR)和频率补偿(FC)两个组件。ADR利用推理时漂移信号学习将偏离状态拉回目标方向,FC基于偏差自反馈权重增强缺失的低频成分。在CIFAR-10、CelebA-64、ImageNet-256/512上,DEFAR优于先前基线,且具有良好的可扩展性与推理鲁棒性。
推荐理由:这篇论文让模型靠偏差自己修正偏差,DEFAR在CIFAR和ImageNet上都能超过之前的方案,还更稳。
6月26日
10:47
10:47官方账号arXiv cs.LG@Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu, Tat-Seng Chua
针对文本到图像(T2I)、局部编辑和全局编辑等能力难以统一且相互冲突的问题,论文提出DanceOPD框架。该框架基于流匹配模型,采用策略生成场蒸馏,将每个样本路由至对应能力场,并查询低噪声的学生诱导状态,用速度MSE目标训练。在T2I、编辑、真实性场吸收和CFG吸收等实验上,DanceOPD改善了多能力组合效果,增强了目标能力同时保持基准生成质量。
推荐理由:这篇论文用DanceOPD把T2I、局部编辑和全局编辑统一到一个模型里,解决了相互干扰的问题,效果显著提升。
00:54
00:54techcrunch@Russell Brandom
前Databricks AI负责人创立新公司,声称其技术可将AI系统电力消耗降低1000倍。该公司首个产品是图像生成系统Un0,能复现传统AI模型的功能但能耗极低。该声称基于硬件与算法协同优化,但尚未有第三方验证数据。若属实,可能大幅降低大规模AI部署的运营成本。
推荐理由:前Databricks AI老大搞了个新公司,说能让AI耗电降到原来的千分之一,他们先做了个图像生成系统Un0,如果真能兑现,那AI成本得崩盘。
6月23日
17:27
00:50
00:50官方一手AWS Machine Learning Blog@Nick Biso
精选
本文介绍了如何通过Amazon SageMaker AI处理作业部署ComfyUI工作流,实现单次批量生成数百张高质量图像。使用AWS CDK配置基础设施,利用GPU加速处理自动执行图像生成。该方案可适配自定义ComfyUI工作流,适用于规模化创意流水线。
推荐理由:AWS官方教你用ComfyUI和SageMaker AI批量跑图,省时省GPU钱,适合需要自动生成大量图像的团队。
6月20日
03:05
03:05官方账号Together AI@togethercompute
88°
OpenAI 的 GPT Image 2 模型现已在 Together AI 的 Serverless Inference 服务中上线。开发者可通过该接口将图像生成与编辑功能集成到多模态应用中。模型支持精准布局控制、可读文本生成以及参考图像引导生成。Together AI 提供无服务器推理能力,无需管理基础设施即可调用。
事件专题

推荐理由:OpenAI 的新图像模型 GPT Image 2 现在能用 Together AI 的无服务器接口调用了,做多模态应用时直接用它生成和编辑图片,支持布局和文字控制,挺方便。