8月21日
00:53
00:53Replicate@replicate
bfl_ai 发布了 FLUX Video Upscale 工具。该工具可将视频放大至 1080p、2k 和 4k 分辨率。它提供两种模式:Precise 模式可精确保留人脸和产品细节。Creative 模式则通过提示词重建精细纹理。
事件专题

推荐理由:bfl_ai 刚刚发布了 FLUX Video Upscale,能把视频放大到 4K,还有个能重建细节的创意模式,比普通放大工具强多了。
00:24
8月20日
23:05
23:05
23:04
23:04
23:04
10:19
10:19官方账号arXiv cs.LG@Zhenyao Cui, Siyuan Kan, Siyang Li, Ziwei Wang, Dongrui Wu
SCORE模型采用无标签框架解决跨主体脑电信号到图像检索难题,分析不同受试者脑电特征后发现概念表达方向存在差异,通过坐标对齐与源训练恢复目标脑电坐标,在200 - way检索测试中超越最强基线取得最优准确率。
推荐理由:SCORE模型发布了无标签跨主体脑电图像检索方法,不用给每个人标数据就能做检索,比之前没标注时效果好很多。
10:19
10:19官方账号arXiv cs.LG@John Mangum, Andrew Glaws, Francois Usseglio-Viretta, Steven Spurgeon, Donal Finegan
利用超分辨率生成对抗网络(SRGAN)提升电池电极材料EBSD分析吞吐量,该技术以锂镍锰钴氧化物(LiNixMnyCozO2)正极颗粒数据为基础开展训练;研究对比了2倍至12倍上采样下的经典插值方法,验证SRGAN在保持晶粒边界与晶粒尺寸上的优势;采用5倍上采样时可实现25倍速度提升或更大视野,且关键指标误差处于合理范围。
推荐理由:朋友说那个用超分辨率生成对抗网络做电池材料EBSD分析的团队,训练了NMC正极数据,比传统方法效率更高,5倍上采后效果明显。
10:18
10:18官方账号arXiv cs.AI@Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
精选
ADEPT是一种强化学习框架,通过预训练和后训练方式提升多指机器人的灵巧性。该模型在23自由度的Kuka-Allegro和29自由度的Flexiv-Sharpa上测试,可从原始感知直接完成长时任务。它先针对通用物体摆放任务进行预训练,再将预训练行为作为先验用于下游任务的后训练。通过稳定后训练流程,实现模拟到现实的转移并达到人速级别的灵巧操作。
推荐理由:我了解ADEPT这个模型,它是用强化学习让机器人更灵活,学新动作时能直接用之前的经验,和没这么训练的方法比,效果更好。
10:18
10:18官方账号arXiv cs.AI@Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban Roy
Qwen3-0.6B模型在多代理拍卖场景中,通过新框架监测潜在隐蔽协作;该框架对同质化代理的检测准确率达0.993,异质化组合达0.854;测试显示对小范围竞拍者监测负载小,全白盒干预能恢复出价分布并降低合谋行为47.3个百分点。
推荐理由:Qwen3推出了VLA框架,用来监测多代理潜在通信,在小范围拍卖里表现好,你可以去了解下。
10:14
10:14官方一手arXiv: OpenAI@Charles de Bourcy, Sahra Ghalebikesabi, Avi Schwarzschild, Alex Gorbachev, Mihai Maruseac, Annie Chu, Vol Kyrylov, Tong Mu, Ally Bennett, Andy Nguyen, Casey Meehan, Jessica Gan Lee, Shane Bauer, Harold Nguyen, Rodolpho Eckhardt, Yuqi Liu, Charlie Oxborough, Marco Rougeth, Omar Chedid, Caio Costa, Yash Parikh, Yao Li, Congzheng Song, Om Thakkar, Vinnie Monaco
OpenAI推出的Privacy Filter模型卡,该模型有1.5亿总参数,用于检测和红action文本中的个人身份信息;该模型通过单次前向传递标注输入序列,支持12800 - 词上下文窗口;它能配置操作点平衡精确率与召回率,涵盖八类隐私分类。
事件专题

推荐理由:OpenAI发布了Privacy Filter模型卡,能高效处理文本隐私信息,效果比传统方案更专业。
08:25
08:25官方账号Pika Labs@pika_labs
精选
Pika推出的Seedance 2.5模型升级为1080p版本,该模型可依据少量视觉参考推导剪辑、音乐与镜头语言风格,其1080p版本在Pika API Club上线后,价格较竞品降低约60%
推荐理由:Pika推出了Seedance 2.5 1080p版,用少量视觉参考就能做剪辑、音乐和镜头设计,比竞品便宜不少,想做视频创作的可以试试
03:55
03:25
03:25Browser Use@browser_use
Browser Use v4 agent借助特定prompt查找美国相关信息并生成学习资料,该成果收获559次浏览体现其实效性;采用美学化浏览器方式学习新事物,可提升学习过程的吸引力;这种学习模式与传统方法对比,更具视觉上的美感。
推荐理由:浏览器用Browser Use v4agent发prompt找美国信息做幻灯片,它能帮你高效学东西,和普通学习方法比更美观有趣。
02:41
02:41lmarena.ai@lmarena_ai
Agent Arena推出的Pareto前沿平台上,Claude Opus 5(High)在真实代理任务中表现领先,提升+12.34%;该平台对比了各模型成本与性能,@OpenAI的GPT 5.5(High)表现突出,提升+7.75%;参与对比的多款知名模型包括Kimi K3(Max)和Groq 4.5等,帮助用户了解不同模型差异。
事件专题

推荐理由:Agent Arena发布了Pareto前沿平台,能查各模型做真实任务里的表现,像 Claude 和 GPT 这些对比后就知道哪个更划算。
02:26
02:26Mustafa Suleyman@mustafasuleyman
精选
微软推出的MAI-Image-2.5-Pro成为Artificial Analysis图像编辑榜单第一名,超越了Reve 2.1、GPT Image 2等模型,同时在文本转图像领域位列第七;该模型于7月23日在Microsoft Foundry预览发布,主打高质量图像处理功能。
事件专题

推荐理由:微软发布了MAI-Image-2.5-Pro,做高质量图像编辑很厉害,比Reve 2.1这些模型表现更好,适合专业图像任务使用。
8月19日
22:38
22:38
22:38eric zakariasson@ericzakariasson
Cursor团队介绍了Origin构建过程,该模型源于20年Git基础设施发展;Origin作为Git存储系统,在设计上注重可靠性;对比传统Git托管方案,Origin在性能和可扩展性表现更优。
事件专题

推荐理由:Cursor分享了Origin构建的故事,讲了Git存储怎么设计,和普通Git托管比更靠谱,值得看看。
12:26
12:26小互@imxiaohu
Ann Nguyen测试了Gemini 3.7 Flash、Kimi K3、Claude Opus 5和GPT 5.6 Sol四个模型。她给模型提供小柠檬作为提示,要求绘制人体姿势与物体融合的图像。各模型对这一创意任务表现出不同的理解和表现能力。
事件专题

推荐理由:Ann测试了四个模型如何将人体与物体融合绘画,Claude Opus 5的创意表现令人印象深刻。
11:45
11:45官方账号arXiv cs.AI@Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen
精选
研究人员提出能力驱动的数据基础设施,构建了440M图像的T2I语料库和120M编辑对。该框架包含三个专门数据引擎,为文本-图像接地、图像间转换和图像-知识关联提供监督。基于此,团队训练了3B和6B两种规模的多模态扩散模型,在CPI-Bench评估中展现广泛视觉覆盖和多功能渲染能力。
推荐理由:这篇论文提出了一种新数据设计方法,训练出能同时处理多种图像生成任务的大模型,比传统方法更高效。
01:49
01:45
01:45官方账号Pika Labs@pika_labs
精选
Pika推出Soundtrack音频模型,为视频生成原生音乐、配音和动作感知音效。该模型是Pika的4个前沿音频模型之一,即使无指导也能捕捉氛围。Pika音频模型刚发布,价格比市场其他产品便宜20倍。
推荐理由:Pika Labs刚推出Soundtrack音频模型,能给视频加原生音乐和音效,价格比其他产品便宜20倍,creators测试后很惊艳。
8月18日
17:05
17:05官方账号阿里通义 Qwen@Alibaba_Qwen
Qwen-3.8-27b与Gemini-3.7-flash进行对比测试。Qwen-3.8-27b生成的水面模拟效果更一致、视觉更惊艳。该模型在3090显卡上运行,使用Q5量化版本。
事件专题

推荐理由:Alibaba_Qwen发布了Qwen3.8-27B,单提示就能生成惊艳效果,对比Gemini-3.7-flash表现更好,还能在本地3090显卡上运行。
8月17日