7月20日
09:23
09:23官方账号arXiv cs.AI@Bhavana Verma, Priyanka Meel, Dinesh Kumar Vishwakarma
论文提出HCIG和GCCN两个新框架,以建模文本与图像之间的多粒度语义不一致。在MMSD讽刺检测基准上,HCIG达到85.74%准确率和85.29%宏F1。在MultiBully网络霸凌数据集上,GCCN宏F1为68.66%,HCIG准确率69.62%、霸凌类F1 74.90%。实验表明分层多粒度不一致建模优于传统融合策略,为多模态推理提供有效方法。
推荐理由:这篇论文提出了HCIG和GCCN,在MMSD和MultiBully上分别达到85.74%和69.62%准确率,比传统融合方法更善于捕捉图文矛盾。
09:15
09:15官方账号arXiv cs.AI@ SciForge Team, Zhangyang Gao, Minghao Fang, Yifei Liu, Hanhui Yang, Xinyu Gu, Shixiang Tang, Siqi Sun, Lei Bai, Cheng Tan, Mengdi Liu, Hao Wu, Shuizhou Chen
arXiv 论文提出 SciForge,一个专为科学研究设计的 AI 原生多模态工作台。该工作台基于五个核心理念构建:目标导向的决策治理、先翻译后推理的多模态处理、可审计的证据链、协作式团队科学以及实际应用场景。论文通过八个端到端用户案例验证,包括基因发现、从头蛋白质设计、分子优化等旗舰演示。SciForge 目前为桌面应用,已开源在 GitHub 上。
推荐理由:想用 AI 管理整个科研流程?SciForge 把论文、代码、数据整合成可追溯的工作状态,还帮你做基因发现和蛋白质设计,开源可玩。
7月19日
20:15
09:27
09:27官方一手Pandaily@contact@pandaily.com (Pandaily)
香港数码港正成为中国AI企业全球化的重要枢纽。其AI超算中心算力达3000 PFLOPS,并推出300亿港元资助计划。通过三板块战略,数码港将连接内地AI初创公司与东南亚、中东市场。此举旨在利用香港的国际金融与法规优势,加速国产AI技术出海。

推荐理由:数码港砸300亿港元和3000 PFLOPS算力,专门帮内地AI公司打通东南亚和中东市场,不是画饼。
7月18日
11:52
11:52Geek@geekbb
该项目利用OpenAI视觉模型自动识别照片中的衣物,并进行自动抠图。随后基于抠图结果生成模特上身预览效果。配套的Codex技能支持一键导入衣物素材或生成模特穿搭画册。整个流程可帮助电商卖家快速制作商品展示图。
事件专题

推荐理由:这个开源项目用OpenAI视觉模型自动识别衣物、抠图,还能生成模特上身图,适合电商卖家快速出图。
08:09
08:09OpenRouter@OpenRouterAI
Think Machines开发的Inkling模型已上线OpenRouter。该模型采用MoE架构,总参数975B、活跃参数41B。支持1M上下文长度,可处理文本、图像和音频。具备可控推理能力。
事件专题

推荐理由:Think Machines的Inkling模型很特别,总参数975B但只激活41B,还有1M上下文和多种模态支持,值得上手试试。
01:22
01:22官方账号NVIDIA AI@NVIDIAAI
精选
英伟达开源微调库 NeMo AutoModel 新增对 Hugging Face Diffusers 的支持。此前仅限 Transformer 模型,现在可微调图像和视频生成模型。提供即用的全参数和 LoRA 训练脚本,免去手动编写分布式训练代码的繁琐。

推荐理由:英伟达开源微调工具 AutoModel 现在也能调图像视频模型了,提供现成 LoRA 脚本,省去写分布式训练的麻烦。
7月17日
16:25
12:17
09:25
09:25官方账号arXiv cs.LG@Sara Ketabi, Matthias W. Wagner, Cynthia Hawkins, Uri Tabori, Birgit Betina Ertl-Wagner, Farzad Khalvati
该论文提出MseaCL框架,在儿科3D脑部MRI和放射学报告的多模态对比学习中,通过语义相似性引导减少假阴性样本。传统对比学习将非配对样本视为负例,但医学影像中语义相似的样本常被误判为负例。MseaCL在儿科队列上训练,将报告语义相似度作为信号,下游任务中儿科脑肿瘤分子分类AUC提升至少22.6%。
推荐理由:新论文用语义感知对比学习解决医学影像的假阴性问题,在脑肿瘤分类上AUC涨了22.6%,值得搞多模态医疗AI的人看看。
08:04
08:04官方账号Together AI@togethercompute
精选
Thinking Machines Lab 联合 Together AI 发布了 Inkling 多模态 MoE 模型。该模型原生支持文本、图像、音频三种输入。它具备可控推理努力机制,允许在推理时动态调整计算量。基于 Together 的 FlashAttention-4 内核优化,显著提升 token 效率。在多个基准上展示了高效推理能力。
事件专题

推荐理由:Inkling 是 Thinking Machines Lab 的新多模态 MoE 模型,同时支持文本、图像、音频输入,还能控制推理计算量,效率很高。
04:00
04:00官方账号Decoder@Matthias Bastian
Kimi发布名为K3的多模态开放权重模型,拥有2.8万亿参数和100万token上下文。在自有基准测试中,K3接近GPT-5.6 Sol和Claude Fable 5,并显著超过Opus 4.8和GLM 5.2。该模型定价大幅高于前代,标志着中国AI低价时代可能结束。完整权重计划于7月27日前公开发布。
事件专题

推荐理由:Kimi搞了个2.8万亿参数的开源模型K3,性能追平GPT-5.6 Sol和Claude Fable 5,不过价格也上去了,中国AI要涨钱了。
02:54
01:03