8月7日
13:06
13:06宝玉@dotey
82°
Higgsfield AI 制作的95分钟AI电影《Hell Grind》以50万美元成本完成,并在戛纳电影市场放映。影片获得了《华尔街日报》《Variety》和BBC新闻的报道。官方已将全部提示词和制作素材开源,用于Higgsfield全球电影节。开源地址需要注册后访问。
事件专题

推荐理由:Higgsfield把95分钟AI电影《Hell Grind》的提示词和素材全开源了,成本50万美元,想学AI电影制作的可以直接抄作业。
13:02
13:02官方账号arXiv cs.AI@George Grispos, Sajda Qureshi
这篇arXiv论文(编号2608.06364)分析了尼日利亚电商移动应用中的AI功能与透明度。研究对多款Android应用做了取证分析,并结合文档审查评估AI披露实践。结果显示AI在应用中被广泛部署,但关于其用途的透明度披露有限。论文还从社会经济层面指出尼日利亚对数字平台依赖加深,AI认知度中等。
推荐理由:想知道购物App背地里怎么用AI、又不告诉你?这篇论文拆了尼日利亚的安卓应用,证据很清楚,看完你会重新审视手机里的购物软件。
12:56
12:56AI Will@FinanceYF5
82°
Microsoft首次披露,2026财年从OpenAI相关业务录得241亿美元收入。Bloomberg估算这约占Microsoft全部AI收入的70%。截至6月30日,Microsoft对OpenAI的应收账款为60亿美元。Microsoft累计已向OpenAI注资119亿美元。
事件专题

推荐理由:Microsoft头回公开OpenAI生意赚了241亿美元,占了自家AI收入七成,这数字真不小。
12:56
12:56AI Will@FinanceYF5
Olivia Moore在X平台表示,AI视频广告已跨越鸿沟。她自2023年跟踪该领域,现在首次怀疑自己识别AI视频广告的能力。这一表态意味着AI视频广告的逼真度已对人工辨别形成挑战。推文附带的视频展示了当前AI视频广告的实际效果。
推荐理由:Olivia Moore说自2023年盯到现在,第一次怀疑自己还认不认得出AI视频广告。她贴了段视频,看一眼就知道这玩意儿多真。
12:55
12:49
12:49官方一手歸藏(guizang.ai)@op7418
一位用户分享每周让 GPT 5.6 Pro 分析运动数据,推文获 1125 次查看。该用户表示,GPT 5.6 Pro 能帮助理解每周运动节奏。互动数据包括 2 个赞和 1 条评论。作者暂未公开 GPT 5.6 Pro 的具体分析流程。

推荐理由:有人每周用 GPT 5.6 Pro 分析运动数据,说比单纯看数字有用。感兴趣的可以看看这条推文。
12:45
12:43
12:37
12:37官方账号arXiv cs.LG@Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong
论文提出MIST基准,将每道推理题置于干净、误导、正确上下文、无关上下文四种条件下。配套SC2W指标衡量误导信号使原本正确答案变错的频率。作者发现该脆弱性在多种开源模型上普遍存在。提出的SCOPE方法通过匹配偏好对优化DPO目标,在保持干净上下文准确率的同时显著降低SC2W。
推荐理由:这篇论文把“信不信上下文”当成独立问题来训练,用MIST测出模型容易被一条错误信息带偏,SCOPE能减少这种翻车还不影响正常表现。
12:36
12:36官方账号arXiv cs.LG@Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo
电子病历特征工程占数据科学家39%-45%工作量,心衰领域尤其棘手。研究者提出Nimblemind多智能体系统(nMAS),在500份模拟患者记录、9张EHR源表上生成132个结构化特征和70个评分聚合特征。加入聚合特征后,HFrEF分型的held-out AUROC从0.895升至0.963,HFpEF从0.870升至0.910。独立LLM对证据支撑与方法学评分为最高分的81.5%。
推荐理由:心衰数据特征工程又慢又容易出错,nMAS自动管线把HFrEF的AUROC拉到0.963,还能审计特征来源。
12:30
12:30官方账号arXiv cs.LG@Chenglong Wang, Ziming Zhu, Yifu Huo, Bei Li, Qiaozhi He, Yan Ding, Xiaoyang Hao, Yuxin Gao, Tianhua Zhou, Xiaojia Chang, Tongran Liu, Jingbo Zhu
生成式奖励模型在响应排序上表现出色,但其比较性输出与强化学习要求的标量奖励不匹配。为此论文提出 RRC(Ranking-based Reward Construction),通过相对偏好排序构造奖励信号。RRC 包含自竞争排序和锚定引导排序两种互补策略,分别利用采样响应间的比较和小规模参考响应实现可扩展构造。实验在开放对话和推理基准上验证,RRC 相比现有方法持续提升强化学习训练效果。
推荐理由:这篇论文提出 RRC,能把生成式奖励模型的排序结果转成强化学习能用的信号,在对话和推理任务上比现有方法更稳定地提升训练效果。
12:12
12:12官方一手marktechpost@Asif Razzaq
精选
Liquid AI发布LFM2.5-2.6B,一个2.69B参数的端侧代理模型。它支持131,072 tokens上下文和工具调用,可在设备上独立完成多步任务。该模型在M5 Max上解码速度达220 tokens/s,内存占用低于2.5GB。开放权重提供GGUF、MLX和ONNX格式。
事件专题

推荐理由:Liquid AI出了个2.6B的小模型,能在端侧跑智能体,带128K上下文和工具调用,占不到2.5GB内存,速度还很快。
12:12
12:12官方一手歸藏(guizang.ai)@op7418
OpenAI宣布ChatGPT聊天改由GPT-5.6系列驱动。Plus和Pro用户可使用GPT-5.6 Sol,支持即时回答与深度推理。免费版和Go用户从明天起可无限使用GPT-5.6 Luna文本聊天,并有限次数使用Thinking。推文提到Luna实际体验“还行”,免费用户也值得一试。
事件专题

推荐理由:OpenAI把GPT-5.6拆成Sol和Luna,付费用户用Sol,免费用户也能无限聊Luna。想不花钱体验新模型的可以明天试试。
12:09
12:09官方账号arXiv cs.AI@Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang
新论文提出trace-grounded参数化测试方法,在2,190个视频上审计事件计数能力。Gemini 3.6 Flash在80%可靠性阈值下最多可靠计数12个持续状态转换事件(0.5和1.0 Hz),对瞬时闪烁事件则无可靠计数区间。高计数高频率场景下仅0.2%的最终计数正确,模型只能恢复18.1%的真实事件。提高采样率将Bounce Ball准确率从19.6%提升至29.3%,但报告序列与真值一致率仅3.7%。
事件专题

推荐理由:用可执行真值逐帧审计视频模型计数,发现Gemini 3.6 Flash处理瞬时事件几乎失效,加帧只虚涨分数,值得看。
12:06
12:06官方账号arXiv cs.AI@Yunjia Qi, Zehua Yin, Xintong Shi, Hao Peng, Songyuanyi Lu, Yixian Liu, Richeng Xuan, Yuhong Liu, Zhichao Hu, Xiaozhi Wang, Lei Hou, Bin Xu, Juanzi Li
TrajDebug提出错误生命周期追踪框架,通过多粒度历史压缩和基于证据的错误识别,解决长轨迹中的错误发现难题。该框架追踪每个错误的解决状态和终端影响,实现关键归因。研究构建了TrajErrBench基准,包含来自Tau2Bench和SWE-Bench Pro的486个手动标注失败轨迹。实验表明TrajDebug在多个智能体基准上优于现有基线,其诊断结果可提升下游智能体成功率。
推荐理由:TrajDebug能从长轨迹里精准揪出导致最终失败的那个错误,486条真实数据验证过,比现有方法都靠谱。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。