8月14日
12:30
12:30官方账号Greg Brockman@gdb
73°
OpenAI 预览了 GPT-5.6 Sol 的 Ultrafast 模式,推理速度最高可达 14 倍。该模式将率先通过 OpenAI API 向选定客户开放,后续随容量增长扩展至更多企业。目前该模式仅处于 API 预览阶段,具体价格与正式上线时间尚未公布。
事件专题

推荐理由:OpenAI 刚展示了 GPT-5.6 Sol 的 Ultrafast 模式,速度拉到 14 倍,API 客户能先尝鲜。
12:22
12:22官方账号arXiv cs.AI@Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li
AutoDesign是面向长周期智能体设计的框架,能将多模态源转化为结构化媒体输出,聚焦论文到海报生成任务。该框架引入PosterBench基准,主轨含100篇论文,横跨五个学科,验证子集含10篇。在主轨上AutoDesign得分78.32,超过闭源系统Claude Design 7.45分。在七个受控配置中,加入DesignHarness将平均得分由54.99提至67.39,提升12.4%。完全自主循环中它执行253次工具调用和11轮编辑,40分钟内成本低于3美元。
推荐理由:AutoDesign能自动把论文变海报,PosterBench上比Claude Design高7.45分,40分钟成本不到3美元。
12:19
12:19官方账号arXiv cs.AI@Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang, Zekai Li, Chenghuai Lin, Xinqiang Yu, Wenyao Zhang, He Wang, Li Yi
HumanTracker 基准包含约153小时专业表演者的光学运动轨迹,覆盖四类运动族并带有文本标签。HumanScore 指标基于12K运动对(共24K运动)训练,用于对齐人类偏好。在代表性 SOTA 跟踪器上,HumanScore 能比运动学指标更准确地预测人类偏好,揭示脚部滑动和触地时机等接触稳定性问题。
推荐理由:想评估人形机器人运动跟踪效果?HumanTracker 提供了153小时专业动作数据和更符合人眼判断的 HumanScore,能发现脚滑、触地不准这类关键问题。
12:05
12:05官方账号arXiv cs.AI@Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech
DFM Mimir v1是丹麦基础模型团队发布的10亿参数语言模型,基于HRM架构从零训练。该模型仅使用许可的后训练数据,混合了161个数据集进行训练。在20个英语、数学与代码及丹麦语基准上,Mimir v1超过HRM-Text 1B,并可与Qwen 3.5 4B和Gemma 4 E2B竞争。它在丹麦语任务上刷新了最先进水平,模型现已在Hugging Face Hub开放下载。
事件专题

推荐理由:丹麦团队开源了10亿参数的Mimir v1,只用合规数据就追上4B模型,丹麦语还是第一。
12:03
12:03官方账号arXiv cs.AI@ AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao
AlayaWorld v1.1技术报告发布,提出改进版交互式长时程世界建模。新版本将空间记忆由深度扭曲法改为流式3D点缓存渲染器。视觉条件被编码到与生成视频一致的因果VAE潜空间中。具体包括六处修改:采用运动感知潜条件、因果编码重渲染空间记忆等。报告未改变主干架构与分块自回归生成方案。
推荐理由:AlayaWorld v1.1报告出来了,空间记忆换成了3D点缓存渲染,条件编码统一到因果VAE,做世界模型的值得瞄一眼。
11:59
11:59官方账号arXiv cs.AI@Saisha Shetty, Satvik Tripathi, Austin Lin, Colin Zhao, Theodore Kim, Don Enwerem, Jacinta Arnold, Shahriar Faghani, Tessa S Cook
MARC v1 是一个面向临床推理的开源多智能体框架,替代单体 LLM 提示方式。框架协调提取、推理、答案生成和评估四类角色智能体,中间输出可追踪,支持分阶段错误归因。Decomposer 模块能从自然语言描述自动生成任务提示,省去手工提示工程。该框架支持 API 和本地 CPU 部署,全部配置通过 YAML 完成。代码已发布在 GitHub 上。
推荐理由:宾大开源了临床AI框架MARC,用多智能体分工替代大提示词,Decomposer自动生成提示,改配置就行,不用写代码。
11:49
11:43
11:43Aravind Srinivas@AravSrinivas
精选
Perplexity宣布将Sonar迁移至Agent API。该API在保持联网搜索的基础上,新增多步研究、代码执行、内建工具,并可通过单一接口访问多种模型。在BrowseComp和WideSearch基准上,Agent API的得分超过Sonar最佳成绩的两倍。
推荐理由:做联网搜索Agent?Perplexity Agent API支持多步研究、代码执行,基准分翻倍,值得一试。
11:37
11:37官方账号arXiv cs.AI@Alison R. Panisson, Maria Eduarda W. M. Vianna, Italo Firmino da Silva, Heitor Henrique da Silva, Rafaela Fernandes Savaris, Bernardo Pandolfi Costa, Martin Augusto Gagliotti Vigil, Jim Lau, Agenor Hentz, Andréa Sabedra Bordin, Alexandre Leopoldo Gonçalves, Roberto Rodrigues-Filho
巴西圣卡塔琳娜联邦大学(UFSC)的论文提出人工智能学术联盟(LIA)的组织框架,用于整合教学、科研和大学推广。该框架采用学生中心、项目驱动的运作方式,强调民主治理和协作学习。文中展示的实践项目涵盖竞赛团队、学习小组、公开讲座、知识库和AI社会应用。这些案例说明了如何在统一组织结构下培养技术能力和横向能力,并为工程和计算机教育提供可复制的模型。
推荐理由:UFSC的LIA论文讲了AI社团怎么组织竞赛队、学习小组和公益项目,搞高校AI社团的可以参考。
11:33
11:33官方账号arXiv cs.LG@Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell, Wieland Brendel
研究者推出LITTLECURRICULUM,一个包含880亿token的预训练语料库,内容限定为美国小学五年级以下的知识范围。他们用该语料从头训练出5B参数的LittleLearner模型,模型语言能力足以进行开放式评测,但知识边界清晰对应课程大纲。实验表明,通过后训练和上下文学习注入新知识,LittleLearner能更好利用已有知识,但无法提升超出课程范围的能力。该研究为可控条件下研究模型知识获取提供了沙盒环境。
推荐理由:想搞懂模型知识边界怎么控制?这篇论文用小学课程语料训练了个5B模型,还公开了数据和模型,适合研究预训练数据影响的人看。
11:29
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song
精选
Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。
推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。