8月25日
10:46
10:46官方账号arXiv cs.AI@Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao
EarthVerse基准测试通过405个可复现任务评估科学智能体,基于199个记录事件和19种灾害类型。评估25个模型和智能体系统,平均答案单元准确率为84.65%,最高Strict@95为34.81%。测试显示当前智能体常在单个步骤完成,但缺乏跨证据、尺度、单元、计算和物理解释的一致性链。EarthVerse为测量动态地球系统中端到端科学可靠性提供可复现基础。
推荐理由:EarthVerse基准测试为评估科学智能体提供了全面的方法,揭示了当前智能体在跨证据和尺度上的不足,值得专业人士关注。
8月14日
11:08
11:08官方账号arXiv cs.LG@Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou
Intern-S2-Preview 是一系列面向科学发现的智能体基础模型,支持多模态科学理解、推理、生成和长周期任务。训练流程包含科学多模态预训练、监督微调、多任务强化学习及智能体 RL,并引入部分 rollout、自适应长度正则化等技巧提升稳定性。其中 Intern-S2-Preview-397B 在 SciTS 时间序列基准上取得领先表现,同时其时间序列模块增强了科学信号理解与预测。独立的 Intern-MemDec-4B 扩展将 Biology-Instructions 平均分从 56.92 提升至 60.32,且无需修改冻结的 397B 主干。
推荐理由:这个科学智能体模型能处理多模态数据,397B 版在时间序列预测上很强,还有个 4B 小模型能直接把生物任务分数拉高,适合搞科研的人看看。
7月17日
19:16
19:16量子位@量子位的朋友们
精选
上海AI Lab在WAIC 2026上发布科学智能体新基座模型Mobius,参数量为397B,性能追平万亿参数模型。Mobius采用非Transformer架构,专攻科学领域任务,不做泛化通用问答。该模型在多个科学基准上达到SOTA,例如在MoleculeNet数据集上准确率提升12%。
推荐理由:上海AI Lab用397B参数的非Transformer架构Mobius,追平了万亿模型,专攻科学智能体,不是通用问答那一套。