AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

LLM-SRBench

共 2 条相关 AI 资讯
8月6日
09:33
09:33官方账号arXiv cs.AI@Wenxiao Zhao, Dong Liu, Kaiyi Xu, Feng Liu, Zhen Zhao, Fei Ben, Shu Wang, Wenhao Li, Yingnian Wu, Fenghua Ling, Haobo Li, Lei Bai
A-SR是一个自演化的智能体框架,用于从数据中发现闭式方程,将控制单元从表达式编辑转为角色条件证据视图。在LLM-SRBench的四个LSR-Synth科学领域上,A-SR将Acc@0.01从基线25.79%提升至48.30%(基于Llama3.1-8B),A-SR-LoRA将Qwen3-4B的结果从24.58%提升至38.29%。在四个真实世界科学发现任务中,A-SR在8项报告指标中的7项上取得最佳归一化均方误差。框架通过在线评估器奖励策略和状态路由过程记忆,在单次运行中无需更新参数即可自适应搜索,跨运行轨迹还可蒸馏为开源LLM的角色条件先验。
论文A-SR符号回归智能体

推荐理由:符号回归老被单一大模型提示词卡住,这个A-SR让不同智能体分工盯不同失败信号,准确率从25%拉到48%,还开源蒸馏路子,值得看一眼。
原文
7月7日
11:46
11:46官方一手arXiv: DeepSeek@Pan Li
精选
论文审计了LLM作为进化引擎在科学方程发现中的效果,发现父代条件进化与独立采样无显著差异:中位OOD NMSE分别为0.045和0.049。新方法PTB-Search仅需一次LLM采样,通过集合级稀疏选择在717个测试中解决165-169个,而单术语方法仅74-78个。在239个问题的LLM-SRBench上,PTB-Search用Llama-3.1-8B达到73.2% Acc0.1,用DeepSeek-V4达到77.0%,是最好基线(49.2%)的1.5倍以上,且调用预算仅十分之一。
论文PTB-SearchLLM-SRBench科学发现

推荐理由:别浪费算力跑进化循环了——这篇论文实测发现多轮迭代没用,用一次采样加集合选择反而效果翻倍,还省了90%的调用成本。
原文
精选全部日报登录