11:04
11:04 官方一手 arXiv: DeepSeek @Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang 现有LLM交易系统评估忽视智能体经济可行性。论文提出TradeLens工具,从交易记录、运行时轨迹和部署配置重建交易轨迹,归因利润与成本。在DeepSeek-V3.2、GLM-4.7等骨干模型及多种资本规模、交易频率上测试,发现智能能否盈利取决于“智能到利润”转换效率:DeepSeek-V3.2资产选择差,GLM-4.7时机判断为负。资本规模和频率仅放大或削弱决策时机价值,并不改变根本模式。 推荐理由: 想知道LLM交易模型到底能不能赚钱?这篇论文给了诊断工具TradeLens,实测DeepSeek-V3.2选股不行,GLM-4.7择时也翻车,不吹准确率而看利润转化。
稍后读 已读 值得跟进 有用 关注 TradeLens
09:59
09:59 官方账号 arXiv cs.AI @Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao Li SETA是一个可扩展框架,用于生成可验证的终端环境以支持强化学习。其构建的SETA-Env数据集包含超过4500个环境,是当前最大的开源可验证终端RL数据集。使用Qwen3-8B在SETA-Env上训练,在Terminal-Bench 2.0上达到12% pass rate,为8B规模RL训练模型的最佳结果。在DeepSeek-V4-Flash上,同一终端代理基准的pass@1从40%提升至43%,pass@5从54%提升至58%。SETA-Env为终端代理研究提供了高质量的训练环境。 推荐理由: 终端代理训练数据难找,SETA开源了4500+环境的RL数据集,Qwen3-8B训后Terminal-Bench拿到12%,顺带还让DeepSeek-V4涨了分,搞终端AI的别错过。
稍后读 已读 值得跟进 有用 关注 SETA
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档 (侧边栏 → AI 日报 → 顶部「往期日报」)。