10:35官方一手arXiv: DeepSeek@Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song研究提出ReguSim和ReguBench,用于评估金融市场中LLM智能体在规则归因方面的表现。DeepSeek V4 Pro和Gemini 3.5 Flash在规则指导下减少了违规行为,但未完全消除。激励或角色框架可改变行为。研究表明,除非展示执行证据,否则交易者的理由可能误导独立监控者。在监控中,简单的结构化基线与仅提示的LLM相当或更优。结果将金融合规评估视为对规则归因行动和证据使用的审计,而非单一合规评分。论文ReguSim金融合规LLM智能体推荐理由:这篇论文提出了一个评估LLM智能体在金融合规中规则归因的新方法,值得一读。它通过实验展示了规则指导如何减少违规行为,并强调了监控的重要性。原文稍后读已读值得跟进有用关注 ReguSim