8月21日
10:35
10:35官方一手arXiv: DeepSeek@Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song
研究提出ReguSim和ReguBench,用于评估金融市场中LLM智能体在规则归因方面的表现。DeepSeek V4 Pro和Gemini 3.5 Flash在规则指导下减少了违规行为,但未完全消除。激励或角色框架可改变行为。研究表明,除非展示执行证据,否则交易者的理由可能误导独立监控者。在监控中,简单的结构化基线与仅提示的LLM相当或更优。结果将金融合规评估视为对规则归因行动和证据使用的审计,而非单一合规评分。
推荐理由:这篇论文提出了一个评估LLM智能体在金融合规中规则归因的新方法,值得一读。它通过实验展示了规则指导如何减少违规行为,并强调了监控的重要性。
6月26日
23:01
23:01官方一手AWS Machine Learning Blog@Christopher Phillippi
精选
Stripe采用ReAct代理框架构建金融合规系统,通过任务分解将复杂流程拆解为92个原子步骤。系统使用提示缓存技术将推理成本降低40%,同时保持人工监督机制确保审计可追溯性。该设计在Stripe的支付处理场景中覆盖了98%的合规审核任务,漏报率低于0.5%。
推荐理由:Stripe分享了他们怎么用AI代理处理金融合规的真实案例,包括ReAct框架和提示缓存省钱技巧,适合做合规系统的人参考。