一篇讲怎么给金融 Agent 打分的论文:专家定规则,Agent 生成评分标准,还附带 100 个查询的基准,做金融评估的可以看看。
#评估基准
共 22 条 · 7 天 0 条 · 30 天 2 条
信息流里打上「评估基准」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月29日
FinAutoRubric:专家引导的金融研究 Agent 自动评分标准生成
9月22日
8月11日
8月5日
LongHorizon-Harness:评测真实世界长时程智能体
有人发了 LongHorizon-Harness,一个专测长时程智能体的框架,论文在 Hugging Face,想评估多步任务表现可以看。
7月28日
7月21日
7月7日
论文11:20
SovereignPA-Bench:评估用户拥有的个人代理在意图演变、平台调解和同意约束下的表现这篇论文提出了一个评估个人代理的新基准 SovereignPA-Bench,不仅看任务完成,还关注隐私和同意。对研究AI代理安全的人很有参考价值。
7月1日
6月30日
6月29日
6月17日
6月10日
前沿编程智能体用元编程适应陌生语言,Claude Opus 4.6 和 GPT-5.4 表现突出
做 AI 编程智能体或评估基准的团队,这篇论文揭示了主流基准(如 SWE-Bench)掩盖的能力差距——强智能体在陌生语言上的元编程策略值得借鉴,建议点开看具体实现方法。
6月8日
6月4日
EVA-Bench Data 2.0:3领域121工具213场景
企业 AI 智能体评估终于有了更贴近真实场景的基准——3 领域 121 工具覆盖 IT、HR、客服,做企业级 AI 落地的团队可以直接用这个数据集来测试自己的智能体。
5月26日
5月20日
OpenComputer:为计算机使用智能体构建可验证软件世界
OpenComputer 解决了计算机使用智能体评估缺乏可靠验证的问题,做智能体开发和自动化研究的团队可以直接用它来测试和训练模型,比 LLM 裁判更靠谱。
5月18日
5月12日
5月11日
论文11:43
SCOPE:复杂图像生成的结构化分解与条件技能编排该工作首次系统定义了图像生成中的语义承诺概念及其生命周期断裂问题,并提供了可操作的框架和评估基准。对追求高可控性图像生成的从业者来说,SCOPE展示了结构化规范追踪如何提升复杂交互场景下的生成质量。
arXiv cs.AI原文