#评估
共 61 条 · 7 天 0 条 · 30 天 11 条
信息流里打上「评估」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月30日
9月29日
9月25日
LangChain 推出秋季 AMA 系列,9/30 起三场讲解 LangSmith
LangChain 9 月底连办三场 AMA,手把手教 LangSmith 评估 Agent 和部署 Deep Agents,做 Agent 开发的可以直接去提问。
9月23日
LangChain 9月30日直播:用 LangSmith Tuned Evaluators 做线上评估
LangChain 9月30日有场直播,教你用 LangSmith 的 Tuned Evaluators 自动给生产环境的 agent 交互记录加反馈,做线上评估的可以看看。
9月21日
9月19日
AI Agent 评估多数团队从搭平台、接 LLM judge、看分数开始
教了700+工程师的Hamel Husain和sh_reya说,评估AI Agent要先手动读100条真实trace找失败模式,而不是先搭平台接LLM judge看分数。
9月14日
9月13日
9月10日
8月25日
8月21日
8月16日
LangChain CEO谈Own Your Intelligence:Agent三要素与数据飞轮
LangChain创始人讲Agent怎么搭:模型权重自持,harness可配置,评估用Harbor,LangSmith跑数据飞轮,干货多。
8月14日
LangChain创始人谈智能体三要素:框架、模型与上下文
红杉活动上,LangChain创始人聊了智能体三件套:框架、模型、上下文。他说越偏离模型训练数据,越该自己造框架。还演示了LangSmith Engine怎么做评估。
8月11日
8月10日
7月30日
7月29日
7月23日
7月21日
7月15日
Perplexity AI发布WANDR:智能体实体发现与事实验证评测基准
Perplexity AI搞了个新评测WANDR,专门看智能体能不能找到一堆实体并核实每个的具体信息,比单一评分更清楚哪里不行。
7月9日
用 Terraform 配置 LangSmith 在线评估与监控
Adam 分享了用 Terraform 管理 LangSmith 在线评估的实操方法,让监控和告警像基础设施一样可编排,适合用 IaC 的团队。
7月7日
7月3日
论文09:57
LLM-as-a-Judge在多语言和低资源语言中的挑战与建议这篇论文很实在,直接指出LLM-as-a-Judge在多语言场景下不靠谱,只找出33篇相关研究还一堆问题。做NLP评估的朋友建议看看。
7月2日
6月29日
LangChain发布DeepAgents Harness与LangSmith Sandboxes等新组件
LangChain把智能体测试、沙箱和评估整合到一起了,企业可以自己掌控从模型选择到部署的全流程,不用再拼凑各种工具。
6月28日
6月27日
6月26日
LangChain 在 AI Engineer World's Fair 设展台,欢迎来访
LangChain 团队在旧金山 AI Fair 设摊,聊聊智能体生产部署和评估,想去交流的记得去 U-G19 找他们。