论文官方一手

OpenAI 发布 MentalHealthBench:评估 AI 心理健康对话的安全性

Introducing MentalHealthBench

精选理由

OpenAI 做了个心理健康对话评测集,专门测模型遇到自伤、焦虑这类敏感问题时答得稳不稳,各家模型能拿它来横向对比。

OpenAI 推出 MentalHealthBench,一个由专家参与构建的基准,用于评估模型在真实心理健康对话中的回复质量。该基准重点衡量 AI 回复是否有帮助和安全,例如面对自伤、焦虑等敏感话题时的表现。它为比较不同模型在心理健康场景下的可靠性提供了统一测试标准。

原文 · OpenAI Blog

Introducing MentalHealthBench

MentalHealthBench is an expert-informed benchmark for evaluating helpful and safe AI responses across realistic mental health conversations.