事件专题 ·官方一手

OpenAI 发布 MentalHealthBench:评估 AI 心理健康对话的安全性

OpenAI 推出 MentalHealthBench,一个由专家参与构建的基准,用于评估模型在真实心理健康对话中的回复质量。该基准重点衡量 AI 回复是否有帮助和安全,例如面对自伤、焦虑等敏感话题时的表现。它为比较不同模型在心理健康场景下的可靠性提供了统一测试标准。

当前结论

OpenAI 做了个心理健康对话评测集,专门测模型遇到自伤、焦虑这类敏感问题时答得稳不稳,各家模型能拿它来横向对比。

11 个信源53° AI 热度最后更新 2026/9/23 10:00:00

证据链

11 个信源
相关来源 2VTV Công nghệ
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。