11:42官方一手arXiv: OpenAI@Amogh Raina, Ilias Chalkidis, Daniel Hershcovich, Henrik Palmer Olsen研究人员评估了OpenAI GPT 5.4模型在欧洲人权法院案例中的法律推理能力。研究发现该模型在法律推理方面得分远不理想,产生结构完整但实质浅薄的分析。专家策划的提示策略虽带来更全面的推理,但并未提高预测准确性。LLM作为评估者内部一致但与人类评估者对齐度低,不适合替代人类评估。论文GPT-5.4ECtHROpenAI4 个信源在谈事件专题推荐理由:OpenAI最新研究测试了GPT-5.4在法律推理上的表现,结果发现AI法官还差得远呢。原文稍后读已读值得跟进有用关注 GPT-5.4