#大模型评估

共 2 条 · 7 天 1 条 · 30 天 1 条
信息流里打上「大模型评估」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月7日
5月27日
MeDial-Speech:111小时医患对话数据集发布,Claude Sonnet 4 表现最佳

医疗 AI 终于有了真实场景的语音对话基准——111 小时医患对话数据,覆盖四种疾病,做医疗对话系统的团队可以直接拿来训练和测试模型。Claude Sonnet 4 在句子选择上领先,但所有模型都过度自信,这个发现值得关注。

arXiv: DeepSeek@Heriberto Cuayahuitl, Grace Jang原文