事件专题 · 官方一手

Zing框架提升LLM社会智能:SoMBench基准与Actio推理架构

Zing是一个集成框架,用于测量、内化和落地LLM的社会智能。其评估基准SoMBench覆盖3个主要维度、17个次要维度和71个任务范式,包含284个共享场景和3481个专家验证实例。在20个代表性LLM上的评估显示最高准确率仅72.08%,17个次要维度均未达90%。Zing训练方法在5个社会认知基准上持续超越基础模型,其中Zing-27B-Stage2取得最高平均分,Zing-32B-Stage2与DeepSeek-V4-Pro竞争。Actio推理架构通过PRISM、Starling、SAGE和门控RAG四种支持,在15个模型-基准对中提升14个。

当前结论

这篇论文发布了一个综合框架,让你看到当前LLM在社会智能上的短板(最高才72%),并提出Zing训练和Actio推理搭配,能显著提升表现。想了解模型怎么更懂社交规矩的可以看看。

2 个信源31° AI 热度最后更新 2026/7/26 16:25:45

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情