10:46官方一手arXiv: DeepSeek@Abdalla Doleh, Toni Somers, Ratna Babu Chinnam该研究开发了一个自动化流程,用大语言模型生成结构化决策场景,并通过基于任务复杂度理论的复合框架验证其复杂度。研究评估了4,238个场景,五个独立模型家族的一致性近乎完美,组内相关系数达0.997,kappa值为0.971。已知组效度显示各复杂度层级间分离明显,eta-squared为0.587,所有配对比较p值小于0.001。因子分析显示一个主导的复杂度构念,载荷在0.87到0.96之间,交互性构成较弱的次要维度。Llama 4 Maverick生成速度最快,每分钟134个场景,而DeepSeek Chat V3.2在领域覆盖和模式合规性上更均衡。论文LLM决策场景复杂度验证推荐理由:这篇论文讲怎么用LLM自动造认知决策场景,还验证了复杂度靠谱,做AI评估或心理学实验的可以看看。原文稍后读已读值得跟进有用关注 LLM