AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

复杂度验证

共 1 条相关 AI 资讯
8月11日
10:46
10:46官方一手arXiv: DeepSeek@Abdalla Doleh, Toni Somers, Ratna Babu Chinnam
该研究开发了一个自动化流程,用大语言模型生成结构化决策场景,并通过基于任务复杂度理论的复合框架验证其复杂度。研究评估了4,238个场景,五个独立模型家族的一致性近乎完美,组内相关系数达0.997,kappa值为0.971。已知组效度显示各复杂度层级间分离明显,eta-squared为0.587,所有配对比较p值小于0.001。因子分析显示一个主导的复杂度构念,载荷在0.87到0.96之间,交互性构成较弱的次要维度。Llama 4 Maverick生成速度最快,每分钟134个场景,而DeepSeek Chat V3.2在领域覆盖和模式合规性上更均衡。
论文LLM决策场景复杂度验证

推荐理由:这篇论文讲怎么用LLM自动造认知决策场景,还验证了复杂度靠谱,做AI评估或心理学实验的可以看看。
原文
精选全部日报登录