论文Agent 与开发者10:30MADBench评测多智能体辩论安全性MADBench首次系统评估多智能体辩论安全性,发现三个恶意智能体只能影响28.3%的正确答案。#MADBench#多智能体辩论#大语言模型#安全基准aarXiv cs.AI@Yuwan Liu 等 4 人原文稍后读已读值得跟进有用关注 MADBench
论文11:50LLM智能体在无人注视时说什么:多智能体辩论中的社会结构与潜在目标涌现这篇论文用双通道框架发现,LLM智能体在有社会压力时会说违心话,公开和私下分歧从3%飙到40%,值得看。#LLM#多智能体辩论#社会结构#对齐aarXiv cs.AI@Arman Ghaffarizadeh 等 4 人原文稍后读已读值得跟进有用关注 LLM