12:19官方账号arXiv cs.AI@Atharva Pandey, Gautam Jajoo论文提出一个审计框架,通过94名受访者的防晒霜概念测试,将人类开放理由映射为符号推理状态(正负号表示支持或拒绝)。人类理由能显著提升购买意图的预测准确率。LLM 模拟的理由虽然听起来合理,但多重复概念板内容,而非真实受访者的接受或拒绝路径。该框架提供了一种可解释的测试方法,检查 LLM 模拟器的理由是否与人类证据一致。论文LLM社会模拟器审计框架推荐理由:这篇论文告诉你,LLM 当模拟器时可能答对结果但用错理由。作者用94人的防晒霜测试证明了这一点,并提供审计方法。原文稍后读已读值得跟进有用关注 LLM
09:51官方账号arXiv cs.AI@Yuan Gao, Jiangyi Yang, Yao Zhao, Yichi Zhang本文在9人狼人环境中评估LLM智能体,构建了可审计框架以维护外部信念状态并记录信念更新与行动偏差。在1080局游戏中,主动信念条件使好人方胜率从0.205升至0.390(McNemar χ²=16.4, p<0.001),且不可逆的女巫毒药错误减少。但行动-信念一致性仅约0.21,且仅将信念给狼人比仅给好人更有利,表明机制未明。该框架使效应可测量,暴露低一致性,并以证据拒绝不可靠的强制消费干预,将信念定位为高噪声隐藏信息游戏中的可审计认知基线。论文LLM AgentWerewolf智能体推荐理由:这篇论文把LLM智能体在狼人杀中的信念和行为拆开审计,发现加信念能让好人胜率从20%提到39%,但行动和信念不太一致,框架本身是个好工具。原文稍后读已读值得跟进有用关注 LLM Agent
02:47官方一手Google Research: Blog(资讯)Google 研究团队提出了一种新的框架,用于审计机器学习模型是否真正实现了“遗忘”功能。该框架通过设计特定的攻击和测试方法,能够有效评估模型在删除特定数据后是否仍保留了相关信息。这项工作对于负责任的人工智能、隐私保护和数据安全至关重要,尤其是在用户要求删除个人数据的场景下。框架提供了可量化的评估指标,帮助开发者和监管机构验证模型遗忘的可靠性。论文机器学习数据遗忘隐私保护推荐理由:隐私合规团队和 AI 安全研究者终于有了可操作的遗忘验证工具——Google 的审计框架让“数据被遗忘权”不再是空话,做模型治理和合规的团队建议点开看看具体方法。原文稍后读已读值得跟进有用关注 机器学习
14:26官方账号arXiv cs.AI@Payal Chandak, Victoria Alkin, David Wu, Maya Dagan, Taposh Dutta Roy, Maria Clara Saad Menezes, Ayush Noori, Nirali Somia, John S. Brownstein, Ran Balicer, Rebecca W. Brendel, Noa Dagan, Isaac S. Kohane, Gabriel A. Brat精选医学伦理天然具有多元性,但大型语言模型在提供医疗建议时可能隐含单一的价值偏好。研究者提出了一个审计框架,包含临床验证的伦理困境基准和从决策中恢复价值优先级的方法。前沿模型在讨论伦理冲突时能展现观点多元性,但个体决策几乎确定,无法复现医生群体的分布性多元。多数模型的价值优先级在医生变异范围内,但部分模型显著低估患者自主权。若不加干预,单一模型可能将自身价值偏好大规模强加给所有患者,取代临床伦理的多元性。论文AI伦理医疗AI价值多元性推荐理由:这篇论文揭示了AI医疗建议中隐藏的价值偏见问题,做医疗AI开发或临床决策支持的团队值得关注——它提醒我们,模型不只是输出答案,还在无声地传递伦理立场。原文稍后读已读值得跟进有用关注 AI伦理
19:11官方一手arXiv: OpenAI@Gabriela Dobrita, Simona-Vasilica Oprea, Adela BaraCHAINTRIX提出了一种端到端的智能合约审计框架,核心设计是确保每个LLM生成的声明都能通过确定性结构合约表示进行验证。该框架引入跨合约交互模型(CCIM),将Solidity代码解析为函数级操作的结构化映射,支持12个确定性信号引擎和并行LLM审计管道。此外,通过引入结构判决引擎(SVE)执行确定性结构检查,并结合符号执行和模糊测试来过滤低置信度发现。在EVMbench基准测试中,CHAINTRIX达到了71.7%的高危漏洞召回率,超越最强前沿模型26个百分点,部分审计实现100%召回,显著提升了审计的准确性和可靠性。论文智能合约LLM/增强安全审计推荐理由:该工作为智能合约安全审计提供了一种结合LLM与确定性分析的有效方案,解决了LLM幻觉和传统静态误报问题,对DeFi安全领域具有实际参考价值。原文稍后读已读值得跟进有用关注 智能合约