论文10:33自动数值重映射攻击揭示LLM算术推理脆弱性做LLM评估和推理优化的团队会关心——GSM8K的脆弱性说明基准测试可能高估了模型的真实推理能力,建议关注数值变化对模型泛化的影响。#LLM#算术推理#鲁棒性#数值重映射1 个信源在谈事件专题aarXiv: DeepSeek@Malia Barker 等 4 人2 个信源在谈原文稍后读已读值得跟进有用关注 LLM