16:18shao__meng@shao__meng72°RSI-Exam量化RSI基准,测试智能体通过自主实验改进方法,覆盖6大领域88项任务,Claude和GPT表现突出,仍有改进空间。AI模型RSI-Exam智能体基准测试推荐理由:RSI-Exam测试了LLM自演化能力,Claude和GPT表现优异,值得一看。原文稍后读已读值得跟进有用关注 RSI-Exam