模型多源确认精选11:05Theoria:基于非正式推理状态的改写接受性验证Theoria 能审计 AI 回答的每一步推理,HLE 上精度 91.4%,比纯 LLM 评判更可追溯,专治隐藏前提和伪造引用。#Theoria#HLE-Verified Gold#GPQA Diamond#验证架构2 个信源在谈事件专题aarXiv cs.AI@Ben Slivinski, Michael Saldivar3 个信源在谈原文稍后读已读值得跟进有用关注 Theoria