8月11日
12:47
12:47官方账号arXiv cs.LG@Lecheng Kong, Like Hui, Haitao Mao, Jun Huan
论文指出基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上会崩溃,因为高置信度常表示探索失败。作者提出Consilience框架,通过评估推理中置信度的时间不对称性,惩罚初始高置信度并要求最终确定性。在研究生级数学问题和自由形式代码生成实验中,Consilience优于现有基线。
推荐理由:如果你做推理模型,这个框架能解决置信度评分在复杂任务上失效的问题,用时间不对称性挑出真正靠谱的答案。
7月1日
09:40
09:40官方账号arXiv cs.LG@Zena Al-Khalili, Rafi Hakim, Dietrich Klakow, Ji-Ung Lee
Fork-Think提出一种新范式:先通过模型置信度在单条路径上识别分流点,再触发多分支采样并聚合。在三个模型和三个推理基准上,相比并行思考,Fork-Think节省了30%的token消耗和57%的推理时间,性能持平或更优。结合早停和加权投票后,无需预热即可达到现有最优方法。
推荐理由:Fork-Think让LLM推理更省钱省时间——先找准关键点再思考,token少用30%,速度快57%,效果还不输并行方法。