论文Agent 与开发者精选09:13研究提出延续式因果测试:CoT 在难题上才真正影响答案拿 Gemma、Llama、DeepSeek 三个模型做了个挺狠的测试:简单题模型根本不看自己的推理,难题上错误会一路传到底,这对做 CoT 监控的人是个警告。#Chain-of-Thought#DeepSeek-R1#Gemma-2#GSM8KaarXiv: DeepSeek@Renee Jia, Di Mu原文稍后读已读值得跟进有用关注 Chain-of-Thought
论文09:26数据库失败时如何安全恢复:面向任务对话中LLM的轻量级提示策略论文用实际数据告诉你,数据库出错时LLM会瞎编内容,但加个简单提示就能把幻觉砍掉一半。不用重训模型,看各家的差距有多大。#DeepSeek-R1#Gemma-2#Llama-3#MistralaarXiv: DeepSeek@Mohammad Alijanpour Shalmani 等 3 人原文稍后读已读值得跟进有用关注 DeepSeek-R1