01:14Geek@geekbb71°网友 geekbb 发帖吐槽 DeepSeek Harness,称内测需上传身份证并签署保密协议,流程繁琐。该网友表示产品难以上手,离开 AI 辅助甚至无法启动,质疑体验像国企外包。他还提到有人用 AI 生成大篇幅的 Harness 图片版功能介绍,并调侃 deepseek-v4-flash 能否按涨价前价格计费。AI产品DeepSeekDeepSeek Harnessdeepseek-v4-flash10 个信源在谈事件专题推荐理由:看看网友怎么吐槽 DeepSeek Harness 的内测门槛和上手难度,还有 deepseek-v4-flash 的涨价梗。原文稍后读已读值得跟进有用关注 DeepSeek
10:48官方一手arXiv: DeepSeek@David M. Markowitz, Timothy R. Levine该研究构建了7个基于主流欺骗理论的RAG模型,在5个公开数据集、700条陈述上测试,涉及gpt-4o、claude-sonnet-4-6、ollama/llama3、deepseek-v4-flash四个大模型,共生成39,200次欺骗判断。RAG模型准确率54.5%,基线模型54.6%,两者无显著差异,均与人类水平相当。RAG模型(57.0%)比基线模型(59.7%)更少出现真实性偏差,但效应量很小。不同理论对准确率影响不大,但对响应偏差影响显著,从可验证性方法的32.2%到真相默认理论的88.1%。论文RAG欺骗检测gpt-4o7 个信源在谈事件专题推荐理由:想看看AI能不能识破谎言?这篇论文用4个模型做了近4万次测试,结论是准确率跟人差不多,但不同理论引导下AI的倾向差异很大。原文稍后读已读值得跟进有用关注 RAG
00:01elvis@omarsar0OpenCode 数据显示开源模型使用情况。GLM-5.2 仍被低估。deepseek-v4-flash 在智能体任务上表现惊喜,便宜高效。AI模型GLM-5.2deepseek-v4-flashOpenCode2 个信源在谈事件专题推荐理由:推主分享了OpenCode上的模型使用数据,发现deepseek-v4-flash当子代理既便宜又高效,GLM-5.2被低估了。原文稍后读已读值得跟进有用关注 GLM-5.2