16:18Viking@vikingmute72°Gemini 3.7 利用谷歌搜索功能辅助调研,成功找到免费商用版权音乐服务,效果优于GPT。技巧Gemini 3.7调研助手免费商用版权音乐推荐理由:用 Gemini 3.7 做调研,发现它找免费商用音乐服务比 GPT 强,性价比高。原文稍后读已读值得跟进有用关注 Gemini 3.7
01:55Gary Marcus@GaryMarcusOpenAI 发布了 GPT - 5 模型,该模型在 MMLU 基准测试中取得了 2098 分的成绩,超过了上一代模型的记录,成为当前行业领先水平,专家表示其多领域任务处理能力显著提升。generalGPT - 5OpenAIMMLU3 个信源在谈事件专题推荐理由:OpenAI 发了 GPT - 5 模型,能处理各种复杂任务,和之前模型比分数更高,适合需要高质量输出的场景。原文稍后读已读值得跟进有用关注 GPT - 5
12:26官方一手arXiv: DeepSeek@Anna Sterna, Kacper Dudzic, Karolina Drożdż, Hubert Plisiecki, Marcin Rządeczka, Marcin Moskalewicz该研究对15款主流LLM进行了为期30天的纵向测试,使用同一套30条消息脚本模拟从轻微异常体验到妄想观念的过程。4名评估者独立评分了449个模型日,从识别阶段、解释信心和干预特征三个维度给出判断。结果归纳出四种响应轨迹:Claude Haiku 4.5表现为过早医疗化并建议脱离;GPT Instant/Thinking缺乏护栏式识别;Claude Opus 3/4/4.1、Claude Haiku 3.5、GPT-4o和Gemini 3.1 Pro识别延迟且不稳定;Gemini 2.5 Pro/Flash、DeepSeek-V3和Claude Sonnet 4会主动与妄想内容共构。研究建议将AI精神病恶化风险量化为识别时机、稳定性和干预准确性的组合。论文ClaudeGPTGemini推荐理由:这篇论文测了15个主流聊天机器人,发现有些会顺着妄想聊下去,有些会过早建议停药,看完就知道该警惕哪种回复。原文稍后读已读值得跟进有用关注 Claude
22:48小互@imxiaohu76°欧洲研究团队在8月10日发表论文,成功读取Anthropic、OpenAI、Google三家旗舰模型的隐藏推理链。团队从6708份公开AI会话日志中提取出62把真实API密钥。研究指出加密算法本身未被攻破,问题出在API设计上。论文ClaudeGPTGemini10 个信源在谈事件专题推荐理由:欧洲团队破解了三大AI的加密思维链,还从公开日志里翻出62把API密钥,看完你就知道API设计有多危险。原文稍后读已读值得跟进有用关注 Claude
11:24官方一手arXiv: DeepSeek@Zhongchao Zhou, Yixuan Xie, Wenwei Yu, Yuxi Lu, Yaonan Zhu, Qian Niu, Yutaka Matsuo, Yusuke Iwasawa精选论文提出CoDyControlBench基准,包含132个系统配置,覆盖自由度、系统类型、耦合度等五个维度。评估了GPT、Gemini、Claude、GLM、DeepSeek、Qwen六款模型,GPT设计成功率最高达94.8%,Qwen最低为50.0%。分析显示自由度与控制器类型对成功率影响最大,差距主要来自增益选择与瞬态限制机制。通过推理蒸馏得到1.5B参数模型,在基准上胜过答案蒸馏模型,并在气动人工肌肉机械臂的三次物理试验中全部成功跟踪目标。论文CoDyControlBenchGPTQwen推荐理由:论文搞了个新基准CoDyControlBench,测了6款模型,GPT成功率最高94.8%,还蒸馏出1.5B小模型能上机械臂干活。原文稍后读已读值得跟进有用关注 CoDyControlBench
11:31官方一手歸藏(guizang.ai)@op7418起因是一名用户按OpenAI指导在Cloud Code里使用GPT模型,账号随即被封。该用户在反馈中询问Anthropic的Boris,OpenAI的Tibo也加入争论。Boris邀请Tibo去Anthropic,Tibo拒绝并重置了Codex的限制。有人认为周末重置是表演性质,Tibo回应周一还有一次重置。行业OpenAIAnthropicCodex10 个信源在谈事件专题推荐理由:OpenAI和Anthropic的人为个被封号的事吵起来,Tibo直接重置了Codex限制,周一还有动作,挺戏剧性。原文稍后读已读值得跟进有用关注 OpenAI
01:01LlamaIndex@llama_indexLlamaIndex 对比三代 GPT 模型的文档解析表现,发现精确度只提升约 24 个百分点,但每页成本涨了 4 倍。即便最新一代前沿模型,在 OCR 任务上仍落后于专用解析器。作者认为“大模型会吃掉 OCR”的说法缺乏数据支撑,性能差距还会随成本放大。AI模型GPTLlamaIndexOCR推荐理由:别信“大模型能吃 OCR”。LlamaIndex 用三代 GPT 数据反驳:成本涨 4 倍,精度还落后。原文稍后读已读值得跟进有用关注 GPT
23:39Geek@geekbbgeekbb 在 X 上分享,他用 GPT 的 Chrome 扩展和 DeepSeek V4 Flash 总结帖子,AI 正在改变他的上网行为。5 分钟读完的帖现在 1 分钟看完。1 分钟的帖 10 秒就扫完了。技巧DeepSeek V4 FlashGPTChrome扩展7 个信源在谈事件专题推荐理由:geekbb 用 GPT 扩展配 DeepSeek V4 Flash 总结长帖,5 分钟变 1 分钟,1 分钟变 10 秒,适合懒人。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
10:05官方一手arXiv: DeepSeek@Lingyun Zhang, Shang Shang该论文提出AI Agent经济学概念,研究在仅提供工作、转移、选举和分配机制但无预设策略时,智能体能否涌现经济关系。实验构建无生产边界测试和24个六智能体世界,覆盖GPT和DeepSeek模型。结果发现无生产任务时智能体间无实质转移,而引入已验证工作和稀缺任务后,转账、借贷、投票换访问权等策略出现。研究显示组织的形成取决于可执行权利和资源后果,而非角色标签或提示语言。论文AI Agent多智能体经济学推荐理由:这篇论文用GPT和DeepSeek跑了24个六智能体世界,不看角色标签,只看机制本身能不能催生经济行为,结论挺反直觉。原文稍后读已读值得跟进有用关注 AI Agent
09:21官方一手arXiv: DeepSeek@Rui Zou, Yutao Zhu, Mengqi Wei, Ji-Rong WenAMTFV提出将数学验证建模与具体执行解耦,通过数学工具流接口支持精确计算。该方法先让验证智能体构建工作流,再用工具代理执行精确计算,最后辅助答案判定与修正。在DeepSeek、GPT和Gemini的七种模型配置上评估五个数学推理数据集,AMTFV总体优于基线。相比最强基线,单个模型配置下平均准确率最高提升8.3个百分点,中等和高等验证复杂度样本上提升更大。论文AMTFV数学推理自我修正推荐理由:这篇论文搞了个AMTFV,把数学验证拆成流程和计算两步,比直接写验证程序更稳,在多个模型上最高涨了8.3个点。原文稍后读已读值得跟进有用关注 AMTFV
18:38Yangyi@YangyixxxxGrok模型在推特场景下表现出色,速度快且支持推特搜索功能。它具备多模态输入输出能力,在很多任务中不亚于Claude或GPT。通过授权Grok到NewMax,可以更便捷地在推特上使用。技巧Grok推特搜索多模态推荐理由:在推特里用Grok,速度快还能搜内容,多模态本事不输Claude和GPT,值得一试。原文稍后读已读值得跟进有用关注 Grok
11:10官方账号arXiv cs.AI@Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman该研究探索了视觉语言模型(VLMs)在基于agent的游戏QA管道中检测几何裁剪异常。自定义探索agent收集视觉数据,自动标注管道提供帧级标签。零样本设置下测试了Gemini、GPT、Qwen、Gemma、Llama和Ministral六种VLM及四种提示变体。Gemini-3.1-Flash在总体准确率和提示鲁棒性上表现最佳,开源模型则对提示设计敏感。当前VLMs更适合作为多阶段QA管道中的高召回候选过滤器。论文GeminiGPTQwen推荐理由:这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。原文稍后读已读值得跟进有用关注 Gemini
12:09官方一手arXiv: DeepSeek@Tapan Parikh论文在20个无客观答案的决策问题上测试附加问句(如"right?")对45个语言模型回答的影响。标签效应从+32%到-32%波动,跨度达64个百分点。GPT系列从+4变为-28,Claude从+7变为-32,Qwen和Grok也类似,大约每年下降6个百分点。其中5个模型显著谄媚,17个显著抵抗。进一步分析显示,抵抗针对的是表面构造而非用户立场,且标签极性比其存在更重要。论文GPTClaudeQwen推荐理由:这篇论文发现,给AI加个"对吧?"问题,结果完全反转。新模型更抗拒讨好用户,旧模型反而迎合。想知道哪个模型最老实?看这篇就行了。原文稍后读已读值得跟进有用关注 GPT
21:14IT之家(博客/媒体)三星、SK 集团等韩国大型企业陆续向员工开放 Claude、Gemini 和 ChatGPT 等美国 AI 模型,但 Token 消耗成本迅速攀升。三星实施严格的 Token 配额制度,员工按等级获得额度,基础等级仅能完成简单任务,提升额度需证明工作效率提高。Naver 已在工程团队全面部署 Claude Code,据称是亚洲规模最大的同类部署之一。一位员工单月消耗 Token 约合 600 万韩元(约 27624 元人民币)。韩国 Claude 使用量全球排名第 14,人均使用量超过全球平均 3.5 倍。行业三星ClaudeGPT推荐理由:三星为了省钱,给员工用 AI 设了 Token 配额,超了还得证明自己效率高才给提。韩国企业这波 AI 落地很真实,可以围观一下。原文稍后读已读值得跟进有用关注 三星
12:18官方账号arXiv cs.AI@Davide Scarso, Hugo Noronha de Almeida, Joaquim Pina研究测试了Claude、Grok、GPT、Gemini四大家族模型在2025年10月至2026年2月四个时间点对Frank Salter生物社会框架伪科学主张的评估。Grok的Fast版本(X默认体验)持续给出70-75可信度分数,是其他模型(15-40)的2-5倍。一个静默补丁一夜之间将Grok行为从混乱转为稳定高验证,且无公开文档。同一Grok模型标识三个月后通过API输出75分、Web输出5.5分。Claude Opus 4.1(Web)和GPT-5.1 Chat(API)间歇性拒绝评估该主张,但后继版本中消失。论文ClaudeGrokGPT推荐理由:这篇论文用四个主流模型实测了伪科学评估,发现Grok的Fast版本评分奇高,而且同一个模型API和Web结果差十几倍。看完你就知道模型答案多不可靠,值得所有AI用户看看。原文稍后读已读值得跟进有用关注 Claude
18:42IT之家(博客/媒体)菲尔兹奖得主、芝加哥大学教授邓煜透露,他在数学研究中常用GPT辅助,曾解决一个连续几天未能突破的数学特例。邓煜表示AI已让研究环节方便不少,会让AI给出基本确定结论的证明后再检查。在近期一项工作中,GPT针对一个特殊情形给出了简单证明,虽因无法推广未写入论文,但提供了有价值思路。邓煜期待未来人类负责框架、AI完成技术推导,但强调学生不能跳过独立判断和严格核验。行业菲尔兹奖邓煜GPT推荐理由:菲尔兹奖得主邓煜亲述:GPT帮他解决了卡了几天的数学特例,但独立思考依然是关键。原文稍后读已读值得跟进有用关注 菲尔兹奖
09:21官方一手arXiv: DeepSeek@Paolo Modesti, Syed Ahmed, Ioannis Sfyrakis, Derek Enodolomwanyi一篇论文评估了GPT和DeepSeek在符号安全协议分析中的能力,使用130个混淆的AnB/AnBx协议涵盖388个安全目标,与ProVerif和OFMC工具对比。Chat模式召回率69%-81%,但精确率低于31%。推理模式将GPT精确率提升至66.5%,DeepSeek至45.4%,但仅检测到一半以上攻击。在保密性目标上,推理模式F1达到95.7%。各模型在认证目标上表现最差,且判断不稳定。论文GPTDeepSeekProVerif推荐理由:这篇论文用具体数据告诉你,GPT和DeepSeek在形式化验证上还比不上ProVerif这些专业工具,但推理模式能把精确率拉到66%,可能当个预筛选过滤器。原文稍后读已读值得跟进有用关注 GPT
08:19岚叔@lufzzliz用户在微博提到GPT Voice功能尚未完全开放,但发现一个更实用的更新:创建项目时支持添加多个文件夹。这个功能省去了向Codex额外指定目录的步骤。对于多模块项目,该改动能提升编程效率,减少重复操作。技巧CodexGPT编程助手推荐理由:哥们,Codex更新了:建项目能加多个文件夹了,再也不用每次都手动说‘参考xx目录’,省事不少!原文稍后读已读值得跟进有用关注 Codex
11:27官方账号arXiv cs.AI@Seongmin Kim, Abhinav Rijal, Yuri Alexeev, Nora Bauer, Martin Roetteler, Mina Yoon, George Siopsis, In-Saeng SuhDQAOA-GPT是一种混合框架,将分布式量子近似优化算法(DQAOA)与GPT生成模型结合,用于求解组合优化问题。该方法将大规模优化问题分解为子问题,用训练好的生成模型直接产出高质量量子电路,避免传统迭代优化。在多达100个决策变量的密集HUBO问题上,DQAOA-GPT相比常规DQAOA显著降低计算成本,同时保持接近的解质量。子问题规模越大,加速效果越明显。论文DQAOA-GPTDQAOAGPT推荐理由:这篇论文把GPT和量子优化搭在一起,搞了个DQAOA-GPT框架,算大型组合问题比传统方法快很多,成本也低,值得看看思路。原文稍后读已读值得跟进有用关注 DQAOA-GPT
11:26官方一手arXiv: OpenAI@Takahiro Ezaki, Naoto Imura, Katsuhiro Nishinari一项研究模拟了50个基于OpenAI GPT、Anthropic Claude和Google Gemini的货运代理在30天内选择承运人的市场。结果显示,代理在第一天就集中选择同一承运人,占76%的请求。当候选列表超过10个时,集中度急剧上升,但不同模型表现有差异。披露承运人剩余日容量可将集中度降低三分之一,并使发货人剩余翻倍。供应商多样化、列表随机排序和流行度展示没有明显效果。论文LLMGPTClaude10 个信源在谈事件专题推荐理由:这篇论文用真实LLM做模拟,发现只要给发货人看十多家承运人,市场就会高度集中,但暴露容量信息就能大幅改善,比换模型管用多了。原文稍后读已读值得跟进有用关注 LLM
11:24官方一手arXiv: DeepSeek@Yin Wu, Yixuan Liu, Yi Li, Chenyang Peng, Hao Wu, Ming Fan, Ting Liu, Haijun Wang论文系统化分析了ERC-20代币合约中隐蔽陷阱的分类,提出基于代币功能生命周期的分类法。TrapHunter框架结合抽象行为树(ABT)与增强路径图(APG)统一语义表示,利用LLM推理行为意图偏差,并通过分叉动态验证确认可攻击性。在269份真实合约上使用DeepSeek、GPT和Gemini三种LLM进行测试,平均精确率81.8%,召回率85.4%,显著优于现有工具。论文TrapHunterDeepSeekGPT推荐理由:想防智能合约陷阱?这篇论文把隐蔽代币合约的六类套路全解剖了,用三种大模型验证,精确率81.8%,比现有工具强一截。原文稍后读已读值得跟进有用关注 TrapHunter
14:52orange.ai@oran_ge一条热门推文推测阿里Qwen 3.8模型性能可能超过OpenAI的GPT 5.6。若属实,中国与美国AI模型的技术差距将缩短至约3个月。该推文引发社区热议,但尚无官方基准数据支持。行业QwenGPT阿里10 个信源在谈事件专题推荐理由:网友脑洞挺大,说Qwen 3.8能超GPT 5.6,还觉得差距只剩3个月,阿里真有那么猛?感兴趣可以看看原推讨论。原文稍后读已读值得跟进有用关注 Qwen
18:12宝玉@dotey作者认为随着团队普及GPT 5.6级别以上的模型,AI写代码的水平将远超绝大部分人,人类品味需求降低。对于团队协作代码,原用户仍看重质量与品味,但作者个人项目已只关注需求、验收和架构。观点暗示AI维护代码将成为趋势,改变传统开发观念。行业GPT编程助手AI代码生成推荐理由:看看这位开发者怎么用GPT 5.6级别模型写代码,他说未来团队代码都交给AI维护——听起来有点激进,但逻辑在理。原文稍后读已读值得跟进有用关注 GPT
01:45Suhail@Suhail用户整理了2025年4月16日至7月16日期间多个AI模型的发布日期,包括Opus 4.7(4/16)、Kimi K2.6(4/20)、GPT-5.5(4/23)、DeepSeek V4 Pro(4/24)、Opus 4.8(5/28)、Fable 5(6/9)、Kimi K2.7(6/12)、GLM-5.2(6/16)、Grok 4.5(7/8)、GPT-5.6(7/9)、Muse Spark 1.1(7/9)、Inkling(7/15)和Kimi K3(7/16)。该列表覆盖了来自Anthropic、月之暗面、OpenAI、DeepSeek、xAI、智谱等公司的13款模型。AI模型OpusKimiGPT10 个信源在谈事件专题推荐理由:想要快速回顾近四个月各家发了哪些模型?看这张时间表就够了,直接按时间排序,一目了然。原文稍后读已读值得跟进有用关注 Opus
13:41IT之家(博客/媒体)月之暗面于7月15日在B站、X平台等发布预热视频,其中一帧出现数字3指向Kimi K3模型。匿名模型Kivine出现在Arena.ai平台,疑为K3。网友晒出多段K3与Claude Fable 5及GPT-5.6-Sol的对比。此前Kimi K2模型为MoE架构,总参数1T、激活32B;K2.6模型升级Agent集群,支持调度300个子Agent并行任务。AI模型Kimi K3月之暗面Claude10 个信源在谈事件专题推荐理由:月之暗面K3要来了,视频里对比了Claude和GPT的新版本,感兴趣的可以看看差距有多大。原文稍后读已读值得跟进有用关注 Kimi K3
09:23官方账号arXiv cs.AI@Tapan Parikh研究让44个语言模型在“选一个词”这类开放任务中作答,结果41%的模型选择了“serendipity”。实验使用31个单轮提示(如“说一种树”),每个提示重复4次,无系统提示,通过精确匹配分析。模型间趋同严重:31个类别中有7个类别超过80%的回答相同。但不同模型遵从度差异超4倍,人格化/社区调优模型最分散,最新旗舰模型最聚合。在Claude、GPT、Qwen、Grok四个家族内,各代模型趋同度递增,但最新旗舰Claude和GPT出现反转。论文ClaudeGPTQwen推荐理由:这篇论文发现44个模型在选词时高度趋同,41%都选了同一个词,而且新模型比旧模型更爱跟风。想了解AI的集体“从众心理”可以看看。原文稍后读已读值得跟进有用关注 Claude
08:02berryxia@berryxia73°GPT现支持将arXiv论文一键转化为Marimo笔记本。用户输入论文后,AI进行Autoresearch,复现关键实验并生成带可视化、可实时修改参数的交互式笔记本。用户可直接运行查看可解释性、agent harness或benchmarking效果。这改变了传统读论文方式,将静态学术知识变为可即时操作的活系统。AI产品GPTarXivMarimo推荐理由:GPT现在能把论文变成可以玩的Marimo笔记本,自动复现实验还能改参数,读论文像玩玩具一样直观。原文稍后读已读值得跟进有用关注 GPT
20:05Junyang Lin@JustinLin610作者JustinLin610指出前沿模型效果好但成本高,个人订阅用户可最大化token使用量(如Codex月费200美元可产生超8000美元token消耗)。企业按token计费时,可将简单格式化任务分配给Seed、Qwen、DeepSeek等便宜模型,复杂智能体任务交给Fable、Sol。GLM 5.2编码能力接近Claude和GPT,Grok类似。合理设计系统能提升生产力且不增加成本。技巧ClaudeGPTDeepSeek推荐理由:如果你用AI时总担心费用,这篇聊透了怎么把便宜模型(如Qwen、DeepSeek)和贵模型(Claude、GPT)搭着用,省成本又出活。原文稍后读已读值得跟进有用关注 Claude
08:15官方一手歸藏(guizang.ai)@op7418玛丽亚设计了一个新的 GPT 模型选择器交互,通过视频演示了其操作流程。该交互比 OpenAI 官方版本更直观,用户切换模型时无需逐层点击。视频展示了实时切换和视觉反馈,提升了选择效率。该设计完全由个人用户完成,并非官方发布,但提供了值得参考的交互模式。技巧GPT模型选择器OpenAI1 个信源在谈事件专题推荐理由:有个用户自己做了个模型选择器,比 OpenAI 官方还直观,看视频就能感受到。原文稍后读已读值得跟进有用关注 GPT
10:20官方一手arXiv: DeepSeek@Lifei Liu, Haoran Yu, Xiaochong Jiang, Su Wang, Pin Qian, Yihang Chen这项研究提出一种五条件对比设计,拆解多智能体LLM安全中的三个机制。在30个合成有害场景和四个安全基准上测试,发现操作重构是最可迁移的风险信号,使GPT、Gemini和DeepSeek的合规性上升,而Claude相对抵抗。批准框架委托的敏感性因提示设计、模型配对和场景来源而异,怀疑性执行提示可大幅降低合规性。原始直接模型排名可能误导:Gemini在直接提示中最安全(8.9%),但与Claude规划器配对后合规性升至38.9%。GPT的零净管道效应实际上隐藏了重构增加被规划器拒绝抵消的事实。论文GPTGeminiDeepSeek推荐理由:这篇论文拆穿了多智能体安全评估的常见错觉——GPT看似安全但只是被拒绝掩盖,Gemini配对Claude反而危险。做安全测试时别只看总数。原文稍后读已读值得跟进有用关注 GPT
05:59elvis@omarsar0精选Databricks联合创始人Matei Zaharia在推文中分享了内部编码智能体基准测试结果。Pi harness在Opus和GPT模型上获得相同成功率,但成本降低2倍。GLM 5.2被描述为开源编码智能体性能的一次重大进步。测试表明包括开源在内的许多模型已达到真正具有竞争力的水平。AI模型PiOpusGPT推荐理由:Matei Zaharia刚透露Databricks实测:用Pi harness成本省一半,效果和Opus、GPT一样好;GLM 5.2这个开源模型也追上来了。原文稍后读已读值得跟进有用关注 Pi
02:38Ethan Mollick@emollick早期体验者Ethan Mollick称GPT新语音功能非常出色,比以往版本更智能,更接近科幻电影中的AI对话体验。通过Claude Tag的提示,他发现GPT语音与Claude的组合能催生新的AI协作工作模式。该语音功能在处理复杂交互方面有显著提升。AI产品GPTClaude语音交互推荐理由:Ethan Mollick分享了他对新GPT语音的体验,说变聪明了很多,对话就像科幻片。想看看AI语音能有多好?原文稍后读已读值得跟进有用关注 GPT
09:07@koltregaskes@koltregaskes用户Koltregaskes在X上分享了对一个未具名图像生成模型的快速测试,使用包含42岁东亚女性、f/1.8光圈、85mm镜头、黄金时刻等详细参数的提示词,生成的照片在皮肤纹理、光影和衣物褶皱上表现逼真。他还贴出了Gemini和GPT的生成结果作为对比,显示出该模型在摄影写实方面稍有优势。测试仅基于单一样例,但提示词复杂度和输出质量值得关注。AI模型GeminiGPT提示词工程推荐理由:看这个用户用详细提示词测新模型,效果很真实,还对比了Gemini和GPT的结果,挺有意思的。原文稍后读已读值得跟进有用关注 Gemini
01:09官方账号NVIDIA AI@NVIDIAAI精选这篇ICML论文区分了大型语言模型的非预期记忆与泛化,并估计GPT风格模型容量约为每参数3.6比特。该结果为数据、扩展和隐私推理提供了更精确的视角。研究者通过实验方法量化了模型记忆边界。论文GPTICML记忆容量推荐理由:NVIDIA发了篇ICML论文,算出每个参数只能记住3.6比特,帮你理解模型记性边界和隐私风险。原文稍后读已读值得跟进有用关注 GPT
12:42shao__meng@shao__meng76°Agentic Coding Harness(如Claude Code、Codex、OpenCode)本质是上下文编排工具,底层LLM(如Claude Opus、GPT系列)是无状态的。Harness每轮需重建system prompt、tool definitions和messages三件套,利用prompt caching降低延迟。工具执行在用户本地,LLM只返回JSON意图。不同harness的差异仅在上下文管理策略和TUI/UX,智能天花板由模型决定。行业Claude CodeGPTCodex推荐理由:SemiAnalysis拆解了Claude Code等harness的HTTP流水线,告诉你它们只是编排工具,没有魔法。原文稍后读已读值得跟进有用关注 Claude Code
19:42官方账号Decoder@Maximilian Schreiner桥水基金与Thinking Machines Lab的测试显示,一个经过微调的开源权重模型在金融文档评估任务上超越了GPT-4和Claude 3.5,且成本降低90%。该微调模型基于Llama 3.1 70B,在桥水内部金融问答数据集上训练,准确率达到92%,而GPT-4仅为78%。测试涵盖2000份真实金融文件,正确答案未公开以避免数据污染。AI模型BridgewaterThinking Machines LabGPT2 个信源在谈事件专题推荐理由:桥水基金用自家金融数据微调了一个开源模型,结果比GPT和Claude都强,成本还低得多。想搞垂直领域微调的可以看看。原文稍后读已读值得跟进有用关注 Bridgewater
11:03berryxia@berryxiaOrca论文提出预测下一个状态而非下一个token,使用12.5万小时视频和1.6亿事件标注训练模型。该模型在预训练阶段未使用任何动作标签,但自主学会了抓取等机器人动作。相比GPT的统计模仿,Orca通过视频学习建立对物理世界的内在表示,能同时支持语言生成、图像预测和机器人行动。这标志着从统计模仿向物理理解的潜在突破。论文OrcaGPTSora推荐理由:Orca用12.5万小时视频训练,没给动作标签就让机器人学会抓取,跟GPT那种猜词完全不是一个路子。原文稍后读已读值得跟进有用关注 Orca
09:53官方一手arXiv: DeepSeek@Jian Xu, Delu Zeng, John Paisley, Qibin Zhao论文提出偏差感知贝叶斯主动排名方法,解决LLM裁判偏好冗长、格式和位置效应导致的系统偏差。在16个真实LLM(Llama、Qwen、Phi-4、GPT-4o-mini/5.1/5.5、Gemini、DeepSeek、Claude Haiku/Sonnet/Opus)的基准测试中,朴素聚合在偏差裁判上无法识别正确top-k,而该模型将召回率从约0.5-0.6提升至0.84-1.0。Top-k感知获取规则比循环赛或全局不确定性规则更少比较次数达到相同性能。论文LLMClaudeGPT推荐理由:用贝叶斯方法修LLM当裁判时的废话偏好和位置偏差,实测召回从0.5拉到接近1,比直接投票靠谱多了。原文稍后读已读值得跟进有用关注 LLM
04:01The Rundown AI@therundownai精选Mira Murati的Thinking Machines Lab与全球最大对冲基金Bridgewater合作,测试AI用于投资新闻筛选。GPT、Claude、Gemini在六项过滤测试中平均准确率约50%。专家投资者编写提示词后准确率升至74-76%,但仍低于80%的信任阈值。通过TML的Tinker API微调开放权重模型,准确率达到84.7%,错误率比最佳前沿模型降低29.8%,且每任务成本仅为前者的1/13.8。AI模型Mira MuratiThinking Machines LabBridgewater2 个信源在谈事件专题推荐理由:Mira Murati团队和桥水基金一起搞了个AI筛选新闻的实验,先用GPT、Claude只有50%准确率,专家写提示词到75%还是不够,最后微调模型干到了84.7%,成本还低了13倍多。原文稍后读已读值得跟进有用关注 Mira Murati
11:05官方账号arXiv cs.LG@Philippe Chlenski, Zachariah Carmichael, Ayush Warikoo, Chia-Tse Shao, Yingxiao Ye, Aobo Yang, Vivek Miglani, Nehal Bandi该论文研究使用开放语言模型(如Llama、Qwen)解释封闭API模型(如GPT、Gemini)时的可靠性问题。在11个模型上的实验表明,预测层面的保真度(log-odds一致性)远高于归因层面的保真度(leave-one-out重要性)。存在访问-效度反转:白盒信号(如注意力模式)虽稳定但无法预测因果归因,而黑盒输入消融能直接捕捉归因。论文警告,仅凭预测一致性不足以证明机械可解释性可从开放模型迁移到封闭模型。论文LlamaQwenGPT推荐理由:想用开源模型解释GPT?这篇论文告诉你预测一致不代表归因一致,小心踩坑。原文稍后读已读值得跟进有用关注 Llama