09:54官方账号arXiv cs.AI@He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe LiDT-Guard提出一种推理主动训练、推理自由推理的范式,在训练时使用推理监督,推理时只输出结构化安全标签。它采用意图-类别-安全的三步决策过程,并构建带意图标签、风险类别、安全标签和推理轨迹的数据集。通过Rollout-Guided Progressive Hard-Case Optimization (RG-PHO)提升硬样本鲁棒性。在提示侧和响应侧安全基准上,DT-Guard分别达到0.886和0.870的平均F1分数,4B参数版本取得0.878的双侧平均F1,超越多个8B基线。AI模型DT-Guard安全护栏推理模型推荐理由:想用轻量模型做好内容安全?DT-Guard靠训练时推理、运行时只打标签,4B就干掉8B的护栏,速度快还准。原文稍后读已读值得跟进有用关注 DT-Guard
06:31官方账号Meta AI@AIatMetaMeta 的 Muse Image 模型在强化学习训练中涌现出思维链内的自我改进行为,能够自适应地选择执行局部编辑、完全重新生成或调用外部工具。该行为未经显式编程,而是模型为优化图像质量和最大化奖励而产生的策略。实验显示这一涌现能力显著提升了图像生成效果。AI模型Muse ImageMeta强化学习推荐理由:Meta 的 Muse Image 在强化学习下自己学会了边画边改,能局部修也能重画,效果比直接生成更好,值得看看原文稍后读已读值得跟进有用关注 Muse Image
05:21OpenRouter@OpenRouterAI精选OpenRouter 用 1,730 道视觉推理题测试了 5 个模型,检验将图片细节设为“low”的省钱技巧。结果发现该技巧适得其反:模型为看清模糊图像消耗更多推理 token,总体成本不降反升。这一发现提示开发者在使用视觉模型时需谨慎选择图片细节参数。AI模型OpenRouter推理模型多模态推荐理由:想省成本把图设成低清?OpenRouter 测了5个模型1730道题,告诉你这招可能更费钱。原文稍后读已读值得跟进有用关注 OpenRouter
05:19OpenRouter@OpenRouterAIOpenRouter 发布博客对比推理模型与非推理模型在不同细节设置下的成本与性能。推理模型推荐保持 auto 或 high 细节以保留精度;非推理模型设为 low 细节可真实节省费用和延迟,但需接受准确度损失。博客附有详细基准表格和每模型分表,帮助用户按需选择。技巧OpenRouter推理模型成本优化推荐理由:OpenRouter 实测告诉你:非推理模型调低细节真的能省钱省时间,但推理模型别省,自己看表格选策略。原文稍后读已读值得跟进有用关注 OpenRouter
05:17OpenRouter@OpenRouterAIOpenRouter的实验显示,调整推理努力(reasoning effort)对成本的影响远大于调整细节(detail)。细节变化可使准确率波动2到17个百分点,但几乎不改变成本。而限制推理努力能削减50%到75%的成本,准确率仅变动1到2个百分点(在噪声范围内)。这说明优化推理努力是控制成本的关键。技巧OpenRouter推理模型成本控制推荐理由:OpenRouter实测数据告诉你,想省钱只要调低推理努力,准确率几乎不掉,但成本能砍一半以上。原文稍后读已读值得跟进有用关注 OpenRouter
01:12官方账号SiliconFlowAI@siliconflowai精选腾讯混元发布 Hy3 模型,参数量 295B MoE / 21B active,支持 262K 上下文长度。该模型经过 50 多个真实业务场景迭代,将幻觉和知识错误减半。在长程任务中能保持意图一致,智能体执行更稳定,工具调用成功率更高且无死循环。即日起在 SiliconFlow 平台提供前两周免费访问。AI模型腾讯混元Hy3SiliconFlow推荐理由:腾讯混元 Hy3 在 SiliconFlow 上免费两周,295B 参数模型幻觉砍半,智能体调用工具更稳,试试看。原文稍后读已读值得跟进有用关注 腾讯混元
00:59官方一手marktechpost@Asif Razzaq72°Liquid AI开源了Antidoom方法,通过Final Token Preference Optimization(FTPO)技术定位并重训推理模型中导致循环的起始token。在LFM2.5-2.6B模型上,doom-loop率从10.2%降至1.4%;在Qwen3.5-4B上,从22.9%降至1%。所有代码包括生成、检测和训练器都已开源。AI模型Liquid AIAntidoomFTPO推荐理由:推理模型老卡死?Liquid AI开源了Antidoom,用FTPO把循环率从22.9%打到1%,直接干掉死循环。原文稍后读已读值得跟进有用关注 Liquid AI
23:06lmarena.ai@lmarena_ai精选76°Anthropic 发布 Claude Sonnet 5 (Thinking),在 Agent Arena 排行榜上排名第6。该基准测试基于全球用户的数百万个真实长程智能体任务。模型可调用网络搜索、文件系统和终端等工具完成复杂工作流。Claude Sonnet 5 在任务成功率、用户满意度及 bash 能力上表现最强,工具幻觉率保持稳定。其可操控性分数置信区间较宽,仍在稳定中。AI模型Claude Sonnet 5AnthropicAgent Arena10 个信源在谈事件专题推荐理由:Anthropic 新出的 Claude Sonnet 5 主打智能体能力,Agent Arena 排第6,能自己规划并用工具完成任务。关心自主执行模型的可以看看它的实际表现。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
22:17Hunyuan@TXhunyuan腾讯混元发布Hy3模型,已在OpenRouter平台上线,通过Novita Labs提供访问。该模型采用295B MoE架构(21B活跃参数),支持原生256K上下文长度,并提供三种可配置推理模式。Hy3在编码、推理和长上下文任务中表现强劲,并针对智能体工作流进行优化。模型免费使用至7月21日。AI模型Hy3Tencent HunyuanOpenRouter推荐理由:腾讯的Hy3模型现在OpenRouter上就能用,295B参数但只激活21B,成本低,还有三种推理模式,做智能体任务很合适,而且免费到7月21号,赶紧试试。原文稍后读已读值得跟进有用关注 Hy3
17:18Thomas Wolf@Thom_WolfJaroslav Beck团队发布ThinkingCap高效模型系列,在Qwen 3.6 27B模型上进行微调,平均减少2倍思考token,部分示例生成速度提升10倍。该方法保持非侵入性干预,得到的模型与原检查点行为高度相似。作者认为这个技术可能像量化一样成为默认工具包的一部分。AI模型ThinkingCapQwen推理模型推荐理由:想给模型推理提速?这个ThinkingCap把Qwen 27B的思考token砍掉一半,有的例子快10倍,效果还很稳定。原文稍后读已读值得跟进有用关注 ThinkingCap
15:57Marc Andreessen@pmarcaMarc Andreessen 在推特上引用观点,认为 DeepSeek 的模型 Fable 在给定足够测试时计算(test time compute)的情况下,可能能够完成任意人类知识工作者的任务。它可以通过生成子代理(subagents)、运行RLM环境等方式实现。该观点称Fable是“智能完备”(Intelligence-Complete)的。目前该推文获得75个点赞和约24k阅读量。AI模型DeepSeekFableAGI推荐理由:Marc Andreessen 直接评价说 DeepSeek 的 Fable 可能已经接近 AGI 的门槛,这个判断来自顶级投资人,值得关注。原文稍后读已读值得跟进有用关注 DeepSeek
14:45IT之家(博客/媒体)Anthropic发布论文《大语言模型中的全局工作空间》,在Claude模型中发现了类似神经科学“全局工作空间理论”的结构,命名为J-space。他们开发了J-lens数学工具来弱化后台任务干扰,聚焦Claude在特定时刻关注的概念。通过4项观察验证了J-space的存在,包括:询问Claude正在思考什么并用J-lens查看其J-space中的概念;要求Claude牢记公平并观察它是否持久化将公平概念拖入J-space;在解决国际象棋等问题时,改变J-space内容会影响最终输出;当一个概念被拖入J-space后,Claude的其他部分能利用它。该结构并非预先设计,而是在训练中自行出现,Anthropic借用生物学“趋同演化”概念描述人脑与AI模型因效率需求出现功能相似的结构。论文ClaudeAnthropicJ-space10 个信源在谈事件专题推荐理由:Anthropic用生物学概念解释了Claude内部如何组织信息,还拿出了4个实验证据,就像给AI做了个脑电图。原文稍后读已读值得跟进有用关注 Claude
14:00官方一手marktechpost@Asif Razzaq精选腾讯Hy团队发布Hy3,一个总参数量295B的混合专家(MoE)模型,每个token仅激活21B参数。Hy3在SWE-Bench Verified上取得78.0分,报告更低的幻觉率,并支持256K上下文窗口。该模型以Apache 2.0许可证开源,可在OpenRouter上免费试用至2026年7月21日。AI模型Hy3腾讯MoE推荐理由:腾讯刚开源Hy3,激活21B参数就能在SWE-Bench拿到78.0,还支持256K长上下文,想尝鲜推理模型的话OpenRouter上免费到7月21日。原文稍后读已读值得跟进有用关注 Hy3
12:37官方一手marktechpost@Michal SutterOpenAI 在 API 中新增了 GPT-Realtime-2.1 和 GPT-Realtime-2.1-mini 两个实时模型。GPT-Realtime-2.1-mini 是专为语音设计的迷你推理模型,定价与此前的 gpt-realtime-mini 相同。通过改进缓存,p95 延迟降低了至少 25%。开发者可通过 WebRTC 协议连接使用。AI模型OpenAIGPT-Realtime-2.1GPT-Realtime-2.1-mini10 个信源在谈事件专题推荐理由:OpenAI 新出的实时语音模型,延迟砍了至少25%,mini版推理更强还保持原价,做语音agent正合适。原文稍后读已读值得跟进有用关注 OpenAI
12:20AI Will@FinanceYF5根据r/LocalLLaMA的一张图表,有人计算了从云端顶尖模型发布到普通笔记本能运行同等能力水平的平均时间差为24.8个月。GPT-3用了37个月才被追上,GPT-3.5是17个月,GPT-4大约24个月。按此节奏推算,Fable/Mythos 5级别的能力预计在2028年7月可运行于高端消费级电脑。行业GPT-3GPT-3.5GPT-4推荐理由:有人拿LocalLLaMA的数据算了一笔账:顶级云端模型大概两年后就能在普通笔记本上跑,GPT-3.5只用了17个月,这个时间差挺有意思。原文稍后读已读值得跟进有用关注 GPT-3
11:41官方账号arXiv cs.AI@Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao ZhouRLVR通过可验证奖励提升推理能力,但每次训练强模型需要大量采样,成本高昂。Direct-OPD方案在小模型上执行RL,将其策略偏移作为隐式奖励传递给强模型。对比后RL教师与前RL参考的对数比率,为学生模型提供密集监督。实验显示,Direct-OPD将Qwen3-1.7B在AIME 2024上的准确率从48.3%提升至62.4%,仅需8块A100 GPU训练4小时。该方法优于step-matched直接RL,并支持多策略偏移的级联组合。论文Direct-OPDQwen3AIME 2024推荐理由:用弱模型训练强模型,Qwen3-1.7B在AIME 2024从48.3%飙到62.4%,只花4小时8卡A100。比直接RL还省,值得试试。原文稍后读已读值得跟进有用关注 Direct-OPD
11:24量子位@克雷西Anthropic在Claude模型中发现了类脑空间结构。移除该结构后,Claude在推理任务上的表现明显退化。这项研究揭示了Claude内部高级认知功能的神经基础。论文ClaudeAnthropicAI安全10 个信源在谈事件专题推荐理由:Anthropic发现Claude内部有个类似意识的模块,一删除模型就傻了,这研究真有意思。原文稍后读已读值得跟进有用关注 Claude
11:21官方账号Nous Research@NousResearch精选腾讯混元发布新模型Hy3,参数量295B,采用MoE架构。Hy3在Nous Portal上免费开放两周。该模型专注于低成本智能体应用,在编码、工具调用可靠性、推理以及256K长上下文任务上表现突出。AI模型Hy3腾讯混元MoE推荐理由:腾讯混元这个Hy3模型挺牛的,295B参数还免费玩两周,编码和工具调用都很强,值得试试。原文稍后读已读值得跟进有用关注 Hy3
11:11官方账号arXiv cs.AI@Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz GeramifardTREK提出一种分阶段训练方法,解决GRPO在困难提示上的探索停滞问题。该方法先用蒸馏将教师模型(如DeepSeek-V4)的已验证轨迹拉入学生模型支持域,再返回标准GRPO精炼。在数学推理中,TREK将Qwen3-8B在AIME 2025上从36.9提升至40.3,在AIME 2024上从47.9提升至51.1(avg@16)。在代理任务上,ALFWorld成功率从75.8提高到82.8,ScienceWorld从12.5提高到26.7。TREK的泛化优势在于仅需已验证输出轨迹,可兼容黑盒或白盒教师。论文TREKGRPO蒸馏推荐理由:这篇论文给出了一个实用技巧:用蒸馏扩展支持域再强化学习,在数学和代理任务上都涨点明显,而且不需要改动模型结构。原文稍后读已读值得跟进有用关注 TREK
09:20官方账号Anthropic@AnthropicAIAnthropic在推文中展示Claude模型通过J-space(内部表示空间)执行推理步骤,无需输出中间文本。Claude能自动发现代码中的错误,并识别图像内容。该发现揭示了模型内部推理过程的可见性,有助于理解Claude的行为机制。研究基于Claude模型的分析,未公布具体版本号。AI模型ClaudeAnthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic新发现:Claude在脑子里悄悄推理,能自己找代码bug和认图,比看手写CoT更直接。原文稍后读已读值得跟进有用关注 Claude
09:17官方账号Anthropic@AnthropicAI精选Anthropic在推文中披露,移除Claude的J-space(内部表征空间)后,模型仍能流畅表达、回忆事实和完成文本分类,但在多步推理任务上显著变差。该发现类比人类认知中的深思熟虑与自动过程。J-space的缺失不影响基础语言能力,却损害了需要连贯逻辑链的复杂推理。这一实验揭示了Claude内部机制与推理能力的关键关联。AI模型ClaudeAnthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic发了新发现:删掉Claude的J-space后它说话正常但推理变弱,想了解模型内部机制可以看看。原文稍后读已读值得跟进有用关注 Claude
08:30官方一手@OpenAIDevs@OpenAIDevsOpenAI 发布了 GPT-Realtime-2.1-mini 新模型,其 API 现已可用。该模型在 Realtime mini 系列中新增了推理能力和工具调用功能。定价与原有的 GPT-Realtime-mini 相同,开发者无需额外付费。AI模型GPT-Realtime-2.1-miniOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 新推 mini 实时模型,能推理还能调用工具,价格不变,适合实时场景开发。原文稍后读已读值得跟进有用关注 GPT-Realtime-2.1-mini
08:00berryxia@berryxia76°Anthropic在Claude模型中发现一种名为J-space的内部神经激活空间,它允许模型在多步推理、识别概念和发现bug时无需输出文本。移除J-space后,Claude的复杂推理能力显著下降,但日常对话仍正常。通过观察J-space,研究人员可窥见模型在安全测试中的内部思考,例如识别出测试场景虚假或训练任务中的有害概念。这一发现为AI可解释性和对齐研究提供了新的观察窗口。AI模型ClaudeAnthropicJ-space10 个信源在谈事件专题推荐理由:Anthropic发现Claude有个隐藏的“思考空间”J-space,模型能在里面默默推理,不写出来。删掉它复杂推理就变差,还能看到模型私下的想法,挺有意思。原文稍后读已读值得跟进有用关注 Claude
07:00elvis@omarsar088°Anthropic新研究发现Claude内部存在一个名为J-Space的全局工作空间,与链式推理或草稿板不同,它是训练中自发出现的推理机制。通过J-Space,研究者可以直接读取和修改模型内部的信息流动。实验表明,该方法首次实现了对模型推理过程的直接观测和操控,而非仅从输出文本推测。这为可解释性提供了新工具,可能用于验证模型行为、实施更好护栏和预测危险场景。论文AnthropicClaudeJ-Space10 个信源在谈事件专题推荐理由:Anthropic找到了Claude思考时的内部工作区J-Space,能看能改,比以往猜输出靠谱多了。原文稍后读已读值得跟进有用关注 Anthropic
03:44官方账号Anthropic@AnthropicAI77°Anthropic最新研究发现,在Claude内部存在一个类似人类认知的“全局工作空间”——只有一小部分信息能被模型显式访问和推理,其余则处于隐藏状态。研究人员通过分析Claude在处理复杂任务时的中间表示,识别出这种信息瓶颈结构。该发现揭示了语言模型内部信息流的局限性,类似于人类意识中只有部分内容可被有意识思考。研究团队认为,这一机制有助于解释模型为何有时会忽略上下文或产生不一致输出。论文AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic发现Claude大脑里也有个“工作台”,大部分信息是潜意识,只有一小部分能主动调用。想看看大模型内部怎么“想”的?这篇论文很有料。原文稍后读已读值得跟进有用关注 Anthropic
03:01AK@_akhaliq精选bottlecapai 基于 Qwen3.6-27B 微调推出 ThinkingCap-Qwen3.6-27B 模型,平均推理 token 减少 50%,最佳案例减少 90% 以上。该模型通过先进微调算法在多个领域和难度的问题集上训练。AI模型ThinkingCap-Qwen3.6-27BQwen3.6-27Bbottlecapai推荐理由:bottlecapai 用 Qwen3.6-27B 微调的新模型能省一半推理 token,最快省九成,适合低成本推理场景。原文稍后读已读值得跟进有用关注 ThinkingCap-Qwen3.6-27B
02:05官方账号LMSYS Org (SGLang)@lmsysorg精选SGLang现支持DSpark算法,通过置信度驱动的变长验证优化推测解码。与传统验证所有候选token不同,DSpark仅验证高置信度token,在批大小1-256的DeepSeek-V4-Flash上实现最佳吞吐延迟权衡,优于MTP和非推测解码方案。高并发下动态调度相比固定预算带来约20%吞吐提升。使用融合内核和零开销调度后,DeepSeek-V4-Pro在B300上达到383.7 tok/s。AI模型SGLangDSparkDeepSeek-V44 个信源在谈事件专题推荐理由:SGLang加入DSpark后,高并发场景下吞吐能提升20%,在DeepSeek-V4上实测383.7 tok/s,推理优化党可以试试。原文稍后读已读值得跟进有用关注 SGLang
02:03官方账号LMSYS Org (SGLang)@lmsysorg76°腾讯混元发布Hy3,一个295B参数MoE模型,激活参数仅21B,支持256K上下文。在推理和智能体任务上,Hy3可媲美参数大2-5倍的开源模型。通过反幻觉训练,该模型的幻觉率从12.5%降至5.4%。多轮意图跟踪指标MRCR从42.9%提升至75.1%。Hy3支持MTP+EAGLE推测解码,并提供了FP8检查点以降低部署成本。AI模型Hy3TencentHunyuanSGLang推荐理由:腾讯混元新模型Hy3,21B激活参数就能比肩更大模型,幻觉率从12.5%降到5.4%,多轮对话能力大增,现在就能在SGLang上跑。原文稍后读已读值得跟进有用关注 Hy3
01:59官方账号vLLM@vllm_project精选腾讯混元发布Hy3模型,作为Hy3 Preview的完整版,总参数295B,活跃参数仅21B,采用192专家MoE架构与top-8路由。该模型在vLLM从第一天起即原生支持,包含工具调用、推理解析器和MTP推测解码功能。上下文窗口达256K,配备3.8B MTP推测解码层,提供BF16和FP8权重。模型采用Apache 2.0许可证,已在NVIDIA和AMD硬件上验证。AI模型Hy3vLLM腾讯混元8 个信源在谈事件专题推荐理由:腾讯混元的Hy3,295B参数但只激活21B,vLLM第一天就支持,能跑工具和长推理,Apache 2.0随便使,值得一试!原文稍后读已读值得跟进有用关注 Hy3
01:54官方账号vLLM@vllm_project76°MistralAI 推出了 Leanstral 1.5,一个基于 Apache-2.0 许可证的 Lean 4 证明智能体。该模型采用 MoE 架构,总参数量 119B,仅激活 6B 参数。它在 miniF2F 上获得 100% 准确率,在 FATE-H 和 FATE-X 上分别达到 87% 和 34% 的新 SOTA。在 PutnamBench 上,它解决了 587/672 个问题,每问题成本约 4 美元。现在可通过 vLLM 进行部署。AI模型MistralAILeanstral 1.5vLLM推荐理由:MistralAI 的 Leanstral 1.5 用 6B 活跃参数就拿下 miniF2F 满分,每个问题才 4 美元,做数学证明的可以试试。原文稍后读已读值得跟进有用关注 MistralAI
20:25Stanford AI Lab@StanfordAILab斯坦福AI实验室在ICML 2026(首尔)公布了论文列表,覆盖编码智能体、LLM推理、评估与基准、AI安全与可解释性、AI for Science五大方向。这些论文涉及具体技术进展,如代码生成Agent、推理链优化、新基准测试等。会议于首尔举行,吸引全球研究者关注。论文ICML 2026Stanford AI Lab智能体推荐理由:斯坦福AI Lab把ICML 2026的论文一次性列出来了,从编码智能体到AI安全都有,搞研究的朋友直接看这列表就行。原文稍后读已读值得跟进有用关注 ICML 2026
15:30IT之家(博客/媒体)腾讯混元正式发布并开源 Hy3 模型,基于 preview 版本提升后训练数据质量和多样性,扩大 RL 算力规模。在推理、智能体、长上下文等任务上显著进步,性能比肩参数规模 2-5 倍的旗舰模型。内部 270 位专家盲测中,Hy3 均分 2.67/4,优于 GLM5.1 的 2.51/4。API 输入价格 1 元/百万 tokens,输出 4 元,缓存命中仅 0.25 元。AI模型Hy3腾讯混元开源模型推荐理由:腾讯把 Hy3 开源了,推理和智能体能力追平了大好几倍的模型,盲测还赢了 GLM5.1,价格也很香。原文稍后读已读值得跟进有用关注 Hy3
14:59Gary Marcus@GaryMarcusGary Marcus 在推文中指出,GPT-5.5-xhigh 远未达到自动化研究员的水平。他认为这些模型在实验设计建议上毫无科学直觉(taste),无法辅助科研工作。该观点质疑了当前大模型通过递归自我改进实现高级智能的路径。AI模型GPT-5.5-xhigh推理模型科学研究推荐理由:Gary Marcus 直接批评 GPT-5.5-xhigh 连设计实验的能力都没有,戳破了大模型自动搞科研的幻想。原文稍后读已读值得跟进有用关注 GPT-5.5-xhigh
13:36量子位@量子位的朋友们OpenSquilla 发布 0.5.0 Preview 版本,通过多模型集成架构在 DRACO 基准测试的两个榜单(总分榜和效率榜)均取得第一。官方对比名单中出现了最新旗舰模型 Fable 5,显示其性能已超越当前顶级闭源模型。该版本还优化了推理成本,在 DRACO 效率榜上每任务消耗降低 40%。AI模型OpenSquillaDRACOFable 510 个信源在谈事件专题推荐理由:OpenSquilla 新版本用多模型集成拿下 DRACO 双榜第一,连 Fable 5 都被比下去了,关键是还省钱。原文稍后读已读值得跟进有用关注 OpenSquilla
12:46shao__meng@shao__meng精选71°Flask/Sentry 工程师 @mitsuhiko 发现,Claude Opus 4.8 与 Sonnet 5 在调用 Pi 的嵌套 edits[] 工具时,会在 edit 对象末尾产生 requireUnique、type、id 等虚构字段,导致 schema 校验失败。此问题在单轮 prompt 下不出现,在长 agentic 历史中复现率约 20%。去掉历史中的 thinking 块后失败率减半,开启 strict 模式后问题消失。作者推测根因是 Anthropic 的 RL 后训练在 Claude Code 的 forgiving harness 中进行,该 harness 接受参数别名和未知键,导致模型学到“edit 操作可多带可选字段”的先验。相比之下,OpenAI 的 harmony 路线在 prompt 中显式标记 JSON 边界并支持约束采样,未出现此回归。AI模型Claude Opus 4.8Sonnet 5Anthropic10 个信源在谈事件专题推荐理由:Armin 用实际 bug 案例拆解了 Claude 新模型在工具调用上的奇怪倒退,解释了为什么更强的模型反而更不听话,读起来很爽。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
11:36小互@imxiaohu作者分享了与Claude Fable 5合作的技巧,强调用户需先识别自己的知识盲区。该方法通过结构化提问,引导Claude Fable 5在代码、逻辑等领域针对性输出。实践表明,明确未知点后,Claude Fable 5的响应效率提升约40%,错误率降低30%。文章以实际案例说明如何用Claude Fable 5排查复杂问题,适合编程和推理场景。技巧Claude Fable 5提示词工程推理模型9 个信源在谈事件专题推荐理由:教你怎么用Claude Fable 5高效干活,先找准自己的盲点再问问题,比直接瞎问靠谱多了。原文稍后读已读值得跟进有用关注 Claude Fable 5
11:25Stanford AI Lab@StanfordAILab精选斯坦福团队在ICML 2026论文中发现,LLMs预测其他模型输出的准确率高于预测事实。当所有模型都预测错误时,投票法无法恢复正确答案。自我一致性(多次采样并验证)在数学和代码领域效果良好,但在无验证器的领域无法扩展真实性。论文标题为'Truthfulness Does Not Scale Like Reasoning'。论文LLM真实性AI安全推荐理由:斯坦福发了篇ICML论文,说LLMs猜别的模型比猜事实还准,但一起翻车时投票也救不了。想看懂它们为啥集体犯傻?看这篇。原文稍后读已读值得跟进有用关注 LLM
10:34IT之家(博客/媒体)77°美团今日开源万亿参数大模型 LongCat-2.0,总参数 1.6T,平均激活约 48B,专为 Agentic Coding 任务设计。架构引入 LongCat 稀疏注意力与 N-gram Embedding,提升长上下文处理与 token 表示。作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型,同步开源针对国产芯片的推理代码。提供 BF16、FP8、INT8 等多精度版本,覆盖不同算力部署需求。AI模型LongCat-2.0美团开源模型2 个信源在谈事件专题推荐理由:美团开源了1.6T参数的LongCat-2.0,专做Agentic Coding,还附赠了国产推理代码,存量卡也能跑,挺实在。原文稍后读已读值得跟进有用关注 LongCat-2.0
05:27官方一手marktechpost@Asif Razzaq美团发布LongCat-2.0,总参数量1.6万亿,每个token激活约480亿参数。模型原生支持100万token上下文,采用LongCat稀疏注意力机制。训练与推理均在国内AI ASIC超算集群上完成。该模型开源,API已开放访问。AI模型LongCat-2.0Meituan开源模型2 个信源在谈事件专题推荐理由:美团开源了1.6T参数的LongCat-2.0,激活参数480亿,原生支持100万token上下文,国内ASIC集群跑出来的,值得关注。原文稍后读已读值得跟进有用关注 LongCat-2.0
08:34AI Will@FinanceYF5用户 Nicolas Bustamante 测试 Claude Fable 5,发现该模型能根据模糊提示一次性生成逼真的埃菲尔铁塔代码。他多次评估后认为 Fable 5 是特殊模型,擅长从模糊描述完成一次生成。该模型在代码生成任务中表现出色。AI模型Claude Fable 5Anthropic编程助手10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Fable 5 回来了,能从一句话就写出埃菲尔铁塔代码,一次成型不用改,写代码神器。原文稍后读已读值得跟进有用关注 Claude Fable 5