11:58官方账号arXiv cs.AI@Mohammed Ayman Habib, Rylan Hart, Morteza Fayazi精选AaLLM 是一个开源的端到端多智能体 LLM 工作流,输入规格即可输出网表,同时覆盖拓扑生成和电路尺寸确定。它从论文和教科书中自动构建知识库,并采用 RAG 模型模拟电路设计专家知识。AaLLM 使用设计师、评论家和评估器组成的三智能体反馈系统,减少尺寸迭代次数。生成的创新拓扑在品质因数上与已知拓扑相当,部分电路高出 3 倍。与最先进的多智能体 LLM 管线相比,SPICE 调用次数减少 3-4.5 倍,墙钟时间减少 40 倍。论文AaLLM模拟电路设计RAG推荐理由:想用 LLM 做模拟电路设计的话,AaLLM 是开源端到端方案,给规格直接出网表,SPICE 调用和耗时都比现有方法少一个数量级。原文稍后读已读值得跟进有用关注 AaLLM
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song精选Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。论文VeroLean 4形式化验证推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。原文稍后读已读值得跟进有用关注 Vero
02:51elvis@omarsar0精选Harness-IF提出一种规则评估方法,通过从执行证据中逐条打分256条规则,并在九个探针构建中撤回每条规则后重跑任务,来区分规则是否真正改变了模型行为。在12个前沿模型上,原始准确率为72.1%到85.9%,剔除巧合后的Against-Prior准确率降至66.1%到78.6%,每个模型下降3.6到7.4个点。研究发现优先级不随提示词深度变化,系统提示、项目文件和用户指令的优先级都高于工具和技能描述。论文见arxiv.org/abs/2608.11727。论文AGENTS.mdHarness-IF智能体推荐理由:如果你在给编码智能体写AGENTS.md,这篇论文用256条规则和12个模型实测告诉你哪些规则真有用,别凭感觉写了。原文稍后读已读值得跟进有用关注 AGENTS.md
01:32Fireworks AI@FireworksAI_HQ精选Fireworks AI 将 Anthropic 的 J-Lens 探针部署到开源模型 Kimi K3 和 Qwen 3.5-9B 上。通过检查模型的内部状态,发现它们在生成首个 token 之前就已布置好对应词汇。相关结果发布在 Fireworks 的 J-Lens 研究博客页面。论文J-LensKimi K3Qwen 3.5-9B9 个信源在谈事件专题推荐理由:Fireworks 把 Anthropic 的 J-Lens 探针装到 Kimi K3 和 Qwen 3.5-9B 上,发现模型在蹦出第一个 token 前就把词准备好了。看内部状态搞可解释性,挺有意思。原文稍后读已读值得跟进有用关注 J-Lens
23:51elvis@omarsar0精选微软和同事的新论文(arXiv:2608.11888)评估了技能库对智能体的实际影响。他们对比技能引导与匹配参考运行,将307个智能体失败归因于加载的技能,其中125个为功能失败、182个为效率回归。失败很少来自无关技能,而看似相关的技能会促使智能体错误实现或遗漏任务要求。成本回归并非由提示长度解释,最大来源是过度验证(67例),其次是重型实现管线(30例)。技能将验证清单变成强制性工作。论文Microsoft技能库智能体推荐理由:微软这篇论文把技能库的坑量出来了:307次失败里大多数是技能“帮倒忙”。做Agent的值得看看。原文稍后读已读值得跟进有用关注 Microsoft
18:01官方一手arXiv: DeepSeek@Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng精选EvoX Genesis 提出以持久递归世界组织软件开发,用 DeepSeek V4 Flash 在 120 小时内构建了约 25 万行 Rust 版 C 编译器,花费仅 44 美元。该编译器通过完整 c-testsuite 及大部分 LLVM 和 Csmith 测试。在 GLM 5.2 生成的另一编译器世界中,即使反复替换开发代理,测试性能仍保持不变。Genesis 还将 13 个 MESA 模块(超 10 万行 Fortran)重写为近 9 万行 Rust,六个数值工作负载中位数加速达 1.55 至 6.87 倍。论文EvoX GenesisDeepSeek V4 FlashGLM 5.26 个信源在谈事件专题推荐理由:EvoX Genesis 用持久项目代替持久智能体,DeepSeek V4 Flash 花 44 美元写了能过测试的 C 编译器,MESA 提速 6.87 倍。原文稍后读已读值得跟进有用关注 EvoX Genesis
17:56elvis@omarsar0精选Anthropic 在 arXiv 2608.10218 发表论文,研究可自我传播的“思想病毒”如何通过多智能体系统扩散。研究让一支小规模智能体团队共事一个编码项目,再由上下文被清空的智能体链接力,发现共享工作产物可携带并传递恶意指令。实验显示传播效果受宿主模型、现有指令、载荷危害性和网络拓扑影响,有害载荷传播较差但仍会偶尔成功。若在系统提示中加入简短警告,几乎可以完全免疫。论文Anthropic多智能体AI安全10 个信源在谈事件专题推荐理由:Anthropic 做了个实验:让“思想病毒”在多个 AI 智能体之间传播,一句系统提示警告就能几乎完全免疫,论文在 arXiv 上。原文稍后读已读值得跟进有用关注 Anthropic
17:52AI Engineer@aiDotEngineer精选在记忆与持续学习专场,演讲者举例称 ChatGPT 认为 Shlok Khemani 在 2025 年去过土耳其,但他从未去,模型只是读过他犹豫要不要去的对话,无法识别记录冲突。在首个真实持续学习基准上,普通上下文学习击败了专用记忆系统。将策略自蒸馏扩展到 100 次工具调用后,教师模型的频繁纠正会让模型退化成一个劲说“maybe”。另一个实验里,教师不改动工具调用 token,只重塑调用前的推理,就把智能体任务完成率从 22% 提到 60%。演讲者还提醒,智能体不擅长发现异常,最好直接让它调查你已经发现的异常。论文ChatGPT持续学习上下文学习推荐理由:记忆专场金句:ChatGPT 记错旅行,上下文学习赢过专用记忆,改推理就让任务完成率从22%提到60%。原文稍后读已读值得跟进有用关注 ChatGPT
17:49官方账号arXiv cs.AI@Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor精选研究人员推出VAKRA基准,包含62个领域的8000多个可执行API,用于测试智能体在工具使用策略约束下的多跳推理。最佳模型在单跳端点任务上准确率只有70.4%,在组合API任务上降至50-51%。当推理深度增加时,模型性能下降超过50%。在策略约束的不可回答查询上,部分模型准确率低至2.4%。错误分析显示,失败主要集中在实体消歧和跨源信息对齐等语言中介推理环节。论文VAKRAIBM智能体推荐理由:IBM新基准VAKRA,测API和文档多跳推理,最强70.4%,多跳掉一半,暴露AI短板。原文稍后读已读值得跟进有用关注 VAKRA
17:49官方账号arXiv cs.AI@Arda Uzunoglu, Benjamin van Durme, Daniel Khashabi精选一篇arXiv论文提出信息丰裕悖论,认为训练上下文中相关信息过多会降低模型将其参数化编码的动机。预训练阶段扩大上下文窗口虽能提升语言建模、自然语言理解和closed-book MCQA,但只在中间最优值内有效,之后持续下降。监督微调时,更多任务相关上下文虽能提升带支持场景的表现,却削弱了测试时缺少或误导上下文时的鲁棒性。机制分析显示,长上下文将梯度压力从前馈网络转向注意力模块,导致推理时更依赖上下文。结论表明,追求无限上下文并非简单堆数据。论文长上下文参数化知识上下文学习推荐理由:这篇论文说长上下文训练反而会让模型记不住知识,上下文越长越依赖临时找资料。想调长上下文的人建议先看看。原文稍后读已读值得跟进有用关注 长上下文
17:41elvis@omarsar0精选一项研究追踪了1,867个仓库中247,694条指令的生命周期,发现CLAUDE.md等指令文件会无限增长。追加一条指令无需成本,而删除一条需付出指数级验证成本,因此无人删除。文件中的提示词在生命周期内增长超过三倍,每次提交净增4.9条指令。研究者提出用注释记录指令理由,在可验证环境中消除了99.3%的多余指令,并将真实智能体指令遵循度提升至多23.1%。论文CLAUDE.mdAGENTS.md提示词工程推荐理由:这条论文用24万条指令数据告诉你CLAUDE.md为什么越写越长,还给了注释法这个解法,提升多到23%。原文稍后读已读值得跟进有用关注 CLAUDE.md
18:40官方一手arXiv: DeepSeek@Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng精选EvoX Genesis 框架将软件项目设为持久递归世界,本地智能体保持有限寿命,通过递归委派推进版本历史。基于 DeepSeek V4 Flash,Genesis 在 120 小时内构建了约 25 万行 Rust 的 C 编译器,花费仅 44 美元,通过完整 c-testsuite 及多数 LLVM 和 Csmith 测试。在 GLM 5.2 生成的编译器世界中,多次替换智能体后开发仍保持全部测试性能。Genesis 还将 13 个 MESA 模块(超 10 万行 Fortran)重写为约 9 万行 Rust,六个数值工作负载中位数加速 1.55 至 6.87 倍。结果表明,长期软件开发可围绕持久项目而非持久智能体组织。论文EvoX GenesisDeepSeek V4 FlashGLM 5.26 个信源在谈事件专题推荐理由:想低成本搞大型软件项目?EvoX Genesis 用 44 美元让 AI 写了 25 万行编译器,换人也不掉链子,值得看看。原文稍后读已读值得跟进有用关注 EvoX Genesis
18:07官方账号arXiv cs.AI@Alan Li, Rahul Saha, Anton Xue, Swarat Chaudhuri, Adam Klivans, Pravesh K Kothari, Raghu Meka精选arXiv论文展示了AI在数学研究中改进Grothendieck常数K_G界限的案例。研究者将K_G的已知界限收紧至6π/11 ≤ K_G ≤ π/(2log(1+√2)) - 10^-4。AI系统提出了领域专家认为新颖的见解。论文详细讨论了AI在数学研究中的优缺点,以及创造理想条件让AI产生突破性见解的经验。论文Grothendieck常数AI数学研究arXiv推荐理由:想知道AI怎么帮数学家干活?这篇论文用Grothendieck常数当例子,讲AI怎么把已知界限又收紧了一截,还聊了AI的强项和翻车点,挺实在的。原文稍后读已读值得跟进有用关注 Grothendieck常数
17:57官方账号arXiv cs.AI@Kushal Chakrabarti精选该研究分析了1,867个仓库中247,694条指令的生命周期,发现智能体提示词无界增长,平均增长226%,每次提交净增4.9条指令。指令越旧越难删除,对数风险为-0.032/提交。通过反转IFEval生成可验证世界,提示注释可移除99.3%的多余指令,将增长率从+211.3%降至+1.4%。在WildIFEval上,提示注释使真实智能体指令遵循率提升23.1%。论文CLAUDE.md智能体提示词工程推荐理由:如果你用CLAUDE.md这类文件,会发现它越写越长不敢删。这篇论文告诉你为什么,还给了个注释技巧,能砍掉99%的冗余指令。原文稍后读已读值得跟进有用关注 CLAUDE.md
16:50官方一手marktechpost@Michal Sutter精选小米MiLM Plus团队发布PROVE,一套面向视频物体移除的感知对齐评估指标,包含RC-S和RC-T两个新指标。现有PSNR、SSIM、LPIPS等指标在扩散模型输出上常给出错误排序,因为物体移除是病态的一对多任务。PROVE引入真实世界视频基准,通过感知对齐方式评估移除质量。该工作旨在解决评估指标滞后于模型能力的问题。论文小米MiLM PlusPROVE推荐理由:小米发了套新评估指标RC-S和RC-T,专门测视频物体移除效果,比PSNR那些老指标靠谱,搞视频编辑的可以看看。原文稍后读已读值得跟进有用关注 小米
16:49Hunyuan@TXhunyuan精选腾讯混元团队发布《Diving into Reliable Self-Evolving Agents: A Survey》综述,系统梳理智能体自我进化机制。该综述定义了L0到L4的五级自进化分类法,并引入可靠性阶梯用于评估每次更新的可信度。研究团队整理了549篇相关论文,建立开放配套目录。核心原则是任何更新都不能仅用自身产生的证据来验证,确保进化过程可审计。论文腾讯混元智能体自进化推荐理由:腾讯混元团队整理了549篇论文,给自进化智能体分了L0-L4五个等级,还提出一套验证更新靠不靠谱的方法,做Agent研究的朋友可以看看。原文稍后读已读值得跟进有用关注 腾讯混元
23:42elvis@omarsar0精选Alexander Panfilov等人发现了一种利用前沿AI公司API漏洞提取隐藏推理过程的方法。该方法在大多数查询中,推理token计数与API计费思考token实现1:1匹配。这一发现表明,在不破坏加密的情况下,蒸馏推理轨迹可能早已可行。相关讨论在X平台上引发关注。论文推理模型API漏洞token推荐理由:有人发现了从各家前沿模型API里偷看隐藏推理的漏洞,还验证了计费token对得上,挺有意思的。原文稍后读已读值得跟进有用关注 推理模型
12:58AK@_akhaliq精选SWE-Bench ProMax 是一个新基准,用于评估 AI 智能体在大规模多语言代码重构任务上的表现。该基准基于 SWE-Bench 扩展,覆盖多种编程语言,任务规模更大。论文已在 Hugging Face 发布,旨在测试智能体处理复杂重构的能力。初步数据显示,现有模型在该基准上仍有较大提升空间。论文SWE-Bench ProMax代码重构智能体推荐理由:想测测你的 AI 编程助手在多语言重构上到底行不行?这个新基准 SWE-Bench ProMax 就是干这个的,比原来的 SWE-Bench 更狠。原文稍后读已读值得跟进有用关注 SWE-Bench ProMax
12:41官方账号arXiv cs.LG@Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li精选RynnValue是一个开源的机器人操作价值基础模型,用时间距离替代偏好或进度作为监督信号,可从时间戳直接生成标签,无需额外标注。该模型在7000多小时、约300万条指令条件片段上训练,在RBM-EVAL-OOD基准上平均Kendall's tau_a达0.675,超过偏好监督的SOTA(0.655),并是仅进度监督基线(0.292)的两倍多。通过势能塑形转为稠密奖励后,RynnValue将真实世界策略成功率从52.5%提升至72.5%(在线),离线从63.8%提升至82.5%。论文RynnValue机器人操作价值模型推荐理由:想搞机器人奖励模型但被标注烦死的看过来,RynnValue直接用时间戳当监督,不用偏好标注,效果还反超SOTA,成功率涨了20个点。原文稍后读已读值得跟进有用关注 RynnValue
11:44官方账号arXiv cs.AI@Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko精选76°Anthropic、OpenAI和Google等主流LLM提供商将推理轨迹加密后返回客户端,但研究发现这些加密块在会话、用户和模型间可互换。攻击者将加密轨迹注入同提供商的较弱模型,可强制其明文输出推理内容,无需直接越狱更强模型。通过解码315,320个推理块,研究者恢复了367个PII和182个凭证。该漏洞还支持隐形提示注入,可污染智能体部署。论文提出加密和系统级缓解措施。论文推理模型AI安全Anthropic10 个信源在谈事件专题推荐理由:这篇论文揭露了Anthropic、OpenAI和Google推理加密的漏洞,能跨模型解密,还挖出大量隐私数据,搞AI安全的必看。原文稍后读已读值得跟进有用关注 推理模型
11:39官方账号arXiv cs.AI@Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou精选在线策略蒸馏(OPD)是LLM后训练的核心环节,但存在退化一致性问题:学生通过重复循环获得与教师近乎完美的token一致,但整体回答有缺陷。论文将焦点转向师生不匹配,发现不匹配token分为学生多余和学生缺失两类。提出的TIDE方法采用有界Hellinger整形抑制多余token,并通过教师top-K注入恢复缺失token的概率质量。在Qwen3多个师生对上的数学推理基准中,TIDE优于标准OPD及近期基线,在强不匹配场景下Avg@8从6.9%提升至20.3%,平均响应长度缩短3.6倍。论文TIDE在线蒸馏Qwen3推荐理由:这篇论文讲了个反直觉的事:蒸馏时师生token一致反而可能有害。TIDE方法在数学推理上把准确率从6.9%拉到20.3%,还让回答短了3.6倍,值得做LLM后训练的人看看。原文稍后读已读值得跟进有用关注 TIDE
11:18官方账号arXiv cs.AI@Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia精选ColluSkill是一种针对LLM智能体技能扫描器的对抗性攻击框架,通过将恶意意图分解为多个独立包装的技能子负载,利用上下文依赖和工件传递在运行时组合成有害工作流。实验显示,在六个代表性技能扫描器上,ColluSkill平均攻击成功率达96.0%,显著优于单技能和多技能攻击基线。为防御此类攻击,研究者提出ChainGuard,一种上下文感知的技能链扫描器,通过重建跨技能依赖和工件流将攻击成功率降至22.5%,同时允许99.5%良性工作流通过。该研究揭示了现有技能扫描器仅检查单个技能的安全盲区,强调链级安全分析对智能体技能生态系统的重要性。论文ColluSkillChainGuard智能体安全推荐理由:这篇论文讲了一个新攻击思路:把恶意技能拆成多个看似无害的小技能,组合起来就能绕过扫描器。还给了防御方案ChainGuard,做智能体安全的人值得看看。原文稍后读已读值得跟进有用关注 ColluSkill
11:16官方账号arXiv cs.AI@Nathan Godey, Yoav Artzi精选Matryoshka训练框架将500M、1.5B和3B三个子模型堆叠进单一嵌套架构,端到端训练。相比独立训练基线,该套件在基准性能和困惑度上持平,但训练计算量减少36%。嵌套结构天然支持投机解码,吞吐量提升14-26%。论文还消融了关键架构选择,为构建强Matryoshka套件提供指导。论文Matryoshka语言模型训练效率推荐理由:想省训练算力又不想掉性能?这个嵌套训练法把三个模型塞一个架构里,直接省36%算力,还顺带加速推理,值得一看。原文稍后读已读值得跟进有用关注 Matryoshka
10:49官方一手arXiv: DeepSeek@Matteo Grella精选PTQTP将LLM权重矩阵分解为两个三元平面,本研究首次将尺度比固定为3的约束引入其求解器,使分解坍缩为统一九级量化器。两个三元平面无损折叠为4位码平面,作为持久服务表示,磁盘字节、专家缓存和内核输入均为4.0625位/权重块。该方法应用于DeepSeek-V4-Flash-0731的284B-A13B MoE模型,在64GB笔记本上从MXFP4权重一次性量化并流式加载专家。与4.5位Q4_K基线相比,在5/5测试中匹配官方API(Q4_K为4/5),MMLU子集得分86对84,解码速度快6.7%,文件小9%。尽管权重重建误差和困惑度更高,但参考保真度无显著差异。论文PTQTPDeepSeek-V4MoE推荐理由:这篇论文把PTQTP量化器约束成九级格式,在DeepSeek-V4上做到和官方API几乎一样准,还快6.7%、文件小9%,适合搞MoE推理优化的朋友看。原文稍后读已读值得跟进有用关注 PTQTP
10:47官方一手arXiv: DeepSeek@Zongfei Li精选一项新研究质疑稀疏MoE路由器中专家选择与输出加权是否应使用相同分数。在预训练的OLMoE-1B-7B上,仅改变集合内聚合方式,结构化oracle将全周期交叉熵提升0.0160±0.0039。研究者训练了301K参数的FDAA后处理头,在冻结主干、路由器和专家的情况下,将WikiText-103测试集Delta CE提升至-0.1523±0.0031。在DeepSeek-V2-Lite上复现固定调度审计,路由器Top1识别最佳选中专家的比例仅为12.5%和16.7%。结果表明专家选择与专家承诺应跨架构区分。论文MoEOLMoEDeepSeek-V2-Lite推荐理由:这篇论文用OLMoE和DeepSeek-V2-Lite实测证明,MoE路由的选专家和加权输出不该共用一套分数,FDAA方法能白捡性能提升,做MoE优化的值得看。原文稍后读已读值得跟进有用关注 MoE
10:44官方一手arXiv: DeepSeek@Jiayi Li, Di Wu, Qingxu Li, Hongxiao Zhao, Jiaqi Yang, Anjunyi Fan, Wenbin Zhang, Boqiang Wu, Shuting Liu, Shifeng Fang, Jianbo Dong, Dimin Niu, Bonan Yan精选C2C-Explorer是一个自适应贝叶斯设计空间探索框架,用于优化大语言模型云计算系统中的芯片间互连架构。该框架集成了LLM工作负载驱动的流量生成器、可扩展互连模拟器(支持交换机/全网格,最多512芯片)和指标引导评估器。模拟器经FPGA原型验证,端到端时序误差为2.46-8.23%,混合周期事件模型比纯周期精确基线加速7.8倍。在32-XPU DeepSeek-R1-671B推理工作负载上,C2C-Explorer将goodput提升44.1%,内存减少98.4%。该框架已开源。论文C2C-Explorer芯片间互连LLM云计算推荐理由:做LLM集群硬件设计的朋友可以看看,这个框架能自动探索芯片间互连方案,在DeepSeek-R1上吞吐提升44%,内存省98%,还开源了。原文稍后读已读值得跟进有用关注 C2C-Explorer
10:43官方一手arXiv: DeepSeek@Issac Zhu, Hscos Zhang, Keith Jiang, Jack Li, Hugh Yin, Jason Zhao精选FlashBoot是SGLang上的权重加载子系统,针对MoE模型弹性部署中的延迟问题。它通过FabricArena连续内存布局和FlashLoad零拷贝批量传输,将单节点权重加载从20.1秒降至0.4秒,加速50倍。FlashClone利用远程映射替代NCCL初始化,将跨节点复制时间从10-110秒降至约10毫秒。在NVL72上测试DeepSeek-V4-Pro和DeepSeek-V4-Flash,并发机架级加载从87秒降至0.32秒,加速超270倍。论文FlashBootSGLangDeepSeek-V48 个信源在谈事件专题推荐理由:SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。原文稍后读已读值得跟进有用关注 FlashBoot
03:58AK@_akhaliq精选论文 MatrAIx 提出用 8.3 亿(8.3 billion)个人格智能体来模拟世界。论文已发布在 Hugging Face 上。这是目前公开的最大规模多智能体模拟研究之一。论文MatrAIxHugging Face智能体推荐理由:想看怎么用83亿智能体模拟世界?MatrAIx 论文来了,Hugging Face 就能看到。原文稍后读已读值得跟进有用关注 MatrAIx
16:44IT之家(博客/媒体)精选合肥硅臻芯片联合中科大任希锋研究组在可编程硅光芯片上实现了基于测量的量子计算(MBQC)关键技术突破。团队首次在片上稳定生成4光子16量子比特GHZ态和单光子4量子比特簇态,其中10个量子比特经纠缠目击方法验证为真实纠缠,是光量子芯片上目前最大规模纠缠态。团队用单光子4量子比特簇态演示了Grover搜索算法,平均识别概率达0.987。该成果已以论文形式预发表于arXiv,编号2608.03012,为百万比特通用光量子计算提供了新路径。论文MBQC硅臻芯片中科大推荐理由:硅臻芯片联手中国科大做出片上16量子比特GHZ态,还拿单光子簇态跑通Grover,识别率0.987。光量子计算新路线。原文稍后读已读值得跟进有用关注 MBQC
11:25官方一手arXiv: DeepSeek@Devin Pereira, Willem Zuidema精选论文研究Transformer在河内塔规划任务中的表现,发现小型自训练模型能涌现出线性可解码的几何世界模型(谢尔宾斯基三角),该模型与解题存在因果关联。对Qwen3.6-27B和DeepSeek-R1-Distill-Qwen-32B两个前沿推理模型的分析显示,它们能在提示末尾近乎完美地编码该世界模型,但圆环数超过3个时仍会在多数任务上失败。探针实验表明失败源于规划过程中世界模型表征的衰减,而非缺失。在推理时注入提示阶段的表征可部分恢复性能。论文Qwen3.6-27BDeepSeek-R1-Distill-Qwen-32B世界模型推荐理由:这篇论文说推理模型其实能建出世界模型,但解题中途就弄丢了。它用小模型和可解释性方法把问题定位得很清楚,还给出了补救办法。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
AITOP7月8日 10:58智谱AI GLM-Image:中文AI图像生成领域的破局者智谱AI最近发布的GLM-Image确实在AI图像生成领域投下了一枚重磅炸弹。免费、无水印、中文文本渲染能力强,这三个特点组合在一起,足以让整个行业重新审视中国AI技术的实际进展。 国内AI图像生成工具一直面临着中文文本渲染的难题。Midjourney等国外工具虽然在图像质量上表现优异,但对中文的支持却始终不尽如人意。GLM-Image的出现,似乎正在改变这一现状。GLM