TTEL:利用错误定位实现推理时扩展
TTEL是一种利用固定或环境反馈进行token级错误定位的推理时算法。它通过比较条件概率隔离出错步骤,截断并重新生成,复用有效前缀。在Qwen3-8B上,TTEL在LiveCodeBench达到pass@64为71.0%,生成token仅约360.4k,远少于独立采样的735.0k。在AIME-2025和HMMT-2025数学基准上,TTEL也优于其他测试时基线。
TTEL是一种利用固定或环境反馈进行token级错误定位的推理时算法。它通过比较条件概率隔离出错步骤,截断并重新生成,复用有效前缀。在Qwen3-8B上,TTEL在LiveCodeBench达到pass@64为71.0%,生成token仅约360.4k,远少于独立采样的735.0k。在AIME-2025和HMMT-2025数学基准上,TTEL也优于其他测试时基线。
vLLM 项目发布实验性插件 vLLM AFD Plugin,由 Ascend、vLLM、阶跃星辰、蚂蚁集团、FastAFD 联合开发。该插件针对 MoE 模型提出 Attention-FFN Disaggregation(AFD)方案,将注意力和专家/FFN 路径作为独立服务运行,支持独立扩缩容。AFD 运行在 NVIDIA GPU 和 Ascend NPU 上,无需 fork 即可使用相同 vLLM 服务接口。
OpenForgeRL 是一个开源框架,用于端到端训练基于推理 harness(如 Claude Code、Codex)的智能体。它通过轻量级代理记录模型调用作为训练数据,并使用 Kubernetes 编排器在远程容器中执行 rollout。在 ClawEval 上达到 31.7 pass^3 和 55.9 pass@3,在 QwenClawBench 上达到 33.7。GUI 基准测试中,OSWorld-Verified 得分 37.7,Online-Mind2Web 得分 63.0,WebVoyager 得分 72.3。这些结果超越同规模开源基线,在 GUI 场景中甚至匹配或超越数倍大的模型。
Anthropic 发布 Claude Opus 5,API 价格每百万输入 Token 5 美元、输出 25 美元,与 Opus 4.8 相同,仅为 Fable 5 的一半。Frontier-Bench v0.1 上得分是 Opus 4.8 的两倍多,单任务成本更低。CursorBench 3.2 最高 Effort 档下与 Fable 5 差距不到 0.5%,任务成本仅一半。ARC-AGI 3 得分是第二名模型的三倍,Zapier AutomationBench 在相同成本下任务通过率约为第二名的 1.5 倍。安全方面自动行为审计失准得分 2.3,低于 Opus 4.8、Sonnet 5 和 Fable 5。
阿里云发布OvisOCR2,一个0.8B参数端到端文档解析模型。在OmniDocBench v1.6上以96.58综合得分登顶,首次超越流水线方法。该模型由Qwen3.5-0.8B后训练得到,采用SFT、RL、在线策略蒸馏和模型融合四阶段训练。以Apache 2.0开源,兼容vLLM和Qwen3.5推理生态,可无缝集成。
Claude Code v2.1.219 发布,默认 Opus 模型升级为 Claude Opus 5,支持 1M 上下文,定价 $10/$50 每百万 token。新增 sandbox.network.strictAllowlist 设置,可拒绝非白名单主机。新增 workflowSizeGuideline 设置和目录添加钩子,修复多项 bug,包括 Vim 模式、屏幕阅读器等。
在WAIC 2026上,阿里云宣布其数据库产品线(包括PolarDB、AnalyticDB、Lindorm等)向Agentic Database演进。新架构基于LakeBase、多模态记忆和全链路可观测性,旨在打造面向智能体时代的下一代数据平台。该平台将支撑大规模AI应用,实现从服务人到服务智能体的转变。
Hermes Agent 新增凭证防火墙功能,保护 Docker 沙箱中的真实密钥不会进入沙箱环境。沙箱使用替代令牌运行,本地代理在网络边界替换为真实密钥。即使沙箱被攻破,令牌在其他地方也无效,提升了 AI 代理运行的安全性。
Cursor 现已集成 Claude Opus 5,用户可直接在编程工具内调用该模型。在 CursorBench 基准测试中,默认努力模式下 Claude Opus 5 得分 66.7,与 Fable 5 的 66.5 基本持平。其价格仅为 Fable 5 的一半,并支持零数据保留功能。该更新为开发者提供了更高性价比的编程助手选择。
OpenRouter 宣布集成 SpaceXAI 的 Grok STT 模型,提供语音转文本功能。该服务支持 25 种语言,具备词级时间戳和说话人分离能力。定价为每音频小时 0.10 美元,用户可通过 OpenRouter API 直接调用。
NVIDIA CEO黄仁勋在首条推文中分享公司签署的公开信。信中指出开放模型能加强安全和网络安全,加速AI创新与扩散,并支持国家主权。信件强调世界既需要前沿封闭模型,也需要前沿开放模型。
NVIDIA CEO Jensen Huang在X平台发布首条帖子,分享一封公开信阐述开源模型的价值。信中指出AI将变革各行业,开源模型可增强安全与网络安全、加速创新扩散并赋能国家主权。他呼吁全球需要前沿封闭模型与开源模型并存。该帖获73个赞和7880次观看。
黄仁勋在 X 平台发表首条帖子,代表 NVIDIA 签署支持开源模型的公开信。他指出开放权重模型允许任何人下载、修改和运行,降低初创企业和学术机构的部署成本。他强调过度集中封闭模型会产生单点故障风险,开放权重能促进芯片、云和应用层多维度竞争。黄仁勋呼吁政策制定者扩大算力资源、投资共享数据及评估工具,避免过早限制以维持创新活力。
AMD与Cerebras在Advancing AI 2026活动中宣布联合开发AI推理解决方案,针对超低延迟场景。方案整合AMD Helios机架和Cerebras Wafer-Scale Engine,分别处理提示词/大上下文和Token生成/解码环节。结合使用2个计算引擎,预计将每瓦每秒token吞吐提升5倍。Cerebras晶圆级引擎在单块硅片上集成数十万个核心和数十GB SRAM,以减少外部网络瓶颈。
文章对比了当前AGI研究的两种核心思路,一种依赖扩大模型规模,另一种聚焦架构与推理能力创新。文中引用了多篇前沿论文和行业进展,但未提供具体模型名称或基准数据。
研究者发布两个 Lean 4 基准:Lean-QuantumAlg-Bench(36 个任务)和 Lean-QIT-Bench(40 个任务),用于评估 AI 在量子算法和量子信息理论上的定理证明能力。在四个模型(GPT-5.5、Kimi K3、DeepSeek V4-Pro、MiniMax M3)中,最高难度加权得分分别为 60.4/100 和 59.6/100。库增强推理(LAD)在所有八个模型-基准对比中均提升得分和完成率,最高提升 15.9 分。模型在量子模拟、量子学习、量子信息度量等领域的证明能力存在薄弱环节。
KroQuant提出一种Kronecker结构可逆变换,对每个32元素激活块进行在线量化,参数少于per-channel缩放的一半。在MI350 GPU上,KroQuant量化核比SmoothQuant核快14%。在PixArt-Σ、SANA和FLUX.1-schnell上以W4A4(MXFP4e2)量化,KroQuant在MJHQ-30K和SDCI上输出比SVDQuant和LoRaQ更接近FP参考,同时保持或提升图像质量。该方法通过离线LoRaQ权重校准吸收残差权重量化误差。
本研究通过提示Claude生成Prolog代码和测试,并使用LPTP进行形式化证明。Claude为前33个P-99问题生成了58个逻辑过程、508个测试和257个引理(共11800行证明)。作者手动检查了所有代码和证明,验证了类型、终止性、唯一性等性质。该实验展示了“vibe-coding/vericoding”方法用于Prolog编程的可能性。
现有视觉语言模型(VLM)在处理3D任务时因缺乏空间理解而表现受限。研究者提出VLM-IE3D框架,通过从RGB视频中学习隐式几何令牌(IGTs)和显式几何令牌(EGTs),增强3D空间感知能力。该框架采用3D感知适配器融合两种几何表示与2D视觉信息,无需额外3D输入。在3D视频检测、3D视觉定位、3D密集描述和空间推理等任务上,VLM-IE3D均取得一致性优越性能。代码和模型已开源。
该论文研究了大型语言模型(LLM)在道德推理中如何区分合理修正与谄媚顺从。通过三项研究,作者发现模型的判断更新沿着三个维度结构化:观点与模型初始立场的距离、该观点的来源归属(如来自模型自身先前判断的影响更大)、以及支持该观点的联盟结构。模型更易接受邻近立场,对看似自身先前判断的观点更敏感,对群体压力的反应存在差异。这些发现将谄媚重新定义为更广泛的判断更新过程的一部分,为区分建设性信念修正与谄媚顺从提供了基础。
教程演示基于百度Unlimited-OCR模型的完整OCR工作流程,涵盖GPU环境配置、高分辨率图像tiled推理与Base模式对比。支持处理密集布局、表格及跨页内容,实现可复现的端到端流水线。实验表明tiled模式能有效提升高分辨率(如4K以上)图像的识别准确率,而Base模式在速度上更优。
AWS博客介绍了如何利用Amazon SageMaker AI和PyTorch构建一个可解释的银行下个最佳产品推荐系统。该系统采用多塔神经网络与注意力机制,实现高准确率的个性化推荐。关键设计包括可解释性模块,满足银行监管对推荐原因透明化的要求。文章提供了完整的架构设计和决策说明。
Milvus团队指出,2026年embedding模型选择更依赖数据形态而非排行榜。对于文本知识库,Qwen3 Embedding、Jina v5 text、BGE-M3、OpenAI text-embedding-3、Voyage、Cohere等密集embedding值得测试。对于PDF、图片、截图、音频、视频,推荐Gemini Embedding 2、Jina v5 omni、Cohere Embed 4、Qwen3-VL-Embedding、Voyage Multimodal等模型。长文档可用Voyage context-4进行上下文化片段嵌入。复杂布局可考虑ColPali风格的多向量检索。基准如MTEB、MMEB、ViDoRe可辅助筛选,但最终验证需用自己的文档和查询。Milvus 2.6新增Text Embedding Function,将嵌入管道移入数据库层。