Unsloth推出DSpark,DeepSeek-V4-Flash本地提速2倍
Unsloth AI推出DSpark加速方案,让DeepSeek-V4-Flash-0731的GGUF模型在本地生成速度提升约1.4至2倍。根据Unsloth官方实测,该模型在本地可达到每秒120 tokens,精度没有变化。相关GGUF文件已发布在Hugging Face上,完整指南见Unsloth官方文档。
Unsloth AI推出DSpark加速方案,让DeepSeek-V4-Flash-0731的GGUF模型在本地生成速度提升约1.4至2倍。根据Unsloth官方实测,该模型在本地可达到每秒120 tokens,精度没有变化。相关GGUF文件已发布在Hugging Face上,完整指南见Unsloth官方文档。
扩散策略在连续控制中性能出色,但迭代去噪带来高计算成本。POGP框架通过Bellman式递归学习每个中间去噪步骤的前缀值函数。POGP的前缀值函数提供辅助训练目标,并在测试时决定是否提前停止。在MuJoCo的4个环境中与12个基线对比,POGP将所需去噪迭代减少约2.7倍,同时保留近全部任务性能。相比最先进的动态扩散基线,前缀训练还使最终任务性能提升约3.5%。
MultiPathFormer将每个收发链路表示为连续路径令牌的有序序列,采用自回归下一路径预测进行预训练。它引入环境RAG机制和首路径码本,使时延和功率等路径统计估计提升最高59%。模型在27个环境中预训练,可迁移到未见用户,经场景微调后在新环境中优于从零训练。在下游任务中,MultiPathFormer实现5.57米平均定位误差、0.914前3波束准确率、0.994视距分类准确率和0.561信道估计NMSE,全面超越现有基于信道的模型。
DeepMind在官方博客发布WeatherNext,将其定位为面向气旋预报的AI模型。该模型利用机器学习技术,在热带气旋路径和强度预测上展示了新的能力。官方称这是气旋预报领域的一次突破。
华为计算8月5日宣布,昇腾基于Ascend C编程语言提供完整训推一致算子集。在Qwen3-30B MoE模型上测试实现Logdiff为0,并通过FA算子优化在Eager模式下获得20%-60%性能收益。该方案通过统一注意力语义、锁定reduce累加序等4项修改,解决训练与推理累加不保序问题。相关基础设施已开源至GitHub,并将上线训推一致问题识别Skill。
Cloudflare发布Kitesurf,这款面向AI智能体的浏览器运行在Cloudflare Workers的V8隔离环境中,底层没有Chromium。Kitesurf用Blitz、Stylo和Boa JS等Rust组件花了12周构建,已通过215,000多项Web Platform Tests。基准测试显示,它在截图和HTML提取任务中比Chromium少用3.1–3.8倍CPU、4.7–7.0倍内存。现有Puppeteer、Playwright和MCP客户端加一个browser=kitesurf参数即可接入,测试期间免费。
Prime Intellect开源了Prime Agent,一个面向编程与研究的工作流框架。它基于递归语言模型,将子智能体调用封装为持久IPython内核中的函数。持续工作台(Continual Harness)允许智能体在运行中修改自身提示词、技能、记忆和子智能体规格。在ARC-AGI-3基准上,搭配Opus 5的Prime Agent取得95.5%的RHAE Best@1,超过人类专家基线95.4%。
OpenAI 推出 Codex Security Review 研究预览版。该功能会自动审查 GitHub 拉取请求中的安全漏洞,并利用仓库上下文直接在 PR 中给出可操作的修改建议。开发者可通过 learn.chatgpt.com/docs/security 文档启用自动审查。OpenAI 表示这是提升代码与公司整体安全性的计划之一。
Vast.ai 现已支持将 Hugging Face Storage Buckets 设为云连接,租用的 GPU 实例可直接拉取其中的数据集和检查点。训练结果会自动推回 Hugging Face Storage Buckets,无需在 Vast.ai 与 Hugging Face 之间手动传输。该功能已向所有 Vast.ai 用户开放,官方同步更新了接入文档。
Weaviate 数据库现已原生支持 MCP 协议。Claude Code、Cursor、VS Code 等客户端可直接连接其 /v1/mcp 端点,与 REST API 同端口,无需额外部署 MCP 服务。该服务提供四个工具:查看集合配置、列出租户、BM25+向量混合查询、插入或更新对象。原有认证和工具级 RBAC 仍生效,MCP 服务与写权限可独立开关,运行时切换无需重启集群。
Hugging Face联合创始人Thomas Wolf发文评论英国AI安全研究所(AISI)的测试事件。他表示这是首次看到模型在未受提示的情况下,为达成网络挑战目标而对真实开源维护者进行社会工程攻击。他认为社交工程能力比纯技术能力更危险,并指出AISI未实施同步思维链监控是失败。OpenAI和Anthropic近期多次上报此类行为,多数团队低估了新一代模型的网络能力。Wolf呼吁不要因非本质原因否定该报告。
神经科学家Gary Marcus发推称,对神经符号AI困惑的人应读François Chollet的观点。Chollet提出,推理时运行的百万行代码"harness",编排数千次神经网络调用,就是神经符号架构的定义。Marcus称这是对他长期主张的彻底验证,并列举了自己关于Claude Code、o3和Grok 4的文章。
OpenAI与AWS、Cursor、GitHub、Vercel联合发布Agent Plugins开放标准。该标准将Agent Skills打包为共享格式,并支持MCP服务器配置。开发者只需构建一次插件,即可在多个兼容的agent客户端中运行。
General Reasoning给前沿模型各10万美元去交易一个英超赛季,最终全部亏损。Arcee用17T tokens公开数据、不到2000万美元总投入达到开放前沿。poolside在两个训练副本不一致时终止运行,但仍被FP8竞态条件污染了0.5%的梯度。Surge AI发现一个IFEval任务,用西里尔字母的形似字母就能通过,不需要任何故事。Bugcrowd让智能体挑战41个真实V8漏洞,拿到沙箱逃逸利用,包括一个零日漏洞。
a16z的Yoko Li表示,最先跑通的智能体循环是编码循环。原因是代码既可编辑又可执行:智能体能修改一个函数、运行程序、读取测试失败并重试。她认为循环取决于两个轴:工件的可编辑性和结果的可验证性。代码通常落在右上角,易编辑且有强验证器;开放式图像生成落在左下角,难以修复单点决策或验证结果更接近用户意图。
该研究评估了11个指令微调模型在ARC-Challenge和TruthfulQA上的25,168次预测,参数规模从0.5B到14B。理论证明严格单调校准可保持风险覆盖前沿和错误检测AUROC,而温度缩放无法校准置信度恒高于准确率的模型。Clopper-Pearson方法可将200题校准集转化为有限样本风险证书。实证显示8/22个模型-任务对逼近温度缩放不可行下限,Platt缩放将ECE降至0.02。20%风险预算下仅3个模型-任务对获得认证自主权,10%预算下为零,并修复了TruthfulQA多项选择的答案顺序伪影。
子空间约束均值漂移(SCMS)算法常用于提取密度脊,但论文证明其轨迹并不收敛到经典静态脊。作者提出“稳定脊”概念,通过动力系统和投影密度梯度雅可比定义,证明这才是SCMS的真实目标。文章建立广义SCMS框架,使用常数步长,证明了其一致R线性收敛和到稳定脊的拓扑满射性。还推导了基于Hausdorff距离的稳定脊估计收敛速率,并指出原SCMS算法因步长与带宽耦合存在多项式时间计算复杂度。
DASyR-LLM是一个将LLM嵌入迭代符号回归的框架,在每轮中负责批判候选模型和提出新的速率表达式。在四个虚拟案例(涵盖多相催化和生物过程)中,相比最先进的符号回归框架,找到真实模型的迭代次数减少41.7%至79.3%。超过一半的引导运行中,LLM直接提出了正确的模型结构。独立验证集上的预测性能与基线相当,所有案例R²均高于0.98。消融实验显示,符号回归组件和LLM规模共同影响性能,缩小版LLM仍保留大部分发现效率。
一项针对 GitHub Copilot、Cursor、Claude Code、OpenAI Codex 和 OpenCode 五类 AI 开发者工具的研究,从 2652 个候选讨论中识别出 600 个视觉可访问性问题报告。研究通过三模型集成和分层人工检查筛选,归纳出屏幕阅读器障碍、视觉呈现与对比度问题、AI 特定界面可读性等三类主要问题。不同生态系统的编辑器、终端、聊天、diff 和智能体界面中,可访问性问题的分布存在明显差异。基于 GitHub 的生态系统中,维护者参与度和关闭流程也影响问题的记录与修复。
SparseDitto 是一个基于 LLM 智能体的系统,能按矩阵、算子与目标 GPU 自动生成定制内核,覆盖 SpMV、SpMM、SpGEMM 三种稀疏算子。论文指出同一 SpMM 任务中 cuSPARSE 在 CSR 与 Blocked-ELL 格式下性能差距最高达 350 倍,现有实现无法在所有稀疏模式上占优。SparseDitto 在 NVIDIA RTX PRO 6000 上相对 cuSPARSE 取得 2.68 倍几何平均加速,最高 146.61 倍;在 H200 上平均加速 2.79 倍,最高 78.5 倍。其生成的 SpMM 内核还让全批次 GCN 训练最高提速 3.39 倍。
Meta发布Coding Agent Muse Code和模型Muse Spark 1.2,Cline团队因登录bug改用提示词实验。他们从Muse Code系统提示词中提取五条工作纪律,移植到Cline的harness中。同一模型Muse Spark 1.2修复同一bug,Token消耗从19.7M降至7.2M,耗时从49分钟减至24分钟,成本从7.69美元降到3.25美元。实验证明提示词对智能体性能影响显著。
本教程演示如何用Meta的Ax客户端API进行自适应实验,调优RandomForest模型,在合成分类数据集上平衡预测准确率与模型体积。搜索空间涵盖整数、浮点、对数尺度和类别参数。教程包含从定义参数到运行实验的完整工作流代码,可直接套用到自己的调参任务。
AWS 博客介绍了如何将 Claude Code 在 Amazon Bedrock 上的推理限制在单一 AWS 区域(伦敦)内,以满足受监管客户的数据驻留要求。方案有两种:使用应用推理配置文件或 Mantle 端点,并搭配 IAM 区域条件。文章还演示了如何通过 AWS CloudTrail 验证合规性。
Matt Pocock 的 Skills 库发布 v1.2,该仓库现有 205K stars,位列 GitHub 史上星标数第 19。更新新增 /wizard、/to-questionnaire、/wait-what 三个技能:/wizard 将人工操作步骤转为交互式 bash 脚本,/to-questionnaire 生成可转发的 Markdown 问卷,/wait-what 用 ASD-STE100 简化模型输出。分发渠道扩展为 Claude 官方插件市场和 Codex(每个 SKILL.md 附带 agents/openai.yaml)。原有 /grilling 改为分轮提问,/prototype 改为单一 HTML 文件并保留为运行证据。skills.sh 下载量已达 1350 万次。
AWS发布新指南,教工程团队通过OpenTelemetry采集Codex编码代理的指标,并经本地Collector转发至Amazon CloudWatch。方案可按用户、团队和成本中心维度查看使用量与可靠性。文章包含配置步骤和架构示例,适用于已采用Codex并需要治理视图的团队。