形式预训练领跑,AI效率与智能体双突破
2026年8月6日,形式推导预训练以100B token达到80%准确率(节省36B token)成为今日最大看点;跨模型KV缓存迁移通过岭回归映射复用预填充,Qwen3 14B到32B键解释方差达79%;智能体应用同步突破:GDPevo基准验证自我进化提升16%,AgenticECO在3D-IC维修中清除七例,MCP桥接打通云端代理与本地工具。测试时缩放与语义优化亦为效率提升提供新路径。
模型发布/更新
5 篇Karpathy 的新测试:让 Claude Opus 5 用 100 万 tokens 把《指环王》开头做成 3D 场景,2 小时生成了 5500 行代码。
VulcanBench 实测:Qwen3.8-Max 跑一趟 126 美元,DeepSeek V4-Flash 只要 13.6 美元,便宜 10 倍还更快。选性价比就 DeepSeek,选准确率就 Grok 4.5。
产品发布/更新
5 篇Meta放出了终端编程代理Muse Code,用Muse Spark 1.2驱动,跑大型仓库更稳,崩溃还能恢复,写代码的可以上手试试。
Meta下场做编程智能体了,Muse Code能直接处理整个代码库的任务,从规划到验证一条龙,用Muse Spark 1.2驱动,可以试试。
装了多个 AI 编程 Agent 的话,用 Metrik 一个桌面工具就能看所有配额和 token 消耗,不用挨个翻界面了。
行业动态
5 篇Hugging Face老板发推聊AI监管分层:别卡开放权重,API和App分开管。用钢铁和汽车的比喻把道理讲得很顺。
AMD给Linux内核提了个eSPI新框架,统一了BIOS和TPM的通信方式,补丁已经在AMDI0070上跑通了。
Demis 转任 Alphabet 首席科学家,Koray 接掌 Google DeepMind 日常,他自己要专注搞 AI 科学和药物研发了。
论文研究
5 篇这篇论文把197个终端界面应用打包成基准,拿4个大模型和随机点击对比,发现随机探索还挺能打,但大模型单次操作效率更高。他们开源了tuicov和tuibot,想测TUI的可以试试。
这篇把GFlowNets训练用信息几何重新梳理了,用Fisher-Rao度量做自然梯度,还给了三种能实际算的场景,图模型工具也用上了,搞生成流网络的可以看。
技巧与观点
5 篇Mobileye用Bedrock AgentCore搭了个客服智能体,把本地系统和云打通了,还讲了怎么过安全和治理这关,挺实在。
Stripe 工程师用开源 Deep Agents 一周做出了人人爱用的 AI 同事 Kai,不用配置就懂公司内部流程,挺有意思。