Feyn AI发布SQRL模型系列:写SQL前先查数据库
Feyn AI推出SQRL文本转SQL模型系列,旗舰版SQRL-35B-A3B(35B参数,3B激活)在BIRD Dev基准上达70.6%执行准确率,超过Claude Opus 4.6个百分点。该系列还提供4B和9B蒸馏版本,支持自托管部署。其核心创新是在生成SQL查询前先用只读探针检查数据库结构与样本数据。
Feyn AI推出SQRL文本转SQL模型系列,旗舰版SQRL-35B-A3B(35B参数,3B激活)在BIRD Dev基准上达70.6%执行准确率,超过Claude Opus 4.6个百分点。该系列还提供4B和9B蒸馏版本,支持自托管部署。其核心创新是在生成SQL查询前先用只读探针检查数据库结构与样本数据。
Perplexity AI 发布了开放基准 WANDR,包含500个证据密集型任务,用于评估研究智能体在搜索广度和深度上的表现。该基准测试智能体能否发现多个符合条件的实体,并为每个实体提供可验证的引用证据。当前 Perplexity Search as Code 以 soft F1 0.363 和 hard F1 0.133 的成绩领先。
OpenMOSS 开源了 MOSS-Transcribe-Diarize-0.9B 模型,参数规模 0.9B,支持 128K 上下文,最长可一次处理约 90 分钟音频。该模型采用 Whisper-Medium 编码器 + Qwen3-0.6B 风格 decoder,端到端完成转写、说话人分离和时间对齐,无需级联流程。在单张 4090 显卡上,RTF 为 0.017,5-10 分钟录音约 30 秒转完,并支持热词增强。模型以 Apache 2.0 协议开源,可商用。
面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,在Artificial Analysis(AA)榜单中以17分取得全球4B以下模型最高分。该模型原生支持混合思考,提供512K超长上下文窗口,可处理整本长篇小说或数十万行代码。训练阶段执行了200B规模的Agent Midtraining和百万条轨迹的Agent SFT,具备工具调用、深度搜索等智能体能力。目前已适配AMD、英特尔、联发科、高通等全球主流芯片,覆盖华为昇腾、英伟达等9款芯片。模型即将在Hugging Face、魔搭等平台开源。
月之暗面于7月19日发布Kimi K3大模型,拥有2.8万亿参数和100万Tokens上下文。该模型在Frontend Code Arena榜单中以1679分超越Claude Fable 5,排名第一。彭博社报道称,这一成绩打破了美国AI领先中国的固有认知。伯克利教授斯托伊卡表示,差距已从6-9个月缩小到2-3个月。市场质疑硅谷数千亿美元投资的回报,企业用户开始通过模型路由服务选用中国模型。
Anthropic 的 Claude Code 从 v2.1.181(6月17日发布)起使用用 Rust 重写的 Bun。相比原版 Bun,Linux 启动速度提升 10%。作者通过检查二进制文件,发现内置的 Bun 版本为 v1.4.0(尚未公开发布)以及 563 个 Rust 源文件路径。该变更已部署到数百万设备上。Jarred Sumner 表示,这次升级几乎没有用户察觉。
阿里云百炼于7月19日上线世界模型产品HappyOyster 1.0。该模型从海量视频中学习物理规律,用户输入一句话或一张图即可生成可交互数字世界。提供世界探索和实时导演两种模式,分别支持1分钟连续交互和3分钟以上分支叙事。已开放Android/iOS/Web三端SDK,在阿里云百炼开启灰测。可用于游戏原型、互动短剧、虚拟陪伴等场景。
本文介绍了10个开源无代码/低代码平台,用于构建LLM应用、RAG系统和AI智能体。每个平台均附带已验证许可证、代码仓库和最佳用例。这些工具将检索、智能体和工作流以可视化及纯英语工具形式交付。
7月19日,蚂蚁数科在世界人工智能大会发布Agentar2.0,首批预置200个岗位级数字专家模板和数百个Skills级工具。平台基于自研LingDT模型提升Token效率,搭配Agentix操作系统实现全流程调度。通过区块链技术为每个Agent赋予可信身份,促进多智能体协同。目前已在金融行业落地超300个智能体,并向能源、出行等领域拓展。
燧原科技与中兴通讯在 2026 世界人工智能大会上发布云燧 ESL64-O 超节点,采用自研 AI 芯片和 OEX 正交无背板设计,实现 0 线缆互联,大幅降低互联成本。燧原还联合先封科技推出适配 AI 算力芯片的 CoPoS 面板级先进封装样品,具备热膨胀系数可调、高频信号损耗极低等优势。该公司已获科创板上市注册批复,拟募集 60 亿元用于第五代和第六代 AI 芯片研发。
WAIC 2026达成的行业共识显示,AI手机的核心竞争已从模型能力转向智能体OS入口点,包括系统级权限控制和服务分发渠道。手机厂商正试图通过深度系统集成(如调用摄像头、短信、位置等底层权限)来建立壁垒,而超级应用(如微信、支付宝)原本掌握的用户入口正被剥离。这场博弈将决定未来3年手机行业话语权归属,目前华为、小米、OPPO等均展示了各自的智能体框架方案。
Dean Ball认为Moonshot的Kimi模型在agentic coding上表现不错,大致匹配2026年Q1的最佳模型,但测试发现其token消耗大,成本优势不如预期。他拆分中国开源动因:75%源于对AGI风险的战略盲目,25%出于实际需要——中国实验室无法在付费服务上竞争,且境外不愿付费。他的核心观点是免费模型削弱前沿实验室收入,减缓顶级模型进度,可能推动AI走向类似国家基础设施的“AI共产主义”乌托邦地狱。他还指出监管已通过Gold Eagle和Mythos断块制造不确定性,迫使公司回避中国模型,并认为开源模型的国家安全担忧已接近不可忽视。
在WAIC 2026期间,千里科技公布ASD 4.1技术预览,实现零断点全场景D2D通行。ASD 4.1基于物理AI大模型,提升对小动物、特殊车辆等识别能力。千里科技计划年底推出ASD 5.0版本。阶跃星辰发布智能体原生操作系统Step AOS,千里科技将其应用于汽车领域。搭载在极氪8X上的超级智能体“超级Eva”已上线,支持模糊出行需求自动导航和本地生活服务调用。
中国在WAIC 2026上宣布,MAZU智能预警系统将于2026年7月前部署到30个国家。该系统整合了风云系列卫星、AI气象模型和地面雷达网络,构成一套完整的气象基础设施出口方案。MAZU旨在利用国产卫星数据和AI算法提升全球灾害预警准确率,覆盖台风、暴雨等极端天气场景。
国地共建人形机器人创新中心与华为联合发布全国首个具身智能实训场样板点。该实训场打通了不同品牌人形机器人的训练数据接口,支持工业搬运、巡检、服务类等多种机型。实训场可完成高温、雨天、狭小通道等复杂场景的仿真训练,并对外开放中小机器人企业试用名额。样板点搭载了具身智能VLA大模型,基于国产算力底座,性能指标处于行业前列。
Google Deepmind 提出 GenCeption 方法,利用视频生成器完成深度估计和语义分割等经典视觉任务。该方法在仅使用合成视频训练的情况下,匹配甚至超越当前最先进系统的性能。研究团队认为视频生成器内部已经隐式包含了一种通用世界模型,这挑战了传统计算机视觉的范式。GenCeption 在 KITTI 深度估计基准上取得了与基于真实数据训练的模型相当的结果,证明了其有效性。
Epoch AI测试了Pangram、GPTZero和Originality.ai三种主流AI文本检测器。在风格模仿的文本中,最高18%的AI生成内容未被识别。对于科学写作场景,漏检率攀升至48%。这些检测器在科学写作领域实际使用最多,但效果最差。
Kimi K3在Arena's Frontend Code盲测中击败Claude Fable 5和GPT-5.6 Sol,排名第一。在DeepSWE基准上,K3得69%且每任务成本$4.65,而Sol得73%成本$8.39,Fable 5得70%成本$21.63。在Artificial Analysis的Intelligence Index上,K3得57分,仅比Fable 5的60分低3分。该模型在长时编码和知识工作方面表现突出,在AA-Briefcase排名第二。但幻觉率为51%,接近Grok 4.5的54%。开放权重将于7月27日发布。
Simon Willison分享了一个技巧:通过预加载脚本打印出claude二进制捆绑的Bun版本。只需创建包含console.log("embedded bun:", Bun.version)的TypeScript脚本,设置环境变量BUN_OPTIONS="--preload=/tmp/bun-version.ts",然后运行claude --version即可看到版本号。当前显示为1.4.0,即Bun的Rust版canary版本。这个方法比手动查找更直接可靠。
Pi Coding Agent 的本地管理面板通过 localhost:3001 即可使用,零 npm 依赖,纯 Node 加静态页面。支持管理模型、子代理、运行状态、会话、用量、工作区和识图。读取 ~/.pi/agent 配置,写操作自动备份,导出 JSON 时自动脱敏 API Key。无需额外安装,打开浏览器即用。
Stability AI 与 MusicHackspace 合作举办免费实践工作坊,教用户利用 Stable Audio 3.0 构建自定义音频应用和工作流。参与者可学习如何超越提示工程,实现生成式音频的深度集成。工作坊面向开发者和创作者,无需付费即可动手操作。