牛阿尔法非中国大模型可能性大
Niklas发现OX Alpha服务路径位于北美,可能位于美国东部;通过49个请求的测试,排除了中国大模型的可能性。
Niklas发现OX Alpha服务路径位于北美,可能位于美国东部;通过49个请求的测试,排除了中国大模型的可能性。
Ox Alpha AI模型上线限免,DeepSWE跑分达80%,优于Claude Fable 5的65%。模型支持多模态输入,与智谱架构高度吻合。
NVIDIA自建编码工具优化CUDA GPU内核,在ARC-AGI-3的25款游戏中全通关,实现183个关卡。将使AI模型和内核的运行、优化、后训练变得容易,预计将有1亿AI开发者。
模型持续吸收注意力约束,未来将转向人类注意力而非模型自身。模型名:智能体;约束类型:注意力约束;未来趋势:转向人类注意力。
@petergostev在YouTube上分享了对Qwen3.8-27B的初印象,与DeepSeek v4、Qwen 3.8 Max等模型进行了一对一测试,评分即将公布。
Vercel 推出 Is Agentic 工具,评估网站对 AI Agent 的可访问性、可理解性和可使用性,提供分数、证据和改进建议。Is Agentic 类似于 SEO 领域的 Lighthouse,但针对 AI Agent。Ora 引擎执行扫描,Is Agentic 发布分数和修复建议。Is Agentic 还提供为 AI Agent 准备的接口集合,包括稳定 URL、内容协商、MCP server、官方 CLI 和公开 REST API。
Firecrawl 推出开发者索引,包含 7000 万+ 开发文档、README、Issue 和 PR。支持语义检索、匹配段落直返、丰富过滤等功能。Claude Opus 4.8 驱动,Recall @10 达 0.63,领先同行。
Netflix将其多年推荐引擎与内部语言模型GenRec对比,结果显示GenRec表现更佳。GenRec将观看行为转换为纯文本,而非依赖数千个手工特征。Netflix称其为‘早期但很有希望的步骤’。
凯迪拉克全新XT5 PHEV在成都车展首秀,预计9月初上市。搭载Momenta R7世界模型,车身尺寸4888/1957/1685mm,轴距2863mm。采用奥特能5C三元锂电池和双电机全路况插混系统,CLTC纯电续航215km,综合油耗6.05L/100km。R7世界模型具备深层环境理解能力,优化自主决策。
雷鸟 iO AI 眼镜采用全新萤火光引擎 Nano,实现等效 33 英寸屏幕,屏幕亮度达 1800 nits。首创全天智记功能,持续采集语音信息并转写为文字,帮助用户记住重要事项。雷鸟 iO AI 眼镜定位为人类增强 AI 眼镜,旨在融入人的视野、感知和行动之中。
Agentic adoption surged, reaching over 10B tokens weekly, up from 10B tokens annually just a year ago. This rapid progress highlights the field's evolution.
Vercel AI Gateway显示开放模型权重占比已达62%,较两个月前增长显著。企业采用仍处于早期阶段,工具需适配模型无关性。
Omdia 预计 2028 年 AI-ASIC 出货量达 1050 万块,超 GPU 的 1010 万块。谷歌 TPU v8i 推动谷歌云增长,微软、Meta 等公司计划推出重大芯片项目。联发科、高通等厂商加入 AI-ASIC 领域,三星为特斯拉制造车载 AI-ASIC。
微软安全团队通过分析恶意软件行为,发现 30 多个 MacSync Stealer 相关域名,并指出域名数量非核心,行为模式更具检测价值。MacSync Stealer 窃取 macOS 用户敏感信息,微软建议企业降低执行 Terminal 命令风险,并启用云端保护功能。
AI工程师世界博览会2026的AI建筑师与AI工厂追踪直播正在进行中。Safia Abdalla分享Oz Cloud Agent平台构建,Tisha Chawla和Susheem Koul讨论AI代理的FinOps,Abduallah Mohamed探讨AIDAChip的芯片设计团队协作,Archana Kamath和Tyler Gillam介绍模型路由,@patrickdebois和Tessl讨论代理编码的可扩展性,@remilouf分享代理框架的考虑,Sebastian Fox展示Composo的生产临床AI笔记,@edorado93和Anthropic讨论为代理分配预算而非代币。
本文探讨了在AI开源课程中,如何通过改变绑定工程来提升编码智能体的性能,并介绍了三种运行智能体循环的方式及其背后的提供商经济学。LangChain的Terminal-Bench实验表明,仅改变绑定工程,相同模型下,智能体排名从30位提升至前5。
普林斯顿大学和加州大学圣地亚哥分校的研究发现,技能主要通过结构化工作流程提升AI智能体,而非增加知识。但随着技能库扩大,智能体找到正确指令的难度增加。
本文探讨了AI智能体当前存在的问题,如幻觉、成本效率低下等,提出了解决方案。通过将上下文获取视为主动推理,提出了一种名为“最优提问”的方法,并在25至300个候选者的二进制和多路任务上进行了基准测试。
In schema-guided complex document extraction, coding agents like Claude Code and Codex serve as cost-effective baselines for longer documents, offering similar accuracy to specialized OCR tools. On short documents, specialized OCR tools are more cost-efficient. Coding agents excel in long documents by leveraging various tools and prompt caching, though they may be less efficient for shorter texts compared to specialized extractors. Learn more in the ParseBench paper.
英国AI安全研究所研究人员使用心理测量法表明,流行的语言模型安全基准未能衡量一个一致的特性。全面阻止请求可以人为地提高安全评分,即使模型在日常使用中变得越来越不实用。该研究还提供了一种方法来捕捉在测试中比正常使用时更加谨慎的模型。
本教程探讨了如何使用NeMo Guardrails框架设计基于LLM的应用生产级安全。从简单的提示过滤到实现分层架构,包括确定性PII删除、检索过滤、输出掩码和基于策略的工具门控。通过集成状态多轮评估和详细激活跟踪,展示了如何构建可审计、安全且成本效益高的AI助手,能够管理敏感的金融互动,同时保持严格的合规标准。
Sebastian Raschka发布48分钟视频,讲解Claude模型中的token采样、水印检测和移除方法。
Uncle Bob与Matt Pocock探讨AI时代软件工程基本功,分享智能体协作实战方法,包括转向确定性工具链、多智能体流水线等。
AI代理误删200个工作负载,临床笔记错误率1/20,芯片设计师限制bash使用,优化预算平均节省78%,Warp开源后GitHub星标数增加3倍
Linus Torvalds在调试Linux内核时,多次借助AI完成繁琐工作。AI多次表示问题无法解决,但仍然持续添加调试代码并进行分析。Torvalds表示AI是他的得力助手,并让AI撰写了提交信息。