Harvey推出Harvey Tenet:基于Kimi K3的微调模型,用于长期法律代理工作
Harvey发布首个微调模型Harvey Tenet,在LAB任务完成率上几乎翻倍,但只有一项基准数据得到独立验证。
Harvey发布首个微调模型Harvey Tenet,在LAB任务完成率上几乎翻倍,但只有一项基准数据得到独立验证。
自2025年2月6日起,AI代理在OpenRouter上消耗的令牌数量已超过人类。代理使用量增长了14倍,而人类使用量仅增长2.8倍。尽管如此,近70%的代理令牌消耗来自廉价的缓存提示,因此实际成本增长速度远低于原始数据所显示的速度。
Ox Alpha 模型、DeepSeek V4 Flash、Vision EXP 模型和 Claude Fable 5 模型进行对比,Claude Fable 5 在排版细节和色散处理上表现更佳;Ox Alpha 模型在多模态和代码能力上表现出色,可还原 3D 玻璃材质质感。
归藏(guizang.ai)对 Ox Alpha、DeepSeek V4 Flash、Vision EXP 和 Claude Fable 5 模型进行对比,发现 Claude Fable 5 在排版细节和色散处理上表现更优。
Ox Alpha 利用多模态和代码能力,通过 WebGL 技术成功还原网页,实现 3D 玻璃材质质感和透视效果,文字位置和排版细节与原图一致。
诺亦腾发布 HiPHI 数据集,包含 617.5 小时高精度人体运动数据,已上线 Hugging Face 平台。数据集由 132 名演员提供,支持人形机器人学习、数字人开发。
MCP(modelcontextprotocol.io)和Skills(agentskills.io)等工具采用Unix哲学,强调小型、高效程序和可嵌入性,支持构建CLI、后台代理和软件工厂。
Vercel与Ora合作推出免费工具Is Agentic,通过Ora的100多项检查,对公共网站进行AI代理准备度评分。
橡鹿机器人发布三款烹饪机器人,包括多模态烹饪AI基座CookingMuse厨启、3K视觉AI炒菜机器人和具身烹饪机器人现炒方舟。3K视觉AI炒菜机器人融合AI视觉与烹饪智脑,可实时判断食材状态,提升后厨运营效率。现炒方舟是一款微型无人后厨解决方案,实现全流程无人化闭环。
OpenAI Codex & ChatGPT 团队负责人回应用量消耗过快问题,明天为所有 Codex 订阅用户重置额度,并修复三个影响用量计算的问题。公司还发现一种全新方案提升使用效率。
NVIDIA应用深度学习研究副总裁@ctnzr将参与Arena Conversations新节目,探讨教师模型在构建强大能力中的作用、训练后推理挑战的增长、开源模型的重要性以及这对NVIDIA构建Nemotron的意义。节目将于8月24日早上9点(东部时间)/6点(太平洋时间)播出。
因三星、SK海力士和美光等供应商的DRAM短缺,搭载Vera Rubin和Grace Blackwell芯片的Nvidia服务器价格预计将上涨约15%。价格上涨影响了微软、谷歌和Meta等云巨头,他们在投入巨资建设AI基础设施的同时,也在支持他们试图摆脱的市场供应商的力量。
Anthropic的年度收入达到650亿美元,预计第三季度将盈利。尽管如此,其Opus 5模型在7月份发布后,用户增长缓慢,Ramp AI指数显示其市场份额仅为8.0%。与此同时,OpenAI的年度收入增长35%,达到400多亿美元,GPT 5.6的发布推动了公司业绩。
Starcloud完成2.5亿美元A轮融资,研发GPU卫星,计划建太空数据中心;英伟达等投资,去年已送Starcloud-1卫星上太空,训练AI模型;Space-1 Vera Rubin模块开发中,未来将建8.8万颗卫星集群,提供20GW计算能力。
安世中国CEO张秋明透露,过去11个月已向全球客户交付超过400亿颗芯片,强调在技术封锁下主动重建,开启市场结构本土化转型,并率先实现12英寸功率半导体平台量产。
Google DeepMind提出一种无需训练的模型架构进化方法,通过模型自身反馈进行架构修改。在Gemma3系列上,自适应变体将困惑度降低23%,GSM8k准确率提升21%,仅进行轻微超参数调整。
模型评估方式存在问题,建议使用标准测试套件。模型质量应与最小套件如Pi和Hermes Agent比较。目前缺乏标准化方法,但模型可能未来能动态生成套件。Claude模型在这方面已有尝试,但不够一致。测试套件工程是AI公司关注的焦点,但优化过于个性化。
研究多智能体系统在代码审查中的应用,提出Adversarial Review方法,使用三个智能体进行审查,在LiveCodeBench上优于五智能体基线,在SWE-PRBench上实现最高F1值。
Jacob Peake分享一篇关于AI芯片架构的长篇博客,涵盖NVIDIA、AMD、TPU、Trainium、Cerebras、Groq等主要架构,分析架构、扩展(向上扩展和向外扩展)和软件堆栈,帮助理解架构及其权衡。
Drew Breunig指出,在Fable出现之前,优化编码工具似乎没有必要,因为新模型的出现往往能解决大部分问题。然而,Fable的出现虽然令人惊叹,但其高昂的成本使得Opus、5.6、K3和GLM等模型已经足够应对大多数需求。因此,人们开始思考哪些工作应该放在哪里。
吴恩达发布AI工程技能图谱系列第一篇,聚焦构建与部署AI应用,强调AI应用输出不可预测性,提出六项核心技能:LLM基础、数据为模型提供Grounding、构建Agentic系统、Evaluation-Driven Development、生产运营AI软件、机器学习基础。
当前智能体(Codex、Cowork)采用两步文档处理方法:快速解析和即时VLM处理,提高知识工作准确性。Opus 5作为第二遍处理工具,但成本高。Llama_index提供更优解决方案:LiteParse和LlamaParse,支持多种文档类型和子文档处理。
Gergely Orosz 提出简化AI服务接入方式,建议服务或App提供MCP或cli接口,直接访问用户常用的Agent,无需额外内置Agent。适用于非前沿AI实验室用户。
康威定律指出团队沟通结构影响系统架构,AI时代AI Agent可能改变传统分工模式,但人类大脑仍为瓶颈。AI辅助下,个人效率提升,组织效率需关注资源整合。
GitHub 成为主要沟通平台,帮助调试问题。搜索 PRs 和 issues,可找到参考解决方案。