腾讯Hy4在WorkBuddy上线,排队人多但能力强,国产模型中领先但抽象推理仍是短板。
腾讯 Hy4 preview 在 WorkBuddy 平台上线,8月28日至9月10日期间限时免费。目前已有2615位用户排队等待使用。该模型在软件工程、办公分析、游戏开发和科学研究四个领域有专门优化。评测显示,Hy4在18项国产模型对比中13项第一,但在抽象推理方面仍有差距。
Hy4 preview 在 WorkBuddy 里也上线了 8.28-9.10 期间限时免费,不过。。免费用户这个排队队伍,是不是过于庞大了。。2615 位用户排队,这跟不可用没啥区别了 😂
Hy4 preview 在 WorkBuddy 里也上线了 8.28-9.10 期间限时免费,不过。。免费用户这个排队队伍,是不是过于庞大了。。2615 位用户排队,这跟不可用没啥区别了 😂 meng shao @shao__meng 腾讯也加速卷上来了! Hy4 preview 开源发布(注意:还只是 preview,参考 Hy3, Hy4 正式版应该会更强一截!) hy.tencent.ai/research/hy4-p… # 模型参数信息对比 Hy4 Preview | Hy3 770B / A49B | 295B / A21B 1M | 256K # Hy4 Preview 以真实工作产出为中心 数据构建方式:与腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家合作,围绕他们实际交付的工作构建训练数据。这是把内部产业场景转化为训练信号的做法,是腾讯相对纯模型公司的差异化资源。 四个能力域:软件工程(含前端的"视觉品味与交互质量",这点在报告中用 Three.js 博物馆案例展示)、办公分析(多文件混乱上下文 → 可交付的文档/表格/PPT,报销审核案例强调多版本制度适用性判断和欺诈识别)、游戏开发(单 prompt 生成可玩原型,支持 Unity/团结引擎多轮迭代)、科学研究(AI 研究、分子动力学、凝聚态物理、纯数学)。 最值得注意的一个信号:报告披露 Hy4 Preview 曾并行管理多个 Codex 会话,在一项小模型后训练任务中扮演"研究者"角色——判断方向、组织实验、协调 Codex 同时优化多个评估目标,最终在全部 8 个基准上超过 Codex 单独探索。 # 模型评测数据 总体评测 报告给出两组数据:10 项对标全球前沿(GPT 5.5、Gemini 3.1 Pro、Claude Opus 4.8 及国产三家),18 项对标国产模型(DeepSeek V4、GLM 5.3、Kimi K3)。结论可以概括为:国产阵营胶着领先(13/18 第一),全球前沿单项突破、整体追赶(2/10 第一)。 三个核心发现 1. 优势高度集中在 agentic 与搜索。 两项全球第一——Terminal-Bench 3.0(77.3,超 GPT 5.5 约 1.7 分)和 BrowseComp(83.6,超 GPT 5.5 约 2.2 分)——都落在智能体编程和智能体搜索上。代际提升最大的也恰是这两项加 ARC-AGI-2:分别 +18.9、+16.9、+16.4 个百分点。这说明这一代的后训练资源明确投向了长周期任务能力,"为最难的工作而生"不是纯营销话术,有数据支撑。 2. 对国产模型是"胶着中的领先",不是代差。 18 项中 13 项第一,但未第一的 5 项里有 4 项输给 GLM 5.3(IMOAnswerBench、GPQA-Diamond、SWE-bench Verified、tau3-bench),且分差多在 1 分以内。这与正文 163 名内部专家盲测的结果(对 GLM 5.3 均分 2.99 vs 2.92,净胜率仅约 6 个百分点)相互印证:Hy4 坐上了国产头把交椅,但 GLM 5.3 贴身紧逼,Kimi K3 全面落后半个身位,DeepSeek V4 在 agentic 类任务上掉队明显(Terminal-Bench 62.2、BrowseComp 64.0)。 3. 对全球前沿的最大短板是抽象推理。 ARC-AGI-2 上 Hy4 仅 52.6,落后 Gemini 3.1 Pro(77.1)达 24.5 分、GPT 5.5(70.7)18 分——这是全部数据中最刺眼的差距,说明在需要泛化而非模式匹配的推理上,国产模型整体(GLM 48.3、Kimi 45.4、DeepSeek 35.0)与美国前沿仍有代际距离。数学与科学推理(AIME、IMOAnswerBench、GPQA)则进入第一梯队,落后幅度在 1–4 分的可追赶区间。 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 184 📊 1 ⚡