韩国 Solar Pro 4 亮相 Agent Arena,与 MiniMax M2.7 同级

韩国 AI 模型 Solar Pro 4 首次亮相 Agent Arena:排名 44,与 MiniMax M2.7 同级

精选理由

Upstage 发了主打智能体任务的 Solar Pro 4,定价不高,Agent Arena 排名和 MiniMax M2.7 同级,适合处理长文档和多轮工具调用。

AI 摘要

韩国 Upstage 发布商用大模型 Solar Pro 4,上下文窗口 512K,输出长度 128K token。定价方面,输入每百万 tokens 0.3 美元,缓存读取 0.06 美元,输出 1.2 美元。该模型在 Terminal-Bench v2.1 得分 57,τ³-Banking 得分 23,AA-LCR 得分 71。在 Agent Arena 榜单排名第 44,与 MiniMax M2.7 同级,也是首个登上该榜单的韩国实验室模型。

原文 · IT之家

韩国 AI 模型 Solar Pro 4 首次亮相 Agent Arena:排名 44,与 MiniMax M2.7 同级

IT之家 8 月 13 日消息,韩国人工智能实验室 Upstage 今天(8 月 13 日)发布博文, 宣布推出 Solar Pro 4 模型,定位为面向复杂 AI 智能体任务的商用大模型。 Solar Pro 4 模型上下文窗口为 512K,最高输出长度为 128K token,支持用户在单次会话中加载多份合同、报告和数据文件,官方博文中暂未披露参数量相关信息。 定价方面,IT之家援引博文介绍,附上相关信息如下: 每 100 万 Tokens 输入价格为 0.3 美元 (IT之家注:现汇率约合 2 元人民币) 缓存读取(Cache Read)每 100 万 Tokens 输入价格为 0.06 美元 (现汇率约合 0.41 元人民币) 每 100 万 Tokens 输出价格为 1.2 美元 (现汇率约合 8.1 元人民币) 智能体任务方面,Solar Pro 4 的主要提升集中在更接近真实工作的评测上,包括长文档、终端任务和多轮工具调用。官方列出的 3 项核心结果为:Terminal-Bench v2.1 得分 57,τ³-Banking 得分 23,AA-LCR 得分 71。 Upstage 以虚构咖啡品牌 Solarbean Coffee 的门店选址分析作为演示任务。输入材料包括 1 份门店开设政策文档和 6 份市场数据文件。 Solar Pro 4 在 3 条提示词内完成 10 个候选站点的政策筛选,并按顺序生成 3 类交付物:Excel 工作簿、审查报告和幻灯片。 IT之家查询公开资料,发现该模型已现身多家 AI 模型评测平台。@ArtificialAnlys (Artificial Analysis) 是一家领先的国际独立 AI 基准测试与分析机构,专门针对大语言模型(LLM)、视频生成、AI 音乐等多领域进行无偏见的性能与托管成本评估。 @arena ( Arena.ai ) 是当前全球 AI 行业最权威的“人类偏好”大模型即时对战与评测平台。它源自著名的 LMSYS Chatbot Arena 团队,采用类似国际象棋的 Elo 积分系统,通过纯粹的人类开发者双盲盲测(Blind A/B Testing)来对全球 AI 模型进行高强度的淘汰赛排名。 该机构指出,@upstageai 的 Solar Pro 4 是首个登上 Agent Arena、Code Arena: WebDev 和 Text Arena 排行榜的韩国实验室。 在  Agent Arena 榜单中,Solar Pro 4 模型排名第 44 位,与 MiniMax M2.7 和 Nemotron 3 Ultra 等模型处于同一水平。

韩国 Solar Pro 4 亮相 Agent Arena,与 MiniMax M2.7 同级 · AI 热点