AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

LLM-as-a-judge

共 2 条相关 AI 资讯
8月12日
03:28
03:28elvis@omarsar0
Oumi 宣布其平台现在不仅能自动构建专用 AI 模型,还能将其部署到生产环境,并从生产经验中持续学习改进。Oumi 可自动生成数据、配方和模型权重,甚至编写 LLM-as-a-judge 评估器。该平台旨在帮助企业摆脱租用通用模型的模式,将自身数据与专业知识转化为专属智能。Oumi 声称企业目前仅使用通用模型中约 1% 的相关智能,却支付高昂费用。
AI产品Oumi智能体模型部署

推荐理由:Oumi 现在能一条龙搞定专属模型:造数据、调模型、部署上线,还能自己当裁判评估,适合不想租通用模型的企业。
原文
7月10日
09:45
09:45官方一手arXiv: DeepSeek@Zheng Yu
本论文在16设备华为Ascend 910系统上使用CANN和vLLM-Ascend部署了两个大模型推理负载:基于W8A8 MoE模型DeepSeek-V4-Flash的LLM-as-a-judge安全对齐评估流水线,以及基于DeepSeek-V4-Flash-Vision的多模态医学视觉基准测试(MMMU和MMMU-Pro)。为保证运行可靠性,需要12个源码级补丁,并关闭多个高吞吐特性以维持数值正确性。论文总结了8类平台限制:不完整算子支持、脆弱并行、低阶内核数值错误、图编译不成熟、不稳定高级特性、可扩展性差、可观测性弱和生态碎片化。同时量化了集成工作量、并发行为和基准质量,验证了负载的正确性。
论文Huawei AscendDeepSeek-V4-FlashLLM-as-a-judge
事件专题

推荐理由:这篇论文实测了华为昇腾跑MoE和多模态大模型的工程代价——需要打12个补丁、关掉一堆特性才能不出错,想用非GPU加速器的团队先看看这个。
原文
精选全部日报登录