大语言模型

concept · 首次出现 2026-05-22 · 最近出现 2026-09-08 · 累计提及 729

综述

大语言模型是当前人工智能领域最前沿的技术之一,指通过大规模数据训练、能够理解和生成人类语言的大型神经网络模型。近期,大语言模型领域呈现出开源与闭源并行发展、模型规模持续增长、应用场景不断拓展的态势。

大语言模型近期进展

  • 微信团队发布了WeLM系列模型,包括80B(A3B)和617B(A23B)两个版本,其中80B版本已应用于小微助手。微信团队在 X 发布 WeLM 系列:80B (A3B) 与 617B (A23B)
  • 腾讯微信公布了WeLM模型,80B版本已投入使用,617B版本仍在开发中。腾讯实际上有两个大模型:混元和WeLM,形成了双轨并行的发展策略。腾讯微信公布 WeLM 模型:80B 版已用于小微,617B 版开发中
  • DeepSeek开源了deepseek-harness评估框架,为大语言模型的性能评估提供了新工具,有助于推动模型标准化评测。DeepSeek 开源 deepseek-harness 评估框架
  • 当前焦点与观察点

    大语言模型的发展呈现出几个明显趋势:一是模型规模持续扩大,如微信团队发布的617B参数模型;二是资源效率成为关注点,WeLM系列主打资源效率;三是应用场景不断拓展,从内容创作到系统诊断等复杂任务。研究人员提出使用RAG和LLM自动构建复杂系统诊断用动态主逻辑知识图谱的新方法,展示了大语言模型在专业领域的应用潜力。用RAG和LLM自动构建复杂系统诊断用动态主逻辑知识图谱

    然而,专家也警示过度依赖AI可能导致推理能力缺失,特别是在医疗等关键领域。一项研究指出,医学生过度依赖AI可能造成推理能力缺失,这引发了对大语言模型伦理和应用的深入思考。专家警示医学生过度依赖AI或致推理能力缺失 同时,大语言模型的内容审核研究也取得进展,从简单的拒绝机制发展到更精细的警告系统,反映了模型安全性的提升。大语言模型内容审核研究:从拒绝到警告

    相关报道

    10 条在档