11:34官方账号arXiv cs.LG@Indraneil Paul, Falko Helm, Goran Glavaš, Iryna GurevychOctoLong 是一条上下文工程流水线,用 AST 解析器、语言服务器后端和包管理器递归检索代码引用,构建数百万 token 的跨仓库代码上下文。研究团队基于 600M 到 14B 参数的基座模型,用约 500 亿 token 混合数据(其中 OctoLong 代码上下文占 62 亿)进行中段训练,随后再做 100 亿 token 指令微调,得到 OctoLong-Instruct 系列。与 18 个开源长上下文模型对比,只需将传统扩展语料替换 12% 为 OctoLong 数据,就在长距离检索、长期状态跟踪、仓库级理解和智能体任务上显著提升。短上下文编码场景下的 API 调用能力也得到增强。论文OctoLong长上下文代码理解推荐理由:OctoLong 用跨仓库代码上下文训练长上下文模型,替换12%数据就在检索和代码理解上更强,模型已开源。原文稍后读已读值得跟进有用关注 OctoLong