腾讯混元开源PlanningBench:评估LLM规划能力的可扩展框架
PlanningBench解决了LLM规划能力评估缺乏标准化基准的问题,做AI Agent或任务规划的研究者和开发者可以直接用这个框架测试和训练模型,建议点开看看具体任务和验证方式。
PlanningBench解决了LLM规划能力评估缺乏标准化基准的问题,做AI Agent或任务规划的研究者和开发者可以直接用这个框架测试和训练模型,建议点开看看具体任务和验证方式。
做长期协作智能体开发的团队终于有了专门优化记忆的插件——Hy-Memory 解决了记忆碎片化和 token 浪费的痛点,建议做 Agent 应用的开发者直接试试。
长期使用 Openclaw 的开发者常遇到“三周轨迹”困境——从蜜月期到降级使用,Hy-Memory 直接解决了这个痛点。做 Agent 应用或依赖 AI 协作的团队,建议试试这个插件,能让你的 Agent 真正成为长期记忆伙伴。
做多语言翻译的开发者终于有了能本地跑的开源模型——Hy-MT2 的 1.8B 版本比微软 API 还强,且量化后仅 440MB,手机芯片就能推理,建议直接下载试试。
手机端就能跑的高质量翻译模型来了,做本地化应用、离线翻译工具或移动端 AI 产品的开发者可以直接下载试用,440MB 的轻量版值得关注。