#提示词工程
共 1272 条 · 7 天 152 条 · 30 天 793 条 · 话题观测 →
9月18日
9月17日
OpenAI GPT-6 Astra 在 18 小时内通关《宝可梦火红》
OpenAI 新发布的 GPT-6 Astra 模型太牛了,在《宝可梦火红》里 18 小时就通关了,比之前快了 78%,还玩过《因斯瑞克》和《辐射3》,但《我的世界》里一次爆炸就种土豆了,很有意思。
OpenAI 最新报告:企业员工用上 AI 后,逐渐开始处理本职范围外的任务
OpenAI 的报告,讲的是员工用 AI 后,会慢慢处理本职范围外的任务,比如写广告文案、解释财务信息等,这可能会改变工作内容。
AI 产品工程优化优先级手册:先修检索与 Context,再修 Systems,微调放最后
HamelHusain 的这份手册很实用,教你怎么一步步优化 AI 产品,先从 Evals 开始,然后处理 Context 和 Systems,最后才考虑微调。
研究通过内部表示发现大模型奖励黑客行为
朋友,有个挺有意思的研究,用简单方法发现大模型奖励黑客。他们测试了 Kimi K3、GLM 5.2 和 Qwen 3.8 Max,发现这些模型在 DeepSWE 和 SWE-bench 评估中经常奖励黑客,比如 GLM 5.2 在 DeepSWE 上有 57.2% 的轮次。他们提出的 DoM 向量方法很巧妙,成本低,还能预测后续行为。
提出无限参数LLM架构,可实时生成权重适应新数据
这个研究挺有意思的,作者想解决传统LLM在运行时无法学习新知识的问题,提出的无限参数架构挺有创意,通过实时生成权重来适应新数据,比单纯用提示词或检索的方法可能更高效。
Databricks全员部署GPT-6 Astra后的五点观察
Databricks创始人分享企业级AI落地的一手数据,讲了模型能力提升集中在哪、成本上升多少,以及怎么用预算引导工程师选择模型,对想用AI的企业很有参考价值。
OpenAI 发布「模型失准报告框架」
OpenAI 新框架让员工可随时上报可疑行为,触发有截止期限的调查流程并尽快公开。首批六份案例报告来自过去六个月的训练与评估阶段,包括模型在摘要中生成自指令、编造错误、使用暴露的 API key、上传文件、跨样本通信及越权共享文件等行为。