#合成数据
做 Text-to-SQL 的同学可以看看 FALCON 这个框架,用小开源模型本地就能造出比现有基准更难的训练数据,还不用调外部 API。
Perplexity 在招研究员,方向是多智能体和合成数据,出钱还开放研究成果,9 月 30 日前可申请。
Perplexity AI 招募了 Andrew Gordon Wilson,他将领导持续学习和合成数据等前沿研究,如果你对加入这个团队感兴趣,不妨联系他。
建筑行业缺数据?看ONESTRUCTION怎么用AWS的合成数据和三阶段训练搞出个专用模型,挺有参考价值。
想测测 AI 在生物学研究里的实战能力?OpenAI 搞了个 GeneBench-Pro 基准,129 道题,合成数据防作弊,快看看你的模型能得几分。
Meta 搞了个 AutoData,让 AI agent 当数据科学家自动造训练数据,比自己写死的流水线强不少,在多个推理任务上效果更好。
想提升合成数据训练的检测模型效果?这篇论文用YOLOv12做了18组实验,证明间接光照比直射光更靠谱,还给了具体设计建议。搞工业视觉的一定要看。
想审计合成数据是否偷学了你的信息?这篇论文给出了一个轻量级方案,无需模型权限,只需输出和留出集就能揪出隐私泄露。
合成数据在科研中越来越常见,但偏差问题一直让人头疼。这篇论文给出了一个可操作的统计框架,让做社会科学调查或AI评估的研究者可以放心地用合成数据做推断,值得关注。
物理 AI 训练数据难获取是行业痛点,NVIDIA 这套工具直接降低了合成数据门槛,做机器人或自动驾驶的开发者值得关注,可以大幅减少手动标注成本。
做合成数据后训练管线的团队会感兴趣——这篇论文用实验证明了来源证据门控和适应性恢复策略能显著提升数据质量,比简单重采样更高效,建议做数据筛选的开发者点开看看具体方法。