这篇论文提出一个叫AutoTrainess的智能体,能自己跑模型训练流程,不用人盯着。在PostTrainBench上比纯命令行强,还能帮DeepSeek-V4涨分。
全部动态
如果你对多语言OCR或印地语文本识别感兴趣,这篇论文揭示了主流模型在天城体上的真实差距,尤其是GPT-5.5表现不如开源Qwen3-VL-8B。
Nature Medicine那篇论文把模型考倒了,但作者直接把考卷开源了。后来GPT-5.5 Pro重新考,分数涨了10%!
动物福利问题有了AI专属的代理基准TAC,实测Claude Opus 4.7刚过一半,加个提示词能暴增60%,暴露了模型在实际行动中的盲区。
这篇论文测试了GPT-5.5、Claude Opus 4.7和Qwen3-Coder-Next用智能体写并行Julia代码,在超算上跑192核,发现小规模还行,大规模容易死锁或OOM,开源模型最差。做HPC或Julia并行开发的人值得看。
RAH 解决了长上下文推理中智能体扩展性的核心瓶颈,做复杂编码任务或智能体系统的开发者可以直接参考其设计思路,效果提升显著。
做基因组学分析的团队终于有了一个可复现的AI能力评估标准——EpiBench揭示了当前最强模型在专业科学判断上的天花板,做生物信息学工具开发或AI+生命科学研究的建议点开看看差距在哪。
TAHOE 解决了 Text-to-SQL 从原型到生产部署的痛点——无需微调模型即可大幅提升 SQL 生成准确率,做数据库应用或数据分析的开发者可以直接用这套方法优化现有 LLM 管线。
做 AI 编程智能体或评估基准的团队,这篇论文揭示了主流基准(如 SWE-Bench)掩盖的能力差距——强智能体在陌生语言上的元编程策略值得借鉴,建议点开看具体实现方法。
Moonshine 把数学研究从“解题”推向“猜想的自动生成”,做AI for Science或数学自动化的研究者值得关注,它展示了智能体如何自主发现并推进新问题。
做多模态智能体或空间推理研究的团队,这个基准直接暴露了当前模型在真实交互任务上的短板——GPT-5都只有17.4%成功率,值得用来检验自家模型。
做特殊教育NLP或低资源语言模型微调的团队,这篇论文提供了一个可复现的CGFD流程,直接解决了繁体中文IEP生成的数据稀缺和隐私问题,值得点开看具体实现。
做 AI 模型评测或选型的人必须看——这篇研究用严格对照实验证明,你看到的模型能力分数可能更多反映的是 scaffold 设计而非模型本身,建议重新审视自己的评估流程。
AI 安全研究者终于有了评估隐性操纵的专用工具——CogManip 覆盖 15 种策略、1000 个场景,做模型对齐和红队测试的团队可以直接拿来用。
做AI智能体开发的团队会立刻警觉——你精心设计的记忆系统可能在悄悄退化。这篇论文用实验数据戳破了「自动总结记忆」的幻觉,建议所有用LLM做长期任务的开发者点开看看,别让记忆成为瓶颈。
这篇论文揭示了标签选择能显著改变模型对误导信息的采纳率(最高差 84 个百分点),做 RAG 系统或上下文增强应用的开发者需要警惕:你用的标签可能无意中放大了错误信息的影响。建议点开了解如何控制这一变量。
做城市模拟、交通规划或政策分析的团队,终于有了一个无需训练就能解释预测结果的方案——AgentMob 在模糊场景下准确率提升 18%,建议直接试一下开源代码。
KINA 解决了 LLM 知识评估中学科代表性不足和排名不稳定的痛点,做模型评测或研究 LLM 知识边界的团队可以直接用这个基准来更可靠地对比模型,建议点开看看具体的设计和排名细节。
做AI Agent开发的团队常手工写技能文档但效果有限,SkillOpt用优化器自动迭代技能文件,零推理开销且效果显著,值得尝试。
做多语言智能体或网页浏览任务的团队会立刻意识到差距——韩语场景下最强模型准确率不到一半,说明现有评估严重偏向英语。做韩语 NLP 或本地化产品的开发者可以直接用这个基准测试自己的模型。
做 LLM Agent 开发的团队终于有了实证依据:给智能体塞技能文档比纠结怎么写更管用。建议直接参考这个实验设计来优化自己的 RAG 或工具调用策略。
做智能体开发的团队终于有了靠谱的技能优化方案——SkillOpt 解决了手工调技能越调越差的痛点,而且最终产物是一个可读文件,部署零成本。做 prompt 工程或 Agent 框架的开发者值得细读。
做CI调试或AI编程智能体的团队终于有了可依赖的日志缩减基准——LogDx-CI直接告诉你哪种工具省钱又有效,建议做DevOps或Agent开发的点开看。
空间生物学研究者终于有了衡量AI科学推理能力的硬核基准——SpatialBench-Long 要求智能体从复杂空间数据中推导真实结论,而非简单跑流程。做生物信息学或AI for Science的团队,值得看看当前模型的表现差距在哪里。
医疗 AI 终于有了真实场景的语音对话基准——111 小时医患对话数据,覆盖四种疾病,做医疗对话系统的团队可以直接拿来训练和测试模型。Claude Sonnet 4 在句子选择上领先,但所有模型都过度自信,这个发现值得关注。
做Agent框架或提示词工程的开发者,终于有了系统级的方法来优化Skills,不用再靠手动瞎改和调试了。建议直接看论文实验数据,特别是编辑预算的设置,对实际落地很有参考价值。