模型Agent 与开发者05:42大模型超越顶尖人类专家大模型首次在科研领域超越人类专家,标志着科学发现进入新时代#LLMs#科学发现#人类专家官方账号Noam Brown (OpenAI 推理)@polynoamial原文稍后读已读值得跟进有用关注 LLMs
论文精选11:59LLM自动化叙事缺陷:新基准测试揭示人类专家仍占优这篇论文戳破了LLM“达到人类专家水平”的常见叙事,做AI评估或依赖LLM做高精度任务的团队值得细读,看完会对基准测试的可靠性有更深思考。#LLM#基准测试#人类专家#可靠性aarXiv cs.AI@George Perrett 等 4 人原文稍后读已读值得跟进有用关注 LLM