#斯坦福AI实验室
共 4 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「斯坦福AI实验室」标签的资讯、产品与论文,按刊登时间排,新的在上。
7月22日
7月10日
LLM-as-a-Verifier:验证成为新的扩展轴,在多个Agent基准上达SOTA
斯坦福团队搞了个新框架,不用传统评分,用细粒度验证加logprob分布,直接刷了四个Agent基准的SOTA,还能顺便提升RL效率。
6月4日
John Yang 谈 ProgramBench 与 AI 编程基准演进
想了解 AI 编程基准测试的来龙去脉和未来趋势?John Yang 的分享能帮你理清 ProgramBench 在其中的位置,做 AI 评估或编程工具的团队值得一听。
5月30日
论文16:46
斯坦福AI实验室发布Theory of Space基准:测试AI能否主动构建空间心智地图做机器人或空间AI的开发者值得关注——这个基准直接测试模型能否像人类一样主动探索并建立空间认知,而不是被动接收数据,看完会对当前模型的局限性有更清晰的认识。