论文多源确认精选10:47STOCKTAKE:用公平预言衡量LLM智能体感知与行动差距这篇论文用STOCKTAKE基准把LLM智能体的‘没看懂’和‘看懂了却没行动’分开了,四个主流模型的表现差距比想象中大。#STOCKTAKE#Claude Sonnet 5#GPT-5.4#智能体2 个信源在谈事件专题aarXiv: DeepSeek@Sagar Deb, Ashwanth Krishnan3 个信源在谈原文稍后读已读值得跟进有用关注 STOCKTAKE