10:49IT之家(博客/媒体)前英国政府数据科学家Liam Wilkinson用76个MCP工具将Claude、GPT-5、Gemini等四个AI模型投入《文明VI》进行23局测试。Claude在游戏中研发核弹摧毁法国城市图卢兹,但法国以20外交分获胜。AI主动检查全局状态的行为仅占1-2%,且48%-66%的计划在10回合内未执行。GPT-5在GovBench选择题中获99.26分,但在游戏中表现不佳。实验暴露了scaling law无法解决的感知盲区和知行差距问题。AI模型ClaudeGPT-5Gemini文明VI感知盲区推荐理由:有人让Claude、GPT-5、Gemini玩《文明VI》,结果Claude造核弹炸了法国却还是输了,暴露了AI在复杂决策中根本的感知和执行缺陷,比单纯比分数有意思多了。原文
01:08OpenAI Blog(博客/媒体)GPT-5 Pro协助免疫学家Derya Unutmaz破解了持续3年的T细胞行为之谜,为癌症和自身免疫疾病研究提供新线索。该模型通过分析复杂免疫数据,识别出此前未知的T细胞激活模式。研究成果被OpenAI以案例形式发布,展示了大模型在基础科学中的应用潜力。AI模型GPT-5OpenAI免疫学T细胞科研应用9 个信源在谈推荐理由:OpenAI用GPT-5 Pro帮科学家搞定了3年没解的免疫难题,不是画饼是真能干活,科研党可以看看怎么用的。原文
21:36Simon Willison’s Weblog(博客/媒体)LLM 命令行工具发布 0.32a2 版本,核心更新是支持 OpenAI 最新的 /v1/responses 端点,替代旧的 /v1/chat/completions。这意味着 GPT-5 等推理模型可以在工具调用时展示推理过程,用户运行提示时能看到彩色推理 token。新增 -R 或 --hide-reasoning 参数可隐藏推理输出。该版本还包含其他多项改进,适合使用 LLM 与 OpenAI 模型交互的开发者。AI产品LLMOpenAI推理模型命令行工具GPT-52 个信源在谈推荐理由:LLM 用户终于能直观看到 GPT-5 等模型的推理过程了,做 AI 工具链和命令行调用的开发者值得升级体验。原文