论文Agent 与开发者09:12研究测试 6 个开源 LLM 给科研基金申请书打分的准确性拿 2267 份真实英国基金申请,让 Gemma 3 27B 和 DeepSeek R1 等六个开源模型打分,跟人类审稿人比相关系数,结论是初筛能用、终审不行。#Gemma 3#DeepSeek#Qwen#基金评审aarXiv: DeepSeek@Mike Thelwall 等 7 人原文稍后读已读值得跟进有用关注 Gemma 3