08:50andrew chen@andrewchen一位用户在X上分享使用GLM 5.2一周的体验,认为该模型表现令人满意。他将使用GLM 5.2比喻为早期在Pentium PC上运行程序的感受,表示短期内足够。同时他指出,随着技术发展,用户总会期待更强的新模型。该推文获得13条评论、2次转发和30个点赞。AI模型GLM 5.2智谱开源模型推荐理由:看看有人实测GLM 5.2一周的真实感受,别被'够用'骗了,他说后面肯定还有更好的。原文稍后读已读值得跟进有用关注 GLM 5.2
23:37向阳乔木@vista8用户开始对Grok 4.5进行正式评测,要求它开发一个用于评测大模型的案例网站。初步测试中,模型的Skill功能调用准确率较高,但网站开发效果还有待观察。该评测侧重考察模型在真实任务中的工具使用和编程能力。AI模型Grok 4.5大模型评测Skill调用推荐理由:有人正在测Grok 4.5的真实水平——让它写个评测网站,目前Skill调用挺准,来看看能不能真搭出来。原文稍后读已读值得跟进有用关注 Grok 4.5
18:35IT之家(博客/媒体)Arena平台公布6月29日~7月5日大模型对战综合榜,Anthropic的claude-fable-5以1509 ELO分蝉联第一,领先第二名claude-opus-4-6-thinking仅5分。前十名全部为美国厂商,gemini-3.5-flash上升2位至第11名,glm-5.1下滑3位至第22名。国产模型中,阿里qwen3.7-max-preview以1475分排名第15,百度ernie-5.1以1468分排第27,小米mimo-v2.5-pro以1466分列第29。代码榜中Anthropic垄断前九,claude-fable-5得1563分居首,国产qwen3.7-max-preview位列第10。数学榜由claude-opus-4-6-thinking以1518分领跑,国产kimi-k2.6排名第13。AI模型claude-fable-5qwen3.7-max-previewernie-5.110 个信源在谈事件专题推荐理由:这期榜单告诉你哪家模型综合最强、代码最好、数学最牛。国产的qwen3.7-max-preview在代码榜进了前十,值得看看。原文稍后读已读值得跟进有用关注 claude-fable-5