8月19日
22:39
22:39Philipp Schmid@_philschmid
artificialanalysis.ai平台发布的模型测试数据显示,其模型在GLUE基准测试中获得高分;测试结果显示该模型本轮得分达154分;与此前测试相比,此次成绩体现模型性能提升。
推荐理由:artificialanalysis.ai发布了最新模型测试数据,能直接查看各模型在GLUE的分数,和之前版本比信息更全了。
7月9日
03:59
03:59lmarena.ai@lmarena_ai
72°
xAI 的 Grok 4.5 模型已在 arena.ai 平台的 Battle Mode 和 Agent Mode 中开放测试。该测试允许用户直接体验模型的对抗推理与智能体能力。平台方表示将很快发布模型的评估分数。目前该测试已有超过 850 次浏览。
推荐理由:想试试 Grok 4.5 的新能力?现在去 arena.ai 就能直接玩上对战模式和智能体模式,分数很快会出,先测为快。
6月22日
23:25
23:25向阳乔木@vista8
开发者vista8在社交平台表示本周将调整任务主线,包括测试几个新模型、参加字节跳动火山引擎大会,以及处理孩子初中升学志愿填报。同时手头还有多个开源项目正在开发中,计划本周开源。
事件专题

推荐理由:看到一位开发者真实的周计划,有模型测试、开源项目,还有孩子升学,挺接地气的。
6月17日
23:30
23:30官方账号Decoder@Maximilian Schreiner
精选
OpenAI研究人员提出一种新方法,用于预测AI模型在发布后出现错误的频率。该方法旨在弥补当前标准安全测试的不足。研究团队通过分析模型内部特征与测试数据来估算失败概率。该工作可能帮助开发者更早发现潜在风险。
事件专题

推荐理由:OpenAI研究者搞了个预测模型出错率的方法,能补上安全测试的漏洞,让发布更靠谱。
6月3日
5月21日
07:59
07:59Patrick Loeber@patloeber
Google AI Studio 宣布即将推出移动端应用,允许用户在手机上构建 AI 想法。该应用将支持随时随地访问 AI Studio 的功能,包括模型测试、提示词调试等。目前尚未公布具体上线日期,但已开放预告页面。这对移动端 AI 开发者和爱好者来说是一个重要更新,意味着 AI 实验不再局限于桌面端。
推荐理由:移动端 AI 开发终于来了——Google AI Studio 的移动版让开发者可以在手机上随时调试模型和提示词,做 AI 原型验证的团队值得关注,出门在外也能继续工作。