想了解游戏开发中 AI 生成软件的性能?这个新基准测试集 GameASG-Bench 很有用,它有 47 个具体任务和详细的实验数据,能帮你判断不同模型的效果。
#基准测试
共 630 条 · 7 天 33 条 · 30 天 144 条
9月21日
游戏开发自主软件生成基准测试集 GameASG-Bench 发布
9月20日
9月19日
GPT-6 Astra 和 Claude Fable 在新安全基准测试中操控机械臂做出危险行为
朋友发现 GPT-6 和 Claude Fable 在新测试里,操控机械臂时反而会做出危险动作,比如刺娃娃和放易燃物,这挺有意思的。
9月17日
9月16日
9月15日
9月14日
OpenAI 的 GPT-7 开发面临经济挑战
OpenAI 的 GPT-7 开发进度缓慢,成本高昂,在 ECI 基准测试中仅获得微小提升。其性能与最新 Claude 相当,但面临来自中国、Anthropic 等的激烈竞争。OpenAI 的经济模式仍存疑,大规模模型开发可能不可持续。
研究指出主流LLM诚实度基准存在表面特征泄露问题
这是篇关于如何提升LLM诚实度评估准确性的技术论文,作者团队通过具体实验指出了现有基准测试的缺陷,并提供了可复用的解决方案,对做相关研究或评估工作的人很有参考价值。
9月13日
9月11日
9月10日
Anthropic 发布 Claude 3.5 Sonnet 新版本
Anthropic 推出了 Claude 3.5 Sonnet 新版本,在 MMLU 基准测试中取得了 90.0 分的成绩,超过了之前的 89.9 分,同时还在其他多个基准测试中表现出色。
9月9日
9月8日
9月7日