#模型测试
共 15 条 · 7 天 0 条 · 30 天 4 条
信息流里打上「模型测试」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月30日
9月22日
论文10:11
PEON 方法:用概率本体建模运行设计域,让 AI 系统测试有统计依据搞自动驾驶或列车感知测试的可以看看:PEON 把运行设计域建成概率模型,能自动采出代表性测试用例,还给出何时能停测的判据。
9月10日
9月7日
8月27日
8月22日
8月19日
模型22:39
artificialanalysis.ai模型在GLUE基准测试获154分artificialanalysis.ai发布了最新模型测试数据,能直接查看各模型在GLUE的分数,和之前版本比信息更全了。
7月9日
Grok 4.5 在 Battle Mode 和 Agent Mode 中开放测试,分数即将公布
想试试 Grok 4.5 的新能力?现在去 arena.ai 就能直接玩上对战模式和智能体模式,分数很快会出,先测为快。
6月24日
Anthropic Mythos 模型数小时检出美国政府机密系统漏洞
Anthropic的Mythos模型能快速找到政府机密系统漏洞,而且只用了几个小时,不是几个星期。想了解最新AI安全测试成果的可以看看。
6月22日
6月17日
6月3日
Anthropic Opus 4.8 被指拿用户当小白鼠,偷偷修 bug 后舆论反转
这条吐槽戳中了 AI 模型发布「先上线再修 bug」的行业潜规则,如果你是重度使用 Claude 的开发者或团队,看完会明白为什么同一模型前后体验差异巨大——建议点开了解背后的不公平逻辑。
5月21日
产品07:59
Google AI Studio 移动版即将上线,随时随地构建 AI 想法移动端 AI 开发终于来了——Google AI Studio 的移动版让开发者可以在手机上随时调试模型和提示词,做 AI 原型验证的团队值得关注,出门在外也能继续工作。