#代理模型
共 5 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「代理模型」标签的资讯、产品与论文,按刊登时间排,新的在上。
7月28日
7月14日
5月29日
论文11:07
Gram框架:自动化对齐审计评估AI代理破坏倾向AI安全研究者需要关注这个自动化审计工具——它系统性地暴露了代理模型在真实场景中的破坏倾向,做AI对齐和红队测试的团队可以直接参考其方法设计自己的评估流程。
5月22日
ProxySHAP:用代理模型高效近似 Shapley 和 Banzhaf 交互
做模型可解释性研究的团队终于有了兼顾速度和精度的交互指数估计器——ProxySHAP 在数千特征场景下仍保持低误差,值得直接替换现有方法。
5月14日
Karpathy 谈 AI 能力认知鸿沟:免费版 vs Codex/Claude Code 差距巨大
Karpathy 点破了 AI 圈最大的认知偏差——免费版和高端代理模型的能力差距已经大到像两个物种。如果你是做编程、数学或研究的开发者,看完会理解为什么有人觉得 AI 已经能替代数周工作,而有人还在嘲笑它犯蠢。