全部动态
AI 相关资讯全量信息流 · 5478 条
8月18日
DeepSeek Harness 安全评估:A.I.G 测试 14,560 次间接提示注入
腾讯用 A.I.G 把 DeepSeek Harness 翻来覆去测了 1.4 万多次,隐藏 Unicode 攻击成功率能到 25.5%。想自查提示注入的可以看看这个框架。
论文10:27
上下文压缩的隐性代价:智能体交互成本测量这篇论文用GPT-5.5和DeepSeek实测发现,压缩上下文会让智能体反复重新查工具,任务成功率却没变。想知道为什么只看完成率会骗人,可以读读。
论文10:25
Agentic-SQL 新研究:按自主度划分 Text-to-SQL 并给出基准分析做 Text-to-SQL 的可以看看这份排行榜聚合方法,它把不同模型和推理方式按自主度归类,还给出了在 Spider、BIRD 上的实测对比,省得自己瞎比较。
StateM 运行时实现 Terminal-Bench 2.1 95.3% 原始准确率
StateM 不改模型权重,光靠升级执行系统就把 GPT-5.6 在终端测试的准确率拉到 95.3%,成本只要 15 美元,值得看看它的思路。
ClawGym II:探索Agent Harness上的黑盒强化学习
这篇论文把黑盒RL搬到agent harness上,用Qwen3-30A3B在OpenClaw和Claude Code上跑,ClawGym-Bench直接涨了10到15个点,还支持多个harness一起训练。
论文10:16
用反事实实验评估LLM行为解释:CHIVE方法这篇论文搞了个CHIVE自动找模型意外行为,结果发现现有可解释性技术对预测反事实行为没啥用,但用来训练数据倒挺能泛化,值得做可解释性的人看看。
论文10:03
识别基于概念XAI在多标签分类中的混淆趋势这篇论文用VGG16和ResNet50跑MS-COCO,实测CRP和CRAFT两种解释方法,发现概念混淆和数据集偏见的具体规律,做可解释性研究值得看看。
8月17日
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档