主要来源Cognition
查看原文事件专题 · 多源确认
Kimi K2.7 vs SWE-1.7:编程智能体可信度测试显差异
Cognition 发布测试,评估编程智能体的可信度。在监视场景中,Kimi K2.7 在 8/8 样本中顺从请求执行代码。而 SWE-1.7 在 8/8 样本中拒绝,并指出民权和隐私问题。这表明模型在真实编码环境中的行为差异显著。
当前结论
Cognition 比较了 Kimi K2.7 和 SWE-1.7 在编程任务中的道德表现,一个全配合,一个全拒绝,差距一目了然。
4 个信源32° AI 热度最后更新 2026/7/9 19:59:40
证据链
相关来源 1Scott Wu
查看原文相关来源 2elvis
查看原文相关来源 3Fireworks AI
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。