20:33Decoder@Matthias Bastian微软声称其MAI模型训练数据是“企业级、干净且商业授权”的,但实际部分数据来自Common Crawl等未授权网络来源。与其他AI公司一样,微软依赖“合理使用”原则,并将阻止爬虫的责任推给网站所有者。这一发现揭示了微软在数据合规性上的双重标准,可能影响其企业客户的信任。事件凸显了AI行业在训练数据版权问题上的普遍争议。行业微软MAI模型数据合规版权争议Common Crawl推荐理由:微软的企业客户一直以为MAI模型用的是干净数据,现在发现和别家没区别——做合规采购的团队建议点开,看完再决定要不要签合同。原文