00:41techcrunch@Amanda SilberlingAmazon被曝销毁稀有书籍,以获取独有内容训练AI模型。由于LLM已充分学习公开网络数据,这类纸质书成为稀缺训练来源。截至报道发布,Amazon未公布销毁的具体数量与书目清单。行业AmazonLLMAI训练数据推荐理由:想知道AI数据有多缺?Amazon为了训练LLM,连稀有书都直接销毁了。原文稍后读已读值得跟进有用关注 Amazon
23:26官方账号Simon Willison’s Weblog(博客/媒体)404 Media 在 Biblio 上的一笔约 1000 本珍本书订单中放入 AirTag,追踪发现书被送到拉斯维加斯 LAS8 仓库的 VGT3 角。该设施入口有恐龙叼书的标志,亚马逊工人论坛讨论确认 VGT3 会破坏性扫描大量书籍。此前 Anthropic 在 2025 年 6 月也被曝出类似扫描行为。行业Amazon404 MediaAI训练数据10 个信源在谈事件专题推荐理由:404 Media用AirTag钓出了亚马逊偷偷扫书训练AI,书最后进了拉斯维加斯仓库,工人都证实了。原文稍后读已读值得跟进有用关注 Amazon
21:56IT之家(博客/媒体)据404 Media调查,AI公司购买图书后常采用切除书脊的高速扫描方式数字化,随后销毁纸质原件。Anthropic曾投入数百万美元购置纸质图书用于Claude模型训练,并随后销毁。马斯克于7月28日要求SpaceX AI团队对图书馆珍稀图书采用俯拍扫描仪等非破坏性方式,而非直接切除书脊。破坏性扫描因效率高、成本低,已导致数百万本图书被拆毁。行业SpaceX马斯克Anthropic10 个信源在谈事件专题推荐理由:马斯克公开表态,让AI公司别再毁书了,SpaceX会用不伤书的扫描方式。和数据版权有关的新闻,值得看看背后的争议。原文稍后读已读值得跟进有用关注 SpaceX
05:27Latent.Space@latentspacepodLila Sciences的CTO Andy Beam和CSO Rafa Gómez-Bombarelli在播客中提出,未来实验室应像数据中心一样运行。他们将湿实验室转变为24/7的token生成器,已积累10万亿实验验证推理token。跨生物学、化学、材料科学的广度训练能产生更好的通用推理模型。他们讨论了从超人类考试能力到真正科学发现的路径。行业Lila Sciences推理模型科学AI推荐理由:Lila Sciences的两位高管聊了个大胆想法:把实验室当数据中心用,用10万亿实验token训练AI,跨学科搞推理,比单纯刷题更有价值。原文稍后读已读值得跟进有用关注 Lila Sciences
12:40IT之家(博客/媒体)一群独立音乐人起诉谷歌,指控其未经许可使用YouTube上的歌曲训练音乐AI模型Lyria 3。谷歌提交动议驳回诉讼,辩称原告上传内容时已授予广泛许可,且指控缺乏证据。YouTube CEO曾承认部分内容用于训练Gemini等模型,但谷歌对Lyria是否使用YouTube内容始终未明确表态。诉讼仍在审理中,谷歌的策略是保留辩解空间。此事引发对AI训练数据版权和平台服务条款的争议。行业谷歌LyriaYouTube推荐理由:音乐人和AI从业者需要关注——谷歌的YouTube服务条款可能被用来合法化AI训练数据使用,这直接影响到创作者权益和AI模型的数据合规性。建议点开了解条款细节和诉讼进展。原文稍后读已读值得跟进有用关注 谷歌