17:47官方一手arXiv: DeepSeek@Xucheng Yu, Emily Knox, Haohan Wang一项基于40,800组问答的系统实验发现,主流大模型对受限书籍的拒绝率仅为0.07%。实验覆盖400本书、17种提示设计和六大前沿模型,包括Claude Sonnet 4.5、GPT-4o和DeepSeek-V3。模型差异体现在警告语言上,警告率提升8-15个百分点,犹豫标记提升2-5个百分点。提及性内容的频率是最强信号,差距达33-52个百分点。提示框架可让警告率差距变化最多19个百分点。论文Claude Sonnet 4.5GPT-4oDeepSeek-V3推荐理由:这篇论文用四万组问答测了六大模型,发现它们很少拒绝聊敏感书,但会用警告和犹豫来暗示,想了解内容审核现状可以看看。原文稍后读已读值得跟进有用关注 Claude Sonnet 4.5
21:59IT之家(博客/媒体)Spotify 宣布从 9 月起推出 AI 人格标签,帮助用户识别 AI 生成的歌手。AI 创作者可主动标记身份,平台也会审核并标记疑似 AI 艺人。被打上标签的艺人默认不纳入算法推荐,用户可申诉误标记。Spotify 将优先展示真实艺人的音乐,减少 AI 垃圾内容推荐。AI产品SpotifyAI 人格AI 歌手2 个信源在谈事件专题推荐理由:Spotify 要动手清理 AI 歌手了,9 月起给 AI 生成艺人打标签,不推荐给用户,真人歌手优先。原文稍后读已读值得跟进有用关注 Spotify
12:06IT之家(博客/媒体)72°Mistral AI 于 8 月 4 日发布 Shieldstral,这是一个 30 亿参数的开源内容审核模型,采用 Apache 2.0 许可证,已上线 Hugging Face。模型支持 12 种语言,可在单张 16GB GPU 上运行,官方称其内容安全性能媲美 7 倍规模的开放模型,并在多模态审核任务上达到 SOTA。与将伤害类别固化在权重中的防护模型不同,Shieldstral 把审核政策写入输入,通过 <Instruct>、<Query>、<Document> 三个字段将任务转化为二元问答。推理时只读取“是/否”两个词元的逻辑值并归一化为分数,以 0.5 为阈值输出判断,覆盖提示词分类、回答审核、拒答检测和毒性检测。AI模型ShieldstralMistral内容审核3 个信源在谈事件专题推荐理由:Mistral出了30亿参数的开源审核模型,16GB显卡就能跑,审核规则可写进输入,适合做内容过滤。原文稍后读已读值得跟进有用关注 Shieldstral
01:54官方账号Mistral AI@MistralAI精选MistralAI 发布了一款新的内容审核模型,可将审核政策以自然语言问题形式输入,并返回校准后的审核分数。该模型同时支持文本和图像,通过统一接口处理多模态内容。相关技术报告已发布在 arxiv 上,编号为 2607.25857。模型目标是让审核策略更灵活、可解释,同时保持评分一致性。AI模型MistralAI内容审核多模态推荐理由:把审核规则写成大白话问题,Mistral 这个模型就能给校准分数,图文通吃。想研究的直接看 arxiv。原文稍后读已读值得跟进有用关注 MistralAI
19:49官方账号阿里云 Alibaba Cloud@alibaba_cloudEaseMate AI利用阿里云的AIGC服务和LLM(包括Qwen模型)提升全球创新效率。结果实现实时内容审核准确率超过99.5%,API成本降低20%。该案例展示了阿里云AI平台的性能与安全平衡。行业Alibaba CloudQwenEaseMate推荐理由:阿里云晒出真实客户案例:EaseMate用他们AI服务,内容审核准到99.5%以上,还省了20%成本,做AI平台的人都该看看。原文稍后读已读值得跟进有用关注 Alibaba Cloud
15:03IT之家(博客/媒体)Substack 平台宣布引入 AI 检测工具 Pangram,读者可查看内容中 AI 辅助撰写的比例。该平台指出,真正问题在于 AI 内容伪装为人类创作,并称这种行为为“Claudefishing”。Substack 还推出创作过程说明、发布前 Pangram 审核等工具,未来考虑提供回复和推荐内容的 AI 偏好设置。AI产品SubstackPangramAI检测推荐理由:Substack 上了个新工具,能告诉你一篇文章有多少是 AI 写的,防止被“假人”内容忽悠。原文稍后读已读值得跟进有用关注 Substack
14:51Geek@geekbbyuwen-publish-precheck 是一款发布前审核工具,支持抖音、小红书、视频号等平台。它通过词面预检和AI语境判定两层检测,而非简单违禁词匹配。规则源自42条官方规则和72条原文引文,并用38篇真实过审稿校准尺度。工具会指出哪句有问题并给出修改建议。技巧yuwen-publish-precheck抖音小红书推荐理由:发抖音、小红书前用它审一遍,能避免被限流。它按官方规则检查,还带AI语境判断,比单纯屏蔽词库靠谱。原文稍后读已读值得跟进有用关注 yuwen-publish-precheck
01:17techcrunch@Sarah PerezX 宣布将使用 Grok AI 模型检测平台上的侵权内容,识别后会把广告收入转给原作者,而非违规账号。该系统还会打击互动诱饵(engagement bait)行为。X 称此举可减少内容搬运并保护原创者的收入。目前该工具已在部分创作者中测试,计划逐步推广。AI产品XGrok抄袭检测推荐理由:X 用自家 Grok AI 抓抄袭,收益直接转给原作者,还打击标题党。做内容的可以关注下。原文稍后读已读值得跟进有用关注 X
00:49官方一手AWS Machine Learning Blog@Konstantin LekhFlo Health 工程团队将 AWS 生成式 AI 创新中心的 PoC 转化为基于 Amazon Bedrock 的生产级医疗内容审核与生成系统。该系统利用 Amazon Bedrock 的 Claude 模型和知识库功能,实现了对医学文本的自动审核与生成。与人工审核相比,新系统将审核时间从数小时缩短至分钟级,并保持了 95% 以上的准确率。该方案还支持多语言医疗内容处理,覆盖了 Flo Health 服务的 100 多个市场。行业Flo HealthAmazon Bedrock医疗AI1 个信源在谈事件专题推荐理由:Flo Health 用 Amazon Bedrock 把概念验证做成了能用的医疗审核系统,效率提升明显,值得了解。原文稍后读已读值得跟进有用关注 Flo Health
23:27techcrunch@Amanda SilberlingReddit宣布使用大语言模型(LLM)来检测和移除平台上的垃圾内容,这些垃圾内容很大一部分由LLM生成。据Reddit称,2026年上半年AI生成垃圾帖占比已达32%,传统规则和分类器难以应对。新系统基于自家微调的Llama 3模型,在内部测试中将误删率从12%降至4%,同时查杀率提升至89%。Reddit计划将该工具开源,供其他平台参考。行业RedditLLM垃圾信息推荐理由:Reddit被AI垃圾淹了,现在用AI反制,自己微调Llama 3把误删率压到4%,想抄作业的可以关注开源。原文稍后读已读值得跟进有用关注 Reddit
18:31官方账号Decoder@Maximilian SchreinerMeta计划到2025年用大语言模型取代约一半的人工审核请求,对某些类型内容,年底前这一比例将超过90%。公司内部员工对此快速部署表达担忧,认为可能增加误判和内容风险。该策略旨在降低人工审核成本,但引发对安全性和可靠性的质疑。行业Meta内容审核员工警告推荐理由:Meta要用AI替代大半人工审核,员工都觉得太快了,看看他们担心什么原文稍后读已读值得跟进有用关注 Meta
09:15官方账号arXiv cs.AI@Dipto Das, Achhiya Sultana, Ankit Singh Chauhan, Saadia Binte Alam, Mohammad Shidujaman, Shion Guha, Sunandan Chakraborty, Syed Ishtiaque Ahmed该论文针对LLM在内容审核中难以识别针对少数族裔(如孟加拉国印度教和查克马社区)的文化隐性歧视问题,提出Mod-Guide系统。研究通过社区合作构建文化敏感语料库,并利用检索增强生成(RAG)将少数群体视角融入审核流程。实验表明,RAG增强的审核响应在文化准确性上显著提升,且不同族群对审核结果的感知存在差异。这项工作为AI伦理和内容审核设计提供了修复性正义和解释学包容的新路径。论文内容审核LLM少数族裔推荐理由:内容审核系统常忽视文化隐性歧视,Mod-Guide通过RAG融入少数群体视角,做AI伦理或内容审核的团队值得关注其方法论。原文稍后读已读值得跟进有用关注 内容审核
05:15官方一手@OpenAIDevs@OpenAIDevsOpenAI 宣布在 Responses API 和 Completions API 中新增内容审核分数功能。开发者现在可以在生成请求的同时获取审核信号,无需额外调用审核接口。这使得应用可以基于审核分数进行日志记录、路由、人工审核或直接拦截。该功能简化了内容安全流程,尤其适合需要实时内容过滤的 AI 应用。AI产品OpenAI内容审核API10 个信源在谈事件专题推荐理由:做 AI 内容审核或安全过滤的开发者终于可以少写一个 API 调用——在生成回复的同时拿到审核分数,直接决定是放行还是拦截,建议试试这个集成方案。原文稍后读已读值得跟进有用关注 OpenAI
12:50IT之家(博客/媒体)YouTube 宣布对 AI 视频标注功能进行两项重要更新。首先,AI 标签将被移至更显眼的位置:长视频中位于播放器下方、描述栏上方;Shorts 短视频中则以覆盖层形式直接显示在视频上。其次,YouTube 将引入自动检测机制,当系统检测到明显的写实类 AI 使用迹象而创作者未主动披露时,将自动添加标签。创作者可在 YouTube Studio 中更新披露状态,但使用 YouTube 自有 AI 工具(如 Veo 或 Dream Screen)生成的内容,以及包含 C2PA 元数据表明为完全生成式 AI 的内容,标签将永久显示。AI产品YouTubeAI 视频标注自动检测推荐理由:YouTube 这次把 AI 标签放到了更显眼的位置,还加入了自动检测,做视频创作的创作者和平台运营者需要关注——这会影响内容审核流程和观众信任度,建议点开看看具体规则。原文稍后读已读值得跟进有用关注 YouTube
10:38官方账号Decoder@Matthias BastianYouTube 正在加强 AI 内容标签规则,从本月起,逼真或大量 AI 修改的视频将在更显眼位置显示标签:长视频显示在播放器下方,Shorts 显示为叠加层。从 2026 年 5 月开始,即使创作者未主动披露,自动检测系统也会标记 AI 生成内容。推荐和变现不受影响。此举旨在提高透明度,帮助观众区分真实与 AI 生成内容。AI产品YouTubeAI 内容标记自动检测推荐理由:YouTube 的自动检测系统将改变内容审核规则,做 AI 视频创作的团队需要提前了解合规要求,建议点开看看具体时间线和影响。原文稍后读已读值得跟进有用关注 YouTube
16:14IT之家(博客/媒体)抖音在谣言治理中引入大模型技术,过去一年谣言被处置时的平均浏览量下降62%。平台推出“AI求真”功能,通过求真卡为用户提供真实信息,建立认知防线。抖音还盘点了十大辟谣案例,均由AI求真大模型识别或处置。该功能于去年9月上线,用户浏览易误解内容或搜索谣言时,可通过大模型获取完整信息。AI产品大模型谣言治理AI求真推荐理由:抖音用大模型把谣言处理效率提升了,做内容审核或平台运营的团队可以看看这套方案的实际效果,值得参考。原文稍后读已读值得跟进有用关注 大模型
12:12官方一手arXiv: OpenAI@Jiwon Kim, Claire Wang, Taeung Yoon, Sabelle Huang, Koustuv Saha精选大型语言模型(LLM)越来越多地被用于情感支持和正式治疗场景,但像ChatGPT或Llama等模型内置的内容审核机制会阻止它们讨论敏感话题,这可能影响其作为治疗师的能力。本研究对OpenAI、Meta和Google的三种先进审核系统进行了算法审计,评估它们对真实治疗对话内容的标记程度。结果显示,这些系统过度标记了治疗中必要的敏感内容,揭示了LLM在扮演治疗师角色时面临的限制。这对设计用于心理健康的AI系统具有重要启示,表明当前审核机制可能阻碍有效的治疗对话。论文LLM内容审核心理健康9 个信源在谈事件专题推荐理由:这项研究戳穿了AI治疗应用的核心矛盾——安全审核反而成了障碍,做心理健康AI产品、设计对话系统的团队值得细读,看完会对审核策略有新的思考。原文稍后读已读值得跟进有用关注 LLM
13:05官方账号Greg Brockman@gdbEthan Mollick 在 X 上分享使用 GPT-5.5 Pro 进行事实核查的体验,称其能准确追踪整章内容中的关键引用。该模型擅长捕捉细微差别,但会频繁指出“大致正确但忽略细节 X”的问题。这表明 GPT-5.5 Pro 在学术写作、内容审核等需要高精度事实验证的场景中具有实用价值。AI产品GPT-5.5 Pro事实核查学术写作7 个信源在谈事件专题推荐理由:做学术写作或内容审核的团队,GPT-5.5 Pro 能帮你省下大量人工核查时间,建议试试整章投喂的体验。原文稍后读已读值得跟进有用关注 GPT-5.5 Pro
10:09官方账号arXiv cs.AI@Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer精选社交媒体正走向多元化,不同社区有各自的规则。研究者提出了PluRule基准,包含来自1989个Reddit社区的13371条规则违规案例,覆盖9种语言。测试发现,即使是GPT-5.2等先进模型,在识别违规内容时表现也仅略优于简单基线。增加模型规模和上下文信息带来的提升有限,而通用规则(如文明用语)更容易被检测。这表明,AI在多元社区的内容审核仍面临根本性挑战。论文内容审核多元社区基准测试推荐理由:内容审核从业者和社区运营团队会关心:现有AI模型在多元规则下表现堪忧,PluRule为评估和提升审核系统提供了关键基准,值得深入研究。原文稍后读已读值得跟进有用关注 内容审核
22:18岚叔@lufzzliz用户反映OpenAI的GPT image 2在生成某些图像时存在较多限制,导致特定内容难以生成。但发现通过Hermes或flowith等第三方工具仍可生成受限图像。用户计划进一步探索GPT image 2的生成尺度。这一现象表明不同工具对内容审核策略存在差异,可能影响用户选择。AI产品图像生成GPT image 2内容审核2 个信源在谈事件专题推荐理由:展示了当前AI图像生成工具在内容审核上的不一致性,对需灵活生成内容的用户有参考价值。原文稍后读已读值得跟进有用关注 图像生成