9月2日
09:32
09:32官方一手arXiv: DeepSeek@Mohammad Hossein Shalchian, Mostafa Amiri, Amir Mahdi Sadeghzadeh
研究人员使用DeepSeek-V3-0324、GPT-OSS-120B和Qwen3-235B-A22B-Instruct-2507三种LLM为波斯语聊天数据生成标注,训练了四个MatinaRoberta-based NER模型。OSS_ZeroShot标注产生的模型在宏平均F1和标签覆盖率召回率(LCR)上表现最佳,能在单块RTX 3090上约2分钟内完成4万条消息的匿名化处理。
推荐理由:波斯语数据匿名化新方案,用LLM标注训练轻量NER模型,消费级GPU上2分钟处理4万消息。