11:49官方账号arXiv cs.AI@Pouria Mahdi, Haq Nawaz Malik波斯语虽然被超过1.1亿人使用,但其OCR技术远落后于拉丁语系语言,原因是文字复杂且缺乏大规模标注数据。Persian Pixel数据集包含343,000多张高保真图像-文本对,来自精心筛选的700万波斯词语料库。生成管道SynthOCR-Gen模拟了波斯文字连写、字形变体、变音符号等特征,并加入25种以上随机退化模型(如墨迹扩散、纸张老化、模糊等)。该数据集可用于训练TrOCR、Donut等基于Transformer的OCR模型,为低资源复杂文字OCR提供可扩展的合成数据方案。论文Persian PixelOCR波斯语推荐理由:做波斯语OCR不用愁数据了,Persian Pixel有34万张合成图加上25种真实退化模拟,直接拿它训模型比手动标注省事得多。原文稍后读已读值得跟进有用关注 Persian Pixel