拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

复旦腾讯ScriptMoE:一个模型识别229种语言场景文本

复旦腾讯ScriptMoE:一个模型识别229种语言场景文本

All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts

作者:Xingsong Ye, Yongkun Du, Jiaxin Zhang, Zhixian Li, Chong Sun, Chen Li, Jing Lyu, Lianwen Jin, Zhineng Chen
核心发表机构:Fudan University、Shanghai Key Laboratory of Multimodal Embodied AI、Tencent Inc.、South China University of Technology
论文链接:arXiv:2609.24058v1
发布于:arXiv 预印本(cs.CV)

|—|—|—|—|—|—|—|—|—|—|—|
| CRNN | 42.77 | 55.47 | 64.00 | 63.87 | 44.28 | 70.10 | 82.38 | 30.93 | 53.13 | 48.60 | 55.55 |
| ABINet | 61.06 | 69.47 | 82.15 | 79.90 | 58.08 | 81.74 | 88.84 | 50.76 | 53.20 | 73.88 | 69.91 |
| SVTR | 64.68 | 75.83 | 83.38 | 81.42 | 60.44 | 83.95 | 90.06 | 52.75 | 58.80 | 78.65 | 73.00 |
| SVTRv2 | 70.85 | 83.46 | 93.23 | 84.73 | 66.67 | 85.86 | 91.52 | 47.91 | 66.27 | 85.39 | 77.59 |
| PARSeq | 67.87 | 78.12 | 87.08 | 83.21 | 65.15 | 84.98 | 90.81 | 61.01 | 62.67 | 84.55 | 76.55 |
| MAERec | 76.17 | 80.15 | 92.92 | 86.01 | 68.35 | 86.16 | 92.13 | 52.66 | 63.73 | 86.80 | 78.51 |
| SVTRv2-AR | 75.11 | 87.79 | 94.15 | 87.28 | 69.36 | 85.86 | 92.27 | 59.30 | 69.60 | 86.80 | 80.75 |
|ScriptMoE|78.09|88.30|95.38| 86.77 |71.21|87.19| 91.67 |61.20|72.00|88.76|82.06|

论文强调增益集中在多语言识别中最困难的低资源文字系统上:相对 SVTRv2-AR,Arabic 提升 2.98 个百分点(78.09 vs 75.11)、Thai 提升 2.40 个百分点(72.00 vs 69.60)、Tibetan 提升 1.96 个百分点(88.76 vs 86.80)。同时也存在个别文字上的代价:Hindi 略低 0.51 个百分点(86.77 vs 87.28),Latin 低 0.60 个百分点(91.67 vs 92.27,也低于 MAERec 的 92.13)。这印证了论文提到的跨文字权衡:优化总体准确率必然牺牲个别文字上的峰值性能。与通用系统的对比差距更为悬殊:源码片段中可见的 VLM 结果里,Qwen3.5-9B 平均 63.77%、PP-OCRv5 MLT 在其支持的文字上平均 63.59%、HunyuanOCR 56.68%、PaddleOCR-VL 51.73%、GLM-OCR 34.16%、InternVL3.5-8B 24.94%、GOT-OCR 2.0 18.47%、DeepSeek-OCR2 8.61%,若干方法在 Arabic、Bangla、Tibetan 上几乎完全失效。作者据此论断"覆盖广 ≠ 准确",而 ScriptMoE 相对这些系统高出约 18 个百分点。

需要说明的是,源码片段只包含了主表的部分行,完整表格中其余约 15 个 STR 模型与 9 个通用 OCR 系统(包括 PP-OCRv6、HunyuanOCR 之外的其他条目)的完整数值未在给定材料中出现。

效率方面,ScriptMoE 每张图激活 41.13M / 45.85M 参数(激活比例 89.69%),比基于 VLM 的系统少一到两个数量级。在单张 V100、batch size 256 的条件下,ScriptMoE 的推理延迟为 541.07 ms、吞吐 473.1 img/s、显存占用 2091.0 MB;作为对比,SVTRv2-AR 为 395.92 ms / 646.6 img/s / 2057.3 MB,MAERec 为 1297.63 ms / 197.3 img/s / 2411.3 MB,CRNN 虽然只有 57.40 ms / 4459.9 img/s 但精度远低。也就是说,ScriptMoE 比沉重的自回归方法与 MAERec 明显更快、更省内存,但比它所替换的 SVTRv2-AR 更慢、更大——这是用一定推理开销换取多语言精度的权衡。

端到端多语言 OCR 结果进一步说明了识别器的增益如何传导到部署系统。在 CC-OCR 多语言任务上,保持 PP-OCRv5 检测器不变、仅把识别器替换为 ScriptMoE,总体 F1 从 65.71% 提升到80.89%,绝对提升 15.18 个百分点;这一结果略微超过最强零样本通用 VLM Qwen3.5-9B(80.73%),也明显超过最佳 OCR 专用 VLM Qianfan-OCR(76.70%)与专家系统 GoogleOCR(71.78%)。分语言看,替换后的 Korean 为 92.33、Japanese 89.43、Russian 79.22、Arabic 87.45,相比 PP-OCRv5 MLT 的 78.58 / 76.13 / 49.67 / 81.93 提升尤为明显。由于检测器完全相同,这一提升完全归因于识别环节,说明更强的文字感知识别器可以直接转化为更强的端到端 OCR 系统。一个重要限定是:CC-OCR 任务只评论文本识别、不评检测框,端到端分数仍受上游 PP-OCRv5 检测器上限约束,漏检与误检在严格词级评测的拉丁文字上最为明显。

在单语基准上 ScriptMoE 同样没有退化。在中文 BCTR 上,ScriptMoE 平均 86.85%(Document 99.47 / Handwriting 74.79 / Scene 83.35 / Web 89.80),相比 SVTRv2-AR 的 85.93% 提升 0.92 个百分点;在英文 Union14M-Benchmark 上平均 88.95%(Curve 93.49 / Multi-Oriented 96.71 / Artistic 81.78 / Contextless 87.55 / Salient 89.10 / Multi-Words 89.87 / General 84.15),相比 SVTRv2-AR 的 88.67% 提升 0.28 个百分点。这说明多语言的增益来自脚本特化本身,而不是在高资源文字系统上做了牺牲式交换。

定性比较也支持同样的结论:图中比较了 ScriptMoE 与若干代表性 VLM 及多语言 OCR 系统在 TextMuSS-Bench 上的预测,与 ground truth 不同的字符被标红,<Null>表示模型不支持该语言;ScriptMoE 持续产生正确结果,而竞争方法经常无法保证准确的多语言识别。

路由分析验证了专家特化的真实存在。对每个脚本组取一行代表性文本,可视化路由器对各专家的 softmax 以及路由专家与共享专家的有效混合后发现:四个来自不同脚本组的样本各自被其预期专家主导,而不是被任意划分。这说明路由器学到的确实是"脚本 → 专家"的对应关系,辅助分类信号的引导达到了预期效果。

)

4.3 消融实验 / Ablation Study

消融实验围绕默认配置(λ scls = 0.1 \lambda_{\text{scls}}=0.1λscls​=0.1、shared-expert width ratio= 0.5 =0.5=0.5、router jitterσ = 0.05 \sigma=0.05σ=0.05)每次只变化一个超参数。

数据消融(Tab. data_ablation)在 MLT2019 的 7 种文字上计算 Avg(Arabic、Bangla、Chinese、Hindi、Japanese、Korean、Latin),Russian/Thai/Tibetan 单独列出:

DataArabicBanglaChineseHindiJapaneseKoreanLatinAvg(7)RussianThaiTibetan
SynthMLT53.6823.1546.3720.3437.9874.1079.9847.940.000.000.00
Real only73.4076.3491.0879.3958.2568.9292.4777.120.000.000.00
Synth only60.0083.2191.0882.4467.8585.7186.9579.6168.1370.3087.08
Synth + Real78.0988.3095.3886.7771.2187.1991.6785.5261.2072.0088.76

四条结论很清晰。第一,只用真实数据训练会在从未见过的三种低资源文字上完全崩溃(Russian/Thai/Tibetan 均为 0.00),证实合成数据对这些文字是必需的。第二,仅用 TextMuSS-10M 训练已远超原有合成数据 SynthMLT(MLT2019 平均 79.61 vs 47.94),甚至在 MLT2019 平均上超过真实数据 2.49 个百分点(79.61 vs 77.12),且在 Russian/Thai/Tibetan 上从 0 提升到 68.13 / 70.30 / 87.08,说明纯合成规模本身就能带来可观收益。第三,合成与真实结合产生互补:MLT2019 平均比 real-only 提升 8.40 个百分点(85.52 vs 77.12)。第四,出现一个有意思的此消彼长模式:加入合成数据会让 Latin 下降(92.47 → 91.67),加入真实数据会让 Russian 下降(68.13 → 61.20)。原因在于 Latin 与 Cyrillic 存在视觉上完全相同、却映射到不同字符的同形字(homoglyph),造成跨文字系统混淆;ScriptMoE 相对其他 STR 方法缓解了这种混淆,但难以完全消除,因为 Latin 有丰富的真实数据而 Cyrillic 只能依赖合成替代品。

上图给出了这一问题的具体案例:一张俄语文本图像中,与拉丁字母视觉相同的西里尔字符偶尔被误识别为拉丁同形字,最终产生拼写看似合理、但文字系统归属错误的转写结果。

模型消融(Tab. ablation_full)中,#Experts=0表示无 MoE 的纯自回归基线,列为专家数、Top-k、路由粒度、是否使用L scls \mathcal{L}_{\text{scls}}Lscls​、是否使用共享专家以及十种文字的准确率与均值:

#ExpertsTopRoutingL scls \mathcal{L}_{\text{scls}}Lscls​SharedAvg
0////80.75
22image✓✓81.52
42image✓✓82.06
102image✓✓81.32
41image✓✓81.60
44image✓✓81.94
42token✓✓81.69
42image—✓81.63
42image✓—81.35

由此可归纳出若干结论。MoE 解码器不可或缺:无专家的纯 AR 基线除在数据最丰富的 Latin 上(92.27)外全面落后于 MoE 系列,说明单一稠密解码器无法充分服务十种文字系统。专家数量存在最优点:4 个专家取得最佳均值 82.06%,增益集中在最受益于专用容量的文字(相对 AR 基线,Thai +2.40、Chinese +1.23);扩展到 10 个专家(即每个文字系统一个)反而把增益抹平(降到 81.32),原因是每个专家看到的样本过少、难以充分特化,而某些文字系统更适合与结构近邻共享专家——例如 Chinese/Japanese/Korean 共享笔画拓扑。稀疏度上 Top-2 是正确的选择:Top-1(81.60)虽仍优于无 MoE 基线,但单个路由专家无法捕获相关文字间共享的子模式,在 Thai 与 Chinese 上掉分最多;Top-4(81.94)在均值上几乎追平 Top-2,却每张图激活更多参数、回报可忽略,且在 Japanese 与 Korean 上反而变差,说明过度激活的边际收益递减。路由粒度基本是平局:token 级路由在某些文字上换取边际收益(如 Hindi),在另一些文字上几乎等量损失(如 Russian),差异在噪声范围内,因此保留开销更低的图像级路由。两个 script-aware 组件都有效:移除脚本分类信号后路由器会漂离文字系统边界,平均损失 0.43%(82.06 → 81.63);移除共享专家伤害更大,平均损失 0.71%(82.06 → 81.35),且下降集中在低资源文字(Arabic −3.62、Tibetan −3.65)。

超参数消融进一步细化了默认值的合理性。脚本分类损失权重λ scls \lambda_{\text{scls}}λscls​取 0.0 / 0.1 / 0.2 / 0.5 时均值分别为 81.63 /82.06/ 81.44 / 81.35,说明移除该损失会让 router 漂离脚本边界,过度加权又会让辅助目标变成竞争目标、过度约束路由器,低资源 Tibetan 受打击最大(在 0.5 时降至 84.55),温和正则优于硬脚本先验。共享专家宽度比取 0.0 / 0.5 / 1.0 时均值为 81.35 /82.06/ 81.41,移除共享专家是最有害的设置,而 0.5 已恢复接近全部收益,继续放大无益。Router jitterσ \sigmaσ取 0.0 / 0.05 / 0.1 时均值为 81.61 /82.06/ 81.32,说明小的乘性抖动能正则化图像级路由器、避免路由脆弱,过大则注入过多噪声。

五、相关工作 / Related Work

与专家 OCR 系统的区别。传统专家系统通常为每种语言部署一个识别器,并依赖语言识别步骤把裁剪图路由到对应模型,本文则用单一 all-in-one 模型共享视觉编码器、由 MoE 解码器按图路由到 Top-2 脚本专家,从而避免误差累积、降低训练与部署成本、简化维护。

与 VLM 的区别。VLM 参数量大、推理成本高、边缘部署困难,而且在多个文字系统上仍然不准确。ScriptMoE 是轻量专用识别器,在 TextMuSS-Bench 与 CC-OCR 上达到或超过 VLM 水平,参数量却少一到两个数量级(每图激活 41.13M)。在 CC-OCR 上,最佳零样本 VLM Qwen3.5-9B 为 80.73 F1,而 ScriptMoE 为 80.89;OCR 专用 VLM 中最佳的 Qianfan-OCR 为 76.70,KOSMOS2.5(36.23)、GOT-OCR 2.0(24.95)、DeepSeek-OCR(32.50)、MinerU2.5(43.20)、PaddleOCR-VL(45.50)差距更大;专家系统 GoogleOCR 为 71.78、PP-OCRv5 MLT 为 65.71。

与 MRN / IMLTR 的区别。MRN 为每种语言维护独立特征提取器、激活语言特定专家和独立字符分类器,参数量随语言数线性增长;ScriptMoE 共享一个视觉编码器,专家与脚本簇对齐,采用 Top-2 路由加 always-on 共享专家以及图像级路由,参数量不随语言数线性增长。

与 Multiplexed TextSpotter 的区别。后者做词级脚本识别,把每个词路由到特定脚本的识别头;ScriptMoE 则做图像级路由,每张图只进行一次路由决策,所有输出 token 共享同一组专家,避免 token 级路由抖动并降低路由成本。

与 SARN 的区别。SARN 向识别器注入脚本信息以使字符特征更具判别性;ScriptMoE 通过辅助四路分类头提供脚本感知监督,但不直接用脚本标签选择专家,路由器仍保留划分文字系统内部子群体的自由。

与非自回归(NAR)/自回归(AR)方法的关系。AR 方法显式建模语言,精度领先但逐 token 解码较慢;NAR 方法(CTC 或并行解码)速度快但语言先验弱,在多语言与形态丰富文字系统(Hindi、Tibetan)上退化严重,不适合联合多文字系统识别。而直接复用 AR 模型会让所有文字系统争抢一份稠密解码器参数、造成高低资源不平衡。ScriptMoE 保留 AR 骨干,但把解码器容量重新分配为脚本感知:只激活当前文字系统所需的专家参数。

与 CLI-STR 的发现。CLI-STR 指出决定多语言性能的是数据规模而非语言相似性,这直接激励了本文为低资源文字系统构建大规模合成数据 TextMuSS-10M。与原有合成数据集 SynthMLT 相比,TextMuSS-10M 在 MLT2019 平均上高出 31.67 个百分点(79.61 vs 47.94),并让 Russian/Thai/Tibetan 从 0 提升到 68.13 / 70.30 / 87.08。

六、局限性与展望 / Limitations & Future Work

论文明确列出三点局限。第一是合成数据与真实图像之间的域差距:尽管 TextMuSS-10M 经过精心合成,仍与真实世界图像存在分布差异;论文提出,收集大规模真实多语言场景图像并用于半监督学习,是缩小该差距的有前景方向。第二是 Latin–Cyrillic 同形字混淆:与拉丁字母视觉相同的西里尔字符偶尔会被误识别为拉丁同形字,产生拼写看似合理却文字系统归属错误的转写;全合成数据的实验显示,更均衡的数据分布能有效缓解这一问题,但要彻底关闭差距仍需构建真实的西里尔文字数据。第三是端到端流程依赖上游检测器:当前复用 PP-OCRv5 检测器,其多语言检测质量无法在所有文字系统上得到保证,可能限制整体性能。

除论文明确指出的内容外,从源码与实验设置中还可以观察到若干值得关注的事实。其一是TextMuSS-Bench 各文字系统的样本量高度不均衡:Latin 有 5,885 张而 Chinese 仅 325 张、Bangla 393 张、Tibetan 356 张,宏平均虽然做了平衡,但单个文字系统上的估计方差可能较大。其二是低资源文字的标注风险:新增的俄语、泰语、藏语由各自语言的一位专家转写,复核者不专精这些低资源语言,只在形态学层面做一致性检查,标注噪声难以完全排除。其三是专家数量不能无限扩张:10 专家(每文字系统一个)的实验显示每专家样本过少、无法特化,反而抹平增益,这意味着继续增加文字系统时需要重新思考专家划分策略,而不能简单地每新增一种文字就新增一个专家。其四是脚本分组与专家角色是人工定义的:虽然论文为不支持的语系预留了归入路径(视觉上类似字母归入 Alphabet、汉字形式归入 CJK、从右到左归入 Arabic 家族、其余归入 Others),但扩展到新文字系统时分组方案可能仍需人工重新设计。其五是推理速度:模型仍使用贪心自回归解码,541.07 ms / 473.1 img/s 虽优于 MAERec(1297.63 ms / 197.3 img/s),但慢于 SVTRv2-AR(395.92 ms / 646.6 img/s)与 NAR 方法。其六是端到端验证仅限 CC-OCR 一个任务,泛化性有待更多基准检验。

在展望上,论文提出两条未来工作方向:一是探索持续学习(continual learning)策略,使新增文字系统无需重训整个模型即可被纳入;二是把 ScriptMoE 与更强的文本检测器结合,进一步提升端到端多语言 OCR 性能。

七、总结 / Conclusion

这篇论文针对多语言场景文本识别中"数据稀缺"与"单模型难以服务多种文字系统"两重困难,提出了一条位于 per-language 专家系统与大规模 VLM 之间的中间路线。在数据侧,论文构建了覆盖 10 种文字系统、229 种语言的大规模多语言合成场景文本数据集 TextMuSS-10M,以 40%/20%/20%/20% 的文本来源混合、针对不同文字系统的渲染调整(CJK 更高垂直文本比例、阿拉伯文 RTL 渲染)和 8k 背景图,为真实数据稀缺的文字系统提供均衡且充分的训练信号;同时组装了覆盖全部十种文字的真实场景文本基准 TextMuSS-Bench。在模型侧,论文提出 ScriptMoE:保持共享的 SVTRv2 视觉编码器,把解码器的 FFN 替换为 script-aware MoE 块,通过图像级 router 激活 Top-2 个与文字系统对齐的专家来重新分配解码器容量,用始终激活的共享专家维持跨文字迁移,用轻量四路脚本分类信号(λ scls = 0.1 \lambda_{\text{scls}}=0.1λscls​=0.1)温和引导专家特化,并以可学习的 per-token gate 融合两路输出。消融实验逐一确认了这些设计选择的必要性:4 个专家、Top-2 稀疏度、图像级路由粒度、脚本分类信号与共享专家缺一不可,其中共享专家是最不能省的组件。实验结果显示,ScriptMoE 在 TextMuSS-Bench 上取得 82.06% 的平均准确率,比最强 STR 基线 SVTRv2-AR 高 1.31 个百分点,增益集中在 Arabic、Thai、Tibetan 等最困难的低资源文字系统上;在 CC-OCR 端到端多语言任务上,仅替换 PP-OCRv5 的识别器就把 F1 从 65.71% 提升到 80.89%,略超最佳 VLM 的 80.73%,而每图仅激活 41.13M / 45.85M 参数;在 BCTR 与 Union14M-Benchmark 两个单语基准上也并未退化。总体而言,这项工作说明:以文字系统而非语言为单位组织模型容量、并配合大规模均衡合成数据,可以在保持轻量的前提下,让单一识别器在广泛文字系统上同时获得接近专门化模型的精度与远低于 VLM 的成本,而剩余的主要挑战集中在合成与真实之间的域差距、Latin–Cyrillic 同形字混淆以及上游检测器带来的端到端上限。

原文摘要:Multilingual scene text recognition (STR) remains challenging due to the scarcity of training data for most languages and the difficulty of serving diverse scripts within a single model. Existing solutions either deploy one recognizer per language, inflating cost and introducing error accumulation, or rely on massive vision-language models (VLMs) that are expensive and still inaccurate on many scripts. In this work, we pursue an all-in-one multilingual recognizer that is simpler than per-language experts, lighter than VLMs, and more accurate than both. First, we construct TextMuSS-10M, a large-scale synthetic scene text dataset spanning 10 scripts and 229 languages. It provides balanced and sufficient supervision where real data is unavailable. Second, we propose ScriptMoE, a script-aware Mixture-of-Experts (MoE) architecture. It shares a single visual encoder and replaces the dense decoder with a sparse MoE block, which consists of an image-level router dispatches each image to the top-2 script-aligned experts and a shared expert absorbs cross-script knowledge. Extensive experiments on our assembled TextMuSS-Bench (10 scripts, 10,899 images) show that ScriptMoE achieves the highest accuracy of 82.06%, outperforming the strongest STR baseline by 1.31%. On the CC-OCR end-to-end multilingual task, replacing only the recognizer in PP-OCRv5 with ScriptMoE lifts F1 score from 65.71% to 80.89%, slightly surpassing the best VLM (80.73%) at a fraction of the parameter count.

PDF链接:https://arxiv.org/pdf/2609.24058v1

部分平台可能图片显示异常,请以我的博客内容为准

返回列表