arXiv cs.CVは8月20日(現地時間)、歴史的アラビア語手稿の筆写問題に対処するため、コンパクトな多ドメイン手書き文字認識(HTR)システム「Phoenix」と、そのレビューワークフロー「Athar」を発表した。このシステムは499万パラメータのCNN-BiLSTM-CTC認識器を搭載し、既存システムと比較して文字エラー率(CER)を大幅に削減したとされている。大規模データセット全体では文字加重CERを25.3%相対的に低減し、手稿デジタル化における精度向上に寄与すると見られる。
この研究は、歴史的アラビア語手稿の筆写が単なるテキスト認識に留まらないという課題意識に基づいている。研究者からは、筆跡やレイアウトの変化への対応、不確実な読みの保持、視覚的証拠と言語的妥当性の区別、最終決定の記録といった要件が求められていた。今回発表された「Phoenix」は、これらの課題に対応するために開発された499万パラメータのCNN-BiLSTM-CTC認識器であり、これと連携するエビデンス認識レビューワークフロー「Athar」が構築された。
Phoenixは、文書認識リプレイ、81シンボルに拡張されたコーデック、および既存ドメインへの許容できないコストで新規ドメインを改善するチェックポイントを拒否する忘却ガードを特徴とする。これにより、アーカイブ、マグレブ、歴史的筆写といった多岐にわたるドメインにわたって適応された。事前指定されたホールドアウト比較において、評価前に凍結され、グリーディデコーディングと生の参照でスコア付けされた結果、Phoenixは顕著な性能向上を示した。
具体的には、Agapetデータセットの10,594行において文字エラー率(CER)を22.12%から17.86%に、Omarデータセットの11,684行ではCERを17.72%から11.84%に削減した。一方で、164行のTariMaデータセットでは10.39%から10.72%へとわずかに悪化した。これら二つの大規模ホールドアウトセット全体では、文字加重CERが19.98%から14.93%に低下し、相対的なエラー削減率は25.3%を記録した。開発診断では、Phoenixが比較可能な4つのドメインのうち4つで最低CER(9.59%の非加重マクロCER)を達成している。
連携するレビューワークフローAtharは、視覚的な読みを保持し、範囲限定された代替案を提示することで、ローカル言語モデルの利用を控えめにする。また、ユニーク、曖昧、または棄却された状態のソースパラレルを検索する機能も持つ。出力は監査可能なTEIおよびPAGE-XML形式の記録として提供される。これらの結果は、手稿のHTRが単なるテキスト置換ではなく、監査可能なエビデンス管理として評価されることの重要性を示唆している。
参考: arXiv cs.CV — 2026年8月21日 13:00 (JST)