FineBooks: 低品質OCRテキストがLLMトレーニングを妨害、大規模修正ツールを開発
FineBooks: 低品質OCRテキストがLLMトレーニングを妨害、大規模修正ツールを開発
| 項目 | 内容 |
|---|---|
| ジャンル | その他IT |
| 日付 | 2026-08-11 |
| 元記事 | The Decoder |
要約
スタートアップのFineBooksが14種類のオープンソースOCRモデルを歴史的な書籍ページでベンチマークした結果を公開した。最良モデル「dots.mocr」でも文字精度97.6%、コスト1,000ページあたり2ドル以下を達成したが、学術研究レベルには不十分とされる。デジタル化された古書・文書のOCRテキストはノイズが多く、LLMのトレーニングデータとして使うと性能劣化を引き起こすことが知られている。FineBooksはAIトレーニング用途に特化した大規模OCR修正パイプラインの構築を目指しており、文化的・歴史的資料を高品質なLLMデータとして活用する道を切り開こうとしている。