My News ← 戻る

FineBooks: 低品質OCRテキストがLLMトレーニングを妨害、大規模修正ツールを開発

FineBooks: 低品質OCRテキストがLLMトレーニングを妨害、大規模修正ツールを開発

項目 内容
ジャンル その他IT
日付 2026-08-11
元記事 The Decoder

要約

スタートアップのFineBooksが14種類のオープンソースOCRモデルを歴史的な書籍ページでベンチマークした結果を公開した。最良モデル「dots.mocr」でも文字精度97.6%、コスト1,000ページあたり2ドル以下を達成したが、学術研究レベルには不十分とされる。デジタル化された古書・文書のOCRテキストはノイズが多く、LLMのトレーニングデータとして使うと性能劣化を引き起こすことが知られている。FineBooksはAIトレーニング用途に特化した大規模OCR修正パイプラインの構築を目指しており、文化的・歴史的資料を高品質なLLMデータとして活用する道を切り開こうとしている。


元記事を読む →