古いOCRテキストが言語モデル訓練を阻害、FineBooksが大規模な解決を目指す
Old OCR text cripples language model training, and FineBooks wants to fix that at scale
記事のポイント
📰ニュース
Hugging FaceとEleutherAIのFineBooksプロジェクトが、古いOCRテキストの品質問題を解決しようとしています。
🔍注目ポイント
dots.mocrモデルは歴史的書籍ページで97.6%の文字精度を達成し、AI訓練データとして十分なレベルです。
🔮これからどうなる
低品質な過去のデジタル化データが改善され、言語モデルの訓練データが大幅に拡充される可能性があります。
FineBooksは2,000ページ以上の歴史的書籍で14のオープンソースOCRモデルを評価しました。
dots.mocrは1,000ページあたり2ドル未満でこの精度を実現しており、学術的な転写にはまだ不十分ですが、AI訓練には十分とされています。
dots.mocrは1,000ページあたり2ドル未満でこの精度を実現しており、学術的な転写にはまだ不十分ですが、AI訓練には十分とされています。
古い書籍のデジタルデータがAI訓練に使えるようになるのは素晴らしいですね。これにより、歴史的な知識が私たちの生活に身近になるかもしれません。