業務改善・DXWebシステム

紙書籍をOCR活用でEPUB電子書籍に変換
プロジェクト概要
出版社様が保有する大量の紙書籍を、電子書籍(EPUB)として配信できる形に変換するプロジェクトです。OCRでの文字認識後の誤字修正やHTML/CSSでの体裁調整など、手作業では時間がかかり品質にもばらつきが出やすい変換プロセスの標準化が求められていました。
OCRによる文字認識とHTML/CSSによる整形を組み合わせ、紙書籍からEPUB形式への変換フローを構築しました。約14ヶ月で139冊・約27,800ページの書籍を電子化し、Amazonでの電子書籍販売につなげています。
課題と解決策
CHALLENGE
紙書籍をスキャン・OCR処理しても認識誤りが多く、手作業での修正が欠かせなかった。EPUB規格に沿ったHTML/CSSへの整形も必要で、無料ツールは使いづらく商用ツールは高コストという課題があった。
SOLUTION
OCRによる文字認識と、HTML/CSSによる規格準拠の整形作業を組み合わせた変換フローを構築。Sigilを用いたEPUB編集・検証まで一貫して対応した。
成果
- 139冊・約27,800ページの紙書籍をEPUB電子書籍として変換
- 変換済み書籍をAmazonで電子書籍として販売するところまで実現
- 約15人月・5名体制、約14ヶ月にわたり継続的に対応
進め方
01
原稿スキャン・OCR処理
紙書籍をスキャンし、OCRで文字データを抽出。
02
誤字修正・内容チェック
OCR特有の認識誤りを修正し、原稿の内容を確認。
03
HTML/CSS整形
EPUB規格に沿ったHTML/CSSへ内容を整形。
04
EPUB化・検証
Sigilを用いてEPUBファイルを生成し、表示崩れがないか検証。