電子書籍から検索やコピーができる文字を取り出したい場合は、無料の EPUB TXT変換ツールを利用できます。EPUB 2とEPUB 3に保存されたテキストを抽出し、UTF-8 TXTに変換します。ZIP内のファイル名ではなく、書籍に指定された読む順序に従うため、章を正しい順番でまとめられます。アカウントやクレジットは不要です。
EPUBをテキストファイルに変換する理由
EPUBは電子書籍リーダー向けの形式で、ナビゲーション、スタイル、画像、フォント、画面に合わせて変化するレイアウトを含められます。TXTはシンプルですが、検索やコピーがしやすく、ほとんどのテキストエディターで開けるため、許可されたメモ作成やアクセシビリティの作業に利用しやすい形式です。
EPUBの見た目ではなく文字が必要な場合に、プレーンテキストへの変換が役立ちます。レイアウト、挿絵、ページの文脈、出版情報が重要なときは元のEPUBも保存してください。TXTは作業用であり、原書そのものを置き換えるものではありません。
EPUBをTXTに変換する方法
- EPUBをアップロードします。 1件の
.epubをアップロード欄へドロップするか、端末から選択します。 - 抽出範囲を選びます。 初期状態では主な読む順序だけが対象です。目次、注釈、解答、補助セクションも必要な場合は、補足コンテンツを有効にします。
- テキストを抽出します。 「作成」を押し、EPUB to TXT処理の完了を待ちます。
- コピーまたは保存します。 文字数と章数を確認し、コピーするかUTF-8 TXTをダウンロードします。
EPUBテキスト変換で章順とタイトルを保つ仕組み
EPUBはZIPを基にした出版物ですが、ファイル名だけでは章順を正しく判断できません。このツールはパッケージ文書を読み、出版社が spine に指定した読む順序で処理します。
linear="no" の項目とナビゲーション文書は、注釈、解答、重複した目次が本文に混ざらないよう初期状態では除外されます。「注釈や補足コンテンツも含める」を有効にすると、それらも元のspine位置に沿って出力されます。
章タイトルは、EPUB 3のナビゲーションまたはEPUB 2のNCX、文書タイトル、本文最初の見出しの順で取得します。本文が同じタイトルから始まる場合は重複させず、元の書籍にない「第1章」などの名前も生成しません。表示される章数は選択されたspine上のコンテンツ文書数であり、見た目の章数と一致しない場合があります。
EPUBからTXTに残る内容
TXTには次の内容が残ります。
- Unicode文字とデコードされたHTMLエンティティ
- spineに沿った章と節の順序
- 段落と改行の区切り
- リスト項目と基本的な表セルの区切り
プレーンテキストでは、フォント、色、段組み、CSS、スクリプト、埋め込みメディア、読書アプリの注釈、表紙デザインは保持できません。リンクの表示文字は残りますが、URLは追加されません。
抽出対象はXHTML、HTML、SVGに保存されている既存の文字です。スキャン、挿絵、漫画にはOCRを実行せず、翻訳、要約、書き換えも行いません。
抽出したEPUBテキストの使い方
- 書籍内をすばやく検索する。 通常のテキスト検索で人名、用語、文章を探せます。
- メモや研究資料を準備する。 利用許可のある文章をメモへ移し、引用時には原書で表現と文脈を確認します。
- 対応ツールへ移す。 UTF-8ファイルをテキストエディターで開くか、プレーンテキスト対応の作業へ取り込めます。
- アクセシブルな読書に利用する。 抽出した文章を支援ソフトで使ったり、短い抜粋をEchoraのテキスト読み上げへ送ったりできます。
所有している、または処理の許可を得ている出版物だけを使用してください。形式を変換しても著作権やライセンスは変わりません。
より読みやすいTXTを得るためのポイント
- 正規の閲覧アプリで元のEPUBを確認します。 すべてのページが画像で文字を選択できない場合、このツールでも抽出できません。
- 最初は主な読む順序だけを処理します。 補足コンテンツを無効にして確認し、注釈や解答が必要な場合だけ有効にして再実行します。
- 章数は文書数として確認します。 EPUBの分割方法は出版社ごとに異なるため、構成が重要な場合は抽出見出しと元の目次を比較してください。
- 省略状態を確認します。 結果は早めに保存し、保持される50,000文字を超える内容が必要な場合は原書も確認してください。
対応形式と制限
1回につき最大 50MB のEPUBを1件アップロードできます。サービスはmimetype、パッケージ文書、manifest、spine、内部パスを検証します。ZIPの拡張子を .epub に変えただけのファイル、破損した書籍、欠落したリソース、安全でないパス、暗号化された本文は処理できません。DRMの解除や回避も行いません。
結果は最大 50,000文字です。上限を超えた場合は省略表示が付き、TXTには保持された範囲だけが含まれます。結果カードからEchoraのテキスト読み上げへ送れるのは先頭 5,000文字までです。
よくある質問
EPUB TXT変換は無料ですか?
はい。ログインやクレジットなしで、対応するEPUBを1件ずつ変換できます。
EPUB 2とEPUB 3に対応していますか?
はい。両方の対応テキストを抽出し、EPUBのspineに指定された読む順序で出力します。
注釈や補助セクションも含められますか?
はい。「注釈や補足コンテンツも含める」を有効にしてから作成してください。主な本文を読みやすくするため、初期状態では無効です。
DRM付きまたはスキャン型EPUBから文字を抽出できますか?
できません。暗号化された本文は拒否され、画像だけのページには直接抽出できる文字がありません。DRM回避もOCRも行いません。
EPUBテキスト抽出の結果が途中までなのはなぜですか?
画像だけのページ、欠落または非対応の内容、50,000文字を超える本文が原因として考えられます。上限で省略された場合は結果欄に表示されます。
別の利用許可済みEPUBを処理するときは、上の変換ツールに戻ってください。