職場の複合機で紙文書をスキャンすると、PDFではなくDocuWorks文書(XDW)として保存されることがあります。このデータから文書名や項目を取り出し、Excelで目次・一覧表を作りたい場合、「ExcelのPDF取り込み機能へDocuWorks文書をそのまま読み込ませればよいのか」と迷いやすいところです。
結論から整理すると、DocuWorks文書をExcelの「PDFからデータを取得」機能へそのまま渡すことはできません。PDFとDocuWorks文書は別形式だからです。ただし、DocuWorks文書をPDFへ変換したり、OCRで文字情報を取り出したりすれば、Excelで目次を作るためのデータとして利用できます。
また、紙をスキャンしたPDFは「文字入りPDF」と「ページ全体が画像になっているPDF」で扱いが異なります。単にPDFへ変換すれば必ずExcelが文字を読み取れるわけではないため、目的に応じてPDF変換とOCRを使い分けるのがポイントです。
- そもそもDocuWorks文書とPDFは別のファイル形式
- Excelの「PDFから」はPDFを丸ごとExcel文書に変える機能とは少し違う
- 方法1:DocuWorks文書をPDFへ変換してからExcelで取り込む
- ただし紙をスキャンした文書ではOCRが必要になることがある
- 方法2:DocuWorksのOCRを使って文字を取り出す
- 目次を作るだけなら「PDF→Excel変換」にこだわらなくてもよい
- 方法3:複合機側で最初からPDF保存できないか確認する
- PDFにできてもExcelでうまく読み取れない場合の確認ポイント
- 文書の種類によっておすすめ方法は変わる
- 職場の文書では外部の無料変換サイトへアップロードしない
- 目次作成ならこの順番で確認するのがおすすめ
- まとめ:DocuWorksを直接Excelへ変換するよりPDF変換・OCRを目的に応じて使い分ける
そもそもDocuWorks文書とPDFは別のファイル形式
DocuWorksは富士フイルムビジネスイノベーションが提供している文書管理ソフトウェアです。紙文書を電子化したデータやOffice文書などを、電子上の机のような環境でまとめて扱えることが特徴です。[参照] 富士フイルムビジネスイノベーション DocuWorks
代表的なDocuWorks文書の拡張子は「.xdw」です。一方、PDFは「.pdf」です。見た目としてはどちらも紙のページを電子化した文書に見えますが、内部のファイル形式は異なります。
そのため、例えば「scan001.xdw」というファイルをExcelのPDF取り込み機能で直接選び、「PDFと同じように表や文字をExcelへ変換する」という使い方は基本的にできません。まずはDocuWorksから必要な情報を取り出せる形式へ変換する必要があります。
Excelの「PDFから」はPDFを丸ごとExcel文書に変える機能とは少し違う
Microsoft Excelには、対応するWindows版などで「データ」タブからPDFファイルへ接続し、PDF内で検出された表などのデータを取り込む機能があります。Microsoftの案内では「データ」→「データの取得」→「ファイルから」→「PDFから」と進み、ナビゲーターに表示された利用可能なテーブルを選択して読み込む方法が紹介されています。[参照] Microsoft サポート「PDFからデータをインポートする」
ここで重要なのは、これはPDFの全ページを完全なExcelファイルへ変換する万能機能ではないということです。Power QueryがPDF内から認識したデータを取得する仕組みなので、元の文書の構造によって取り込み結果が変わります。
例えば元データから生成された表形式のPDFなら比較的扱いやすい一方、コピー機で紙をスキャンしただけのPDFでは、ページが一枚の画像として入っていることがあります。その場合、ExcelのPDF取り込みだけでは期待する文字一覧が得られない可能性があります。
方法1:DocuWorks文書をPDFへ変換してからExcelで取り込む
元のDocuWorks文書をPDFへ変換できる環境なら、まずPDFを作成し、そのPDFをExcelから読み込む方法があります。DocuWorksにはPDFへの変換・出力に利用できる機能が用意されていますが、具体的な操作や利用可能な機能はDocuWorksのバージョンや職場の環境によって異なります。
一般的にはDocuWorks Desk上で対象文書を選択し、PDFへの変換機能やPDF出力に対応した機能を利用します。職場PCでは管理者が設定を制限している場合もあるため、メニューが見当たらない場合は社内のシステム担当者へ確認するのが確実です。
PDFを作成できたらExcel側で「データ」→「データの取得」→「ファイルから」→「PDFから」と進みます。目的の表やデータがナビゲーターに認識されれば、そのまま読み込んだりPower Queryで整形したりできます。
ただし紙をスキャンした文書ではOCRが必要になることがある
今回のように「職場のコピー機でスキャンした文書」という条件では、PDF変換だけで解決しない可能性があります。紙をスキャンすると、文字の形は画面に表示されていても、コンピューターから見ると単なる画像である場合があるためです。
例えば紙に「第1章 総務関係」「第2章 人事関係」と印刷されていても、スキャン直後のデータでは、それらが「第」「1」「章」という文字コードではなく、一枚の写真として記録されていることがあります。この状態ではExcelが文章として簡単に抽出できません。
そこで利用するのがOCR(光学文字認識)です。OCRは画像に写っている文字を解析し、検索・コピーなどに利用できる文字情報へ変換する技術です。
方法2:DocuWorksのOCRを使って文字を取り出す
DocuWorksにはOCRによってイメージ文書を文字認識する機能があります。富士フイルムビジネスイノベーションの公式サポートでも、DocuWorks文書へOCR処理を行い、文字情報を付加する方法が案内されています。[参照] 富士フイルムビジネスイノベーション サポート
OCR処理が成功すれば、スキャン画像だった文書から文字を検索したり、認識結果を利用したりしやすくなります。「表を完全にExcel化したい」というより、「文書に書かれたタイトルを拾って目次を作りたい」という用途では、この方法が適していることがあります。
例えば100ページの資料から各章のタイトルだけをExcelへ並べたいなら、ページのレイアウトを丸ごとExcelへ再現する必要はありません。OCRで文字を取得し、必要な見出しだけExcelへコピーして「ページ番号」「文書名」「備考」などの列に整理する方が作業しやすい場合があります。
目次を作るだけなら「PDF→Excel変換」にこだわらなくてもよい
目的が「文書の目次をExcelで作成すること」なら、PDF全体をExcelへ変換すること自体が目的ではありません。必要なのは、各文書・ページの名称とページ番号などを効率よくExcelへ入力できる状態にすることです。
例えば最終的な目次が「1ページ:契約書」「4ページ:仕様書」「12ページ:見積書」「15ページ:検査記録」のような一覧なら、元文書の本文やレイアウトまでExcelへ移す必要はありません。DocuWorks上でOCRした文字から必要なタイトルを取り出し、Excelへ貼り付けるだけでも十分です。
文書数がそれほど多くない場合には、変換後の崩れを一つずつ直すより、DocuWorksを見ながらExcelへタイトルとページ番号だけ入力する方が速いこともあります。自動化に必要な修正時間まで含めて方法を選ぶのがポイントです。
方法3:複合機側で最初からPDF保存できないか確認する
今後も同じ作業を繰り返すなら、コピー機・複合機でスキャンするときにDocuWorksだけでなくPDFを選択できないか確認する価値があります。業務用複合機では、スキャンデータの保存形式としてPDF、DocuWorks文書、JPEG、TIFFなど複数の形式を選択できる機種があります。
さらに機種や契約しているオプションによっては、OCRを利用した「検索可能なPDF」などを作成できる場合があります。これならスキャン時点で文字情報を含んだPDFを作れるため、その後の検索やデータ活用がしやすくなります。
ただし、利用可能な形式は複合機の型番・オプション・管理者設定によって異なります。「職場では必ずDocuWorksになる」という場合も、機械の仕様ではなく社内でその形式を初期設定にしているだけという可能性があります。勝手に設定を変更せず、管理担当者へ「PDFまたはOCR付きPDFでスキャンできるか」を確認するとよいでしょう。
PDFにできてもExcelでうまく読み取れない場合の確認ポイント
DocuWorks文書をPDFへ変換したのにExcelで欲しいデータが表示されない場合、まずPDF上の文字をマウスで選択・コピーできるか確認すると切り分けやすくなります。
文字を選択してコピーできるなら、すでにテキスト情報を持っている可能性があります。この場合はExcelのPDF取り込み、コピー&ペースト、Power Queryなど複数の方法を試せます。一方、ページ全体を画像としてしか選択できない場合は、OCR処理が必要になる可能性が高くなります。
また、OCRを行っても100%正しく文字認識されるとは限りません。小さい文字、傾いた原稿、薄い印刷、手書き文字、罫線と重なった文字などは誤認識されることがあります。特に目次のページ番号や文書番号は間違えると実務上の問題につながるため、最終的には原本と照合してください。
文書の種類によっておすすめ方法は変わる
最適な方法を整理すると、元のデータが表形式でPDFへ変換後も文字情報を保持しているなら、Excelの「PDFから」機能を試す価値があります。大量の紙資料をスキャンした画像中心の文書なら、先にOCRすることが重要です。
一方、「数十ページの資料について見出しを10~20件だけ目次にしたい」という程度なら、全文をExcelへ変換するより、DocuWorksでページを確認しながら必要項目だけ入力する方が簡単です。
つまり、「DocuWorks→PDF→Excel」が常に正解ではありません。最終目的が目次作成なら、必要な文字だけOCRで取得する方法も含めて、最も修正作業が少ない手順を選ぶと効率的です。
職場の文書では外部の無料変換サイトへアップロードしない
検索すると「PDFをExcelへ無料変換」「画像をOCR」といったオンラインサービスが多数見つかります。しかし、職場でスキャンした文書を扱う場合は、会社の許可なく外部サービスへアップロードしないよう注意してください。
契約書、顧客情報、社員情報、社内資料などが含まれていれば、外部サイトへのアップロード自体が社内の情報セキュリティ規程に違反する可能性があります。便利さだけでサービスを選ばず、会社で承認されているDocuWorks、Microsoft 365、複合機などの環境内で処理するのが基本です。
特に「無料OCRサイトへ一度アップロードしてExcelにする」という方法は技術的には簡単でも、業務文書には適さない場合があります。分からなければ情報システム担当者や上司へ確認してください。
目次作成ならこの順番で確認するのがおすすめ
職場のコピー機からDocuWorks文書が作られる環境では、次の順番で確認すると無駄な変換作業を減らせます。
- 最終的にExcelへ必要なのが「全文・表」なのか「目次用のタイトルとページ番号だけ」なのか整理する
- DocuWorks文書内の文字が検索・選択できるか確認する
- 画像だけならDocuWorksのOCRが利用できるか確認する
- PDFが必要ならDocuWorksからPDFへ変換できるか確認する
- PDF内に表データがある場合はExcelの「データ」→「PDFから」を試す
- 今後も頻繁に作業するなら、複合機で最初からPDFまたはOCR対応PDFとしてスキャンできないか管理者へ確認する
- 作成した目次の文書名・番号・ページ番号を原本と照合する
特に目次だけなら、全文変換より「OCR→必要な見出しだけExcelへ整理」という流れの方が簡単になる可能性があります。
まとめ:DocuWorksを直接Excelへ変換するよりPDF変換・OCRを目的に応じて使い分ける
コピー機でスキャンして作成されたDocuWorks文書はPDFとは別形式なので、Excelの「PDFからデータを取得」へXDWファイルをそのまま読み込ませる方法は使えません。PDF経由で処理したい場合は、まずDocuWorks側でPDFへ変換します。
ただし、紙をスキャンしたDocuWorks文書ではページが画像になっていることがあります。この場合はPDFへ変換しただけではExcelが文字や表を期待どおり認識できず、OCRが必要になることがあります。
今回のように目的が「文書の目次をExcelで作ること」であれば、必ずしも文書全体をExcel化する必要はありません。DocuWorksでOCRを行って必要な見出しを取得し、Excelへ「ページ番号・文書名・備考」などを整理する方法も有効です。
今後も同じ作業が多いなら、複合機で最初からPDFやOCR対応PDFを出力できるか職場の管理担当者へ確認するのもおすすめです。DocuWorks→PDF→Excelという変換だけにこだわらず、「最終的に目次へ必要な情報は何か」から逆算して方法を選ぶことが、最も効率のよい進め方です。


コメント