PDFツール by Workato - PDFからテキストを抽出アクション
Extract text from PDFアクションは、デジタル(機械可読)PDFドキュメントから生の非構造化テキストを抽出し、コンテンツをページごとに返します。 サポートされるソースPDFには、Word、Excel、PowerPoint、Webページ、またはシステム生成レポートから作成されたPDFが含まれます。
このアクションは通常、PDFコンテンツをAIエージェント用のナレッジベースに取り込む場合や、AI要約用にテキストを準備する場合に使用されます。
スキャンされたPDFと構造化抽出はサポートされていません
このアクションは生のテキストのみを返します。 スキャンされたPDFや画像ベースのPDFはサポートされず、定義済みスキーマにデータを抽出することもできません。 構造化データを抽出する場合、またはスキャンされたドキュメントを処理する場合は、代わりにIDP by Workatoを使用してください。
入力
| 入力フィールド | 説明 |
|---|---|
| ソースPDF | テキストの抽出元となるPDFのファイルコンテンツを指定します。 最大サイズは100 MBです。 |
| ページ範囲 | テキストの抽出元となるページを指定します。 例:1-3,5-5,7-10。 指定しない場合、デフォルトですべてのページになります。 |
出力
| 出力フィールド | 説明 |
|---|---|
| ページ | 抽出されたテキストを含むページのリスト。 リスト内の各項目には次の項目が含まれます。 |
| ページ番号(Pages) | ソースPDF内のページ番号。例:1。 |
| コンテンツ(Pages) | ページから抽出されたテキストコンテンツ。 |
| リストサイズ(Pages) | Pagesリスト内のページの総数。 |
| リストインデックス(Pages) | Pagesリスト内の現在のページの位置。 |
最終更新日: