iTextSharp を使用して PDF からテキストの書式設定 (フォント、サイズ、スタイル) を取得するにはどうすればよいですか?
iTextSharp を使用してテキスト形式を抽出する方法
iTextSharp は効率的なテキスト抽出方法を提供しますが、フォント、色、サイズなどの書式設定の詳細を保持する点で欠点がある可能性があります。この制限を克服するために、私たちは別のアプローチを検討しました。
カスタマイズされたテキスト抽出戦略
カスタム TextWithFontExtractionStategy
クラスは、形式情報を取得するために ITextExtractionStrategy
インターフェイスを拡張します。 RenderText
メソッド内:
- フォント名、疑似太字の使用、ベースラインの変更、フォント サイズの変更を監視します。
- これらの属性のいずれかが変更されると、現在の HTML の span タグが閉じられ、対応するスタイルで新しいタグが作成されます。
出力例
次の C# コードは、PDF からテキストとフォント関連の書式設定を抽出する方法を示しています。
StringBuilder result = new StringBuilder(); PdfReader reader = new PdfReader(System.IO.Path.Combine(Environment.GetFolderPath(Environment.SpecialFolder.Desktop), "Document.pdf")); TextWithFontExtractionStategy S = new TextWithFontExtractionStategy(); string F = iTextSharp.text.pdf.parser.PdfTextExtractor.GetTextFromPage(reader, 1, S); Console.WriteLine(F);
生成された HTML 出力には、フォント ファミリ、フォント サイズ、フォント スタイルのタグが含まれています。
その他の考慮事項
-
PostscriptFontName
には、フォントのサブセット化に関連する可能性のある追加の文字が含まれる場合があります。 - コード例では、ベースラインの変更が HTML の改行を表すことを前提としています。
- 現時点では、抽出プロセスでは色情報が取得されませんが、これを手動で取得できる可能性があるという兆候があります。
以上がiTextSharp を使用して PDF からテキストの書式設定 (フォント、サイズ、スタイル) を取得するにはどうすればよいですか?の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

ホットAIツール

Undresser.AI Undress
リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover
写真から衣服を削除するオンライン AI ツール。

Undress AI Tool
脱衣画像を無料で

Clothoff.io
AI衣類リムーバー

AI Hentai Generator
AIヘンタイを無料で生成します。

人気の記事

ホットツール

メモ帳++7.3.1
使いやすく無料のコードエディター

SublimeText3 中国語版
中国語版、とても使いやすい

ゼンドスタジオ 13.0.1
強力な PHP 統合開発環境

ドリームウィーバー CS6
ビジュアル Web 開発ツール

SublimeText3 Mac版
神レベルのコード編集ソフト(SublimeText3)

ホットトピック











この記事では、C標準テンプレートライブラリ(STL)について説明し、そのコアコンポーネント(コンテナ、イテレーター、アルゴリズム、およびファンクター)に焦点を当てています。 これらが一般的なプログラミングを有効にし、コード効率を向上させ、読みやすさを改善する方法を詳述しています。

この記事では、cの効率的なSTLアルゴリズムの使用について詳しく説明しています。 データ構造の選択(ベクトル対リスト)、アルゴリズムの複雑さ分析(STD :: STD :: STD :: PARTIAL_SORTなど)、イテレーターの使用、および並列実行を強調しています。 のような一般的な落とし穴

この記事では、不必要なコピーを回避することにより、パフォーマンスを向上させるために、CのMove Semanticsを使用することについて説明します。 STD :: MOVEを使用して、移動コンストラクターと割り当てオペレーターの実装をカバーし、効果的なAPPLの重要なシナリオと落とし穴を識別します

この記事では、Cでの動的発送、そのパフォーマンスコスト、および最適化戦略について説明します。動的ディスパッチがパフォーマンスに影響を与え、静的ディスパッチと比較するシナリオを強調し、パフォーマンスとパフォーマンスのトレードオフを強調します

C 20の範囲は、表現力、複合性、効率を伴うデータ操作を強化します。複雑な変換を簡素化し、既存のコードベースに統合して、パフォーマンスと保守性を向上させます。

記事では、移動セマンティクス、完璧な転送、リソース管理のためのcでのr値参照の効果的な使用について説明し、ベストプラクティスとパフォーマンスの改善を強調しています。(159文字)

この記事では、Cでの効果的な例外処理、トライ、キャッチ、スローメカニックをカバーしています。 RAIIなどのベストプラクティス、不必要なキャッチブロックを避け、ログの例外をロギングすることを強調しています。 この記事では、パフォーマンスについても説明しています

Cメモリ管理は、新しい、削除、およびスマートポインターを使用します。この記事では、マニュアルと自動化された管理と、スマートポインターがメモリリークを防ぐ方法について説明します。
