PDFlib TET는 PDF 문서를 위한 텍스트 및 데이터 추출 툴킷입니다. 구조 및 위치 정보를 유지하면서 콘텐츠를 정규화된 Unicode 텍스트로 변환합니다. 복잡한 레이아웃, 이미지, 메타데이터를 지원하여 신뢰할 수 있는 콘텐츠 분석, 인덱싱, 문서 변환 워크플로를 가능하게 합니다.
광범위한 PDF 호환성
최신 사양, 암호화된 파일, 손상된 콘텐츠를 포함한 다양한 PDF 문서를 처리하여, 여러 문서 유형에서 일관된 추출 결과를 보장합니다.
Unicode 텍스트 추출
PDF 텍스트를 정규화된 Unicode 출력으로 변환하며, 문자 매핑, 합자, 인코딩 차이를 처리하여 여러 언어와 스크립트에 걸쳐 일관되고 기계 판독 가능한 텍스트를 생성합니다.
콘텐츠 및 레이아웃 분석
문서 구조를 분석하여 읽기 순서를 재구성하고, 단어 경계를 감지하며, 하이픈으로 연결된 텍스트를 병합하고, 콘텐츠를 논리적인 단락과 열로 구성하여 사용성을 향상시킵니다.
표 및 구조 감지
표, 목록, 다중 열 레이아웃을 식별하고 구조적 관계를 보존하여 정확한 데이터 추출과 구조화된 문서 콘텐츠의 후속 처리를 지원합니다.
정밀한 텍스트 및 이미지 위치 지정
텍스트와 이미지에 대해 위치, 크기, 방향, 글꼴 속성을 포함한 상세한 기하학적 정보를 제공하여 정밀한 공간 분석과 레이아웃 재구성을 가능하게 합니다.
이미지 추출
내장 이미지를 원래 형식 그대로 추출하면서 품질, 색상 정보, 관련 마스크를 보존하여 시각 콘텐츠의 정확한 재사용과 처리를 지원합니다.
메타데이터 및 문서 정보 접근
XMP 속성, 북마크, 주석, 포함 파일을 포함한 문서 메타데이터를 검색하여 문서 수준 정보에 대한 포괄적인 접근을 가능하게 합니다.
유연한 출력 옵션
추출된 콘텐츠를 일반 Unicode 텍스트 또는 구조화된 XML로 출력하여 검색, 인덱싱, 콘텐츠 처리 시스템과의 통합을 위한 상세한 레이아웃 및 의미 정보를 제공합니다.
제품 호환성
아래의 세부 정보를 확인하여 이 제품이 사용 환경에서 지원되는지 확인하세요.
컴포넌트 유형
.NET
Java
Windows DLL
.NET 버전
.NET 10 LTS
.NET 9 STS
.NET 8 LTS
.NET 5 / .NET Core 3.1
.NET 4.8 or earlier
.NET 플랫폼
.NET 어셈블리
.NET 클래스
.NET Core 3.1 어셈블리
Java 플랫폼
Java Class
IDE 지원
Visual Studio
PDFlib에 대해
PDFlib은 1997년에 설립되어 독일 뮌헨에 본사를 둔 회사로, 소프트웨어 개발자와 IT 전문가를 위한 PDF 기술 개발을 전문으로 합니다. 이 회사의 구성 요소는 서버, 데스크톱, 모바일 플랫폼 전반에서 PDF 문서를 생성, 조작, 개인화하는 데 널리 채택되고 있습니다. ISO PDF 표준과 널리 사용되는 PDF 뷰어와의 호환성에 대한 강한 commitment를 바탕으로, PDFlib은 다양한 환경에서 규격 준수와 신뢰성을 보장합니다. 이 브랜드의 글로벌 영향력은 유럽, 북미, 일본의 주요 시장을 포함하며, 핵심 라이브러리는 C, Java, .NET, Python과 같은 널리 쓰이는 프로그래밍 언어에서 사용할 수 있어 동적인 PDF 솔루션을 위한 신뢰할 수 있는 선택이 됩니다.