ExpertPDF PdfToText는 애플리케이션 내에서 사용할 수 있도록 PDF 문서에서 텍스트 콘텐츠를 추출하는 .NET 라이브러리입니다. 기존 프로젝트에 쉽게 통합되며 추출된 콘텐츠를 .NET string 객체로 반환하므로, 검색 작업, 인덱싱, 문서 분석 또는 파일이나 데이터베이스에 저장하는 데 사용할 수 있습니다.
PDF 문서에서 텍스트 추출
이 라이브러리는 PDF 문서에서 텍스트 콘텐츠를 가져와 .NET string 객체로 변환합니다.
파일 및 스트림 소스 지원
이 구성 요소는 디스크에 저장된 PDF 파일과 PDF 데이터 스트림 모두에서 텍스트를 추출합니다.
원본 레이아웃 보존
추출 엔진은 원본 PDF 콘텐츠의 레이아웃을 보존할 수 있습니다. 텍스트 위치와 간격이 소스 문서의 구조를 반영하도록 유지됩니다.
읽기 순서 기반 텍스트 추출
이 라이브러리는 PDF 문서의 논리적 읽기 순서에 따라 텍스트를 추출할 수 있습니다. 이를 통해 처리 시 단락과 섹션이 자연스러운 순서로 표시됩니다.
페이지 범위 추출 제어
개발자는 텍스트 추출을 위해 특정 페이지 범위를 정의할 수 있습니다. 이를 통해 애플리케이션은 대용량 문서에서 관련 섹션만 처리할 수 있습니다.
메타데이터 태그가 포함된 HTML 출력
추출된 텍스트는 선택적 설명 메타데이터와 함께 HTML 형식으로 저장할 수 있습니다. 이 구성 요소는 제목, 키워드, 작성자와 같은 문서 정보를 HTML meta 태그에 포함할 수 있습니다.
추출된 텍스트에서 페이지 구분 표시
이 구성 요소는 구성 가능한 특수 문자를 사용하여 추출된 텍스트 내의 페이지 경계를 표시할 수 있습니다. 이를 통해 애플리케이션은 문서 구조를 보존하고 원본 PDF 페이지에 대한 텍스트 위치를 추적할 수 있습니다.
암호로 보호된 PDF 지원
액세스에 암호가 필요한 PDF 문서를 처리합니다. 애플리케이션은 필요한 자격 증명을 제공하고 보호된 파일에서 텍스트를 추출할 수 있습니다.
PDF 페이지 수 가져오기
PDF 문서에 포함된 페이지 수를 쉽게 확인할 수 있습니다. 애플리케이션은 이 정보를 사용하여 문서를 검증하거나, 탐색 기능을 만들거나, 추출 프로세스를 관리할 수 있습니다.
위치 정보가 포함된 텍스트 검색
PDF 문서 내에서 특정 텍스트를 검색할 수 있는 기능을 제공합니다. 검색 결과에는 페이지 번호와 페이지 내 텍스트의 위치가 포함됩니다.
루마니아에 설립된 Outside Software Inc.는 고급 .NET 컴포넌트와 완전한 .NET 애플리케이션 개발에 집중하는 것으로 인정받고 있습니다. 기술적 전문성을 바탕으로, 금융, 의료, 기술, 정부 등 다양한 분야의 조직을 포함해 전 세계 수천 명의 고객 신뢰를 얻었습니다. Outside Software의 제품은 특히 .NET 환경에서 신뢰할 수 있는 PDF 기능과 통합을 구현하려는 웹 및 소프트웨어 개발자들 사이에서 인기가 높습니다. Outside Software를 선택한다는 것은 현대적인 엔터프라이즈급 솔루션의 요구를 충족하도록 설계된 검증된 소프트웨어 컴포넌트를 활용하는 것을 의미합니다.