Extraia o texto de um PDF de forma programática usando C#
Use o MESCIUS Document Solutions for PDF para automatizar a extração de texto de PDFs para indexação, pesquisa e muito mais.

Document Solutions for PDF (DsPdf) é uma API de PDF do lado do servidor, de alta velocidade e rica em recursos, para .NET, sem dependências do Adobe Acrobat. O DsPdf permite que os desenvolvedores criem, manipulem, importem/exportem e implantem documentos PDF de forma programática, incluindo AcroForms, em escala em aplicativos de desktop e web. Com suporte completo ao .NET, você pode gerar, carregar, modificar e converter PDFs diretamente dentro dos seus apps .NET, Mono, Xamarin.iOS e Xamarin.Android. Ele também inclui um visualizador/editor rápido baseado em JavaScript no lado do cliente, que permite que os usuários visualizem/opcionalmente editem documentos PDF em aplicativos de desktop/web.
Neste post do blog, a Especialista de Marketing de Produto da MESCIUS, Mackenzie Albitz, demonstra como usar o DsPdf para desbloquear conteúdo em PDF de forma contínua, analisando e extraindo texto de PDFs para uma variedade de cenários, incluindo:
- Extraindo todo o texto de um arquivo PDF
- Extraindo texto de uma página específica de um PDF
- Extraindo texto de limites predefinidos em um PDF
- Extraindo fontes de um PDF
Há código de exemplo incluído e até um link para uma Demonstração de Início Rápido, além de um aplicativo de exemplo completo para ajudar você a começar.
Leia o blog completo para aprender como desbloquear conteúdo em PDF.
Document Solutions for PDF é licenciado por desenvolvedor e está disponível em várias opções de licença para atender necessidades diferentes de distribuição. Licenças de equipe também estão disponíveis para vários desenvolvedores dentro da mesma organização. Consulte nossa página de licenciamento do Document Solutions for PDF para obter todos os detalhes.
Saiba mais na nossa página do produto Document Solutions for PDF.