> ## Documentation Index
> Fetch the complete documentation index at: https://docs.tess.im/llms.txt
> Use this file to discover all available pages before exploring further.

# AI Step | Extract Text from Entire PDF

Neste tutorial, vamos explicar como usar o Step de "Extract Text from Entire PDF" na plataforma Tess AI. Essa etapa é útil para extrair texto de um PDF, permitindo que você o utilize para treinar seu modelo ou consultar o documento.

Aqui estão os detalhes sobre como preencher os campos e exemplos de casos de uso:

<Frame>
  <img src="https://mintcdn.com/tess-dfe1edf0/T8BXCjKeHQ3OqfdE/images/image-121.png?fit=max&auto=format&n=T8BXCjKeHQ3OqfdE&q=85&s=11166235296688abc8e1634ca1808b91" alt="Image" width="445" height="503" data-path="images/image-121.png" />
</Frame>

> **Campos de Preenchimento:** Insira o arquivo ou link PDF - Neste campo, você precisa fornecer o link de um arquivo PDF publicado na internet e com acesso liberado. Alternativamente, você pode usar o resultado da entrada do usuário "Subir Arquivo" para extrair dados de arquivos armazenados em seu computador.
>
> **Resultado de Output:** O texto de todo o PDF será extraído.

### **Casos de Uso:**

1. **Importação de Contratos para Consultas:** Imagine que você tem uma biblioteca de contratos em formato PDF. Usando a Etapa "Extract Text from Entire PDF", você pode extrair o texto de todos esses contratos e criar um modelo de busca que permita aos usuários pesquisar termos específicos nos contratos. Isso é útil para localizar informações importantes rapidamente.
2. **Importação de Knowledgebases para Consulta:** Se você possui uma base de conhecimento em formato PDF, pode usar esta etapa para extrair o conteúdo de todos os documentos e disponibilizá-lo em um sistema de consulta. Os usuários podem, então, pesquisar e acessar informações relevantes de maneira eficaz.
3. **Importação de Documentos para Treinamento de Diversos Mercados:** Se você estiver treinando um modelo de IA para um mercado específico, como o setor financeiro, jurídico ou médico, pode usar a Etapa "Extract Text from Entire PDF" para coletar dados de documentos PDF relevantes. Esses dados podem ser usados para treinar o modelo e melhorar sua compreensão do mercado, permitindo que ele forneça informações mais precisas e contextuais.

<Info>
  **Limitações:**

  É importante ter em mente que o treinamento de sua IA com base em documentos PDF extraídos por meio do Tess AI possui uma limitação de tamanho. 

  O treinamento não pode ultrapassar 80.000 palavras. Portanto, certifique-se de que o PDF selecionado esteja dentro deste limite. Caso você tenha um PDF com mais de 80.000 palavras, considere dividi-lo em partes menores ou selecionar apenas as seções mais relevantes.

  Caso contrário, é melhor usar o modo de GPTs da criação, adicionando o arquivo como RAG.
</Info>

O Step "Extract Text from Entire PDF" é uma ferramenta poderosa que permite a extração de texto de PDFs para diversos fins, desde consultas de contratos até treinamento de modelos em diferentes setores. Ela simplifica o processo de obtenção de dados de documentos PDF e facilita a utilização desses dados em seu fluxo de trabalho.
