FreePDF logoFreePDF

Como extrair as imagens de um PDF (e não prints das páginas)

Pela equipe do FreePDF ·

Um fornecedor manda um catálogo de 40 páginas e você só quer as fotos dos produtos. Tirar print de cada uma joga resolução fora, e converter o PDF em JPG devolve páginas inteiras com o texto grudado na imagem. O que você quer são as figuras em si: os arquivos que alguém arrastou para dentro do documento antes de exportá-lo.

Extrair imagens não é converter páginas

São dois trabalhos diferentes e os nomes das ferramentas são parecidos demais, então vale deixar claro qual você precisa.

  • PDF em JPG renderiza cada página como uma única imagem achatada: texto, fotos, números de página, tudo junto, na resolução que você pedir.
  • Extrair imagens entra no arquivo e retira cada figura incorporada separadamente, na resolução exata em que ela foi guardada.

Nada é recodificado no caminho. Uma foto de 3000×2000 volta como 3000×2000 mesmo que no layout ela aparecesse do tamanho de uma miniatura, porque o PDF guardou a imagem inteira e apenas a exibia pequena. Costuma ser uma surpresa boa: as fotos são maiores do que pareciam na página.

O que vem no ZIP

Tudo volta em um único ZIP, para você não clicar em 60 downloads. Cada arquivo leva o nome da página de onde saiu, na ordem em que aparece, então page7_23_Im4.png é o quarto objeto de imagem da página 7. Ordenando a pasta por nome, as imagens ficam na ordem de leitura, o que facilita relacioná-las ao documento.

Os formatos são os que o PDF guardou, normalmente PNG ou JPG. Podem aparecer mais arquivos do que você esperava: um fundo de página, um logotipo repetido no cabeçalho de todas as páginas, um fio fino salvo como uma imagem de dois pixels. Dê uma olhada e apague, em vez de supor que todo arquivo é uma foto.

Quando a figura que você quer não sai

A ferramenta só encontra imagens em bitmap, aquelas feitas de pixels. Algumas coisas que parecem figuras na página não são guardadas assim:

  • Logotipos, ícones e gráficos desenhados em vetor. Um gráfico exportado do Illustrator ou gerado por uma ferramenta de relatórios costuma ser um conjunto de instruções de desenho, não uma imagem. Não há objeto de imagem para retirar, e a ferramenta avisa que não achou nenhuma.
  • Fotos fatiadas em tiras. Alguns programas de diagramação cortam uma imagem grande em faixas horizontais ao gravar o PDF. Você recebe as faixas, em ordem, e precisa juntá-las de novo.
  • Imagens recortadas no layout. O recorte é uma instrução de exibição, então você recebe a figura original inteira, inclusive a parte que estava escondida na página.

Para tudo do primeiro caso, renderize a página e recorte o resultado. Você perde a resolução original, mas uma página renderizada a 300 DPI de um gráfico vetorial sai nítida em um slide ou em um documento.

Documentos digitalizados se comportam diferente

Se o PDF saiu de um scanner ou de um aplicativo de digitalização do celular, cada página é uma imagem grande. A extração devolve exatamente isso: uma foto por página, a digitalização em si, na resolução em que foi feita. É bem útil quando você quer recuperar as digitalizações originais de um pacote que alguém juntou, e inútil se a ideia era isolar uma figura impressa na página. Nesse caso, extraia a imagem da página e recorte.

Perguntas frequentes

As imagens extraídas terão qualidade pior do que no PDF?

Não. Os dados da imagem incorporada são copiados como estão, em vez de salvos de novo, então não há uma segunda rodada de compressão. Se a foto já tinha sido achatada para 72 DPI quando o documento foi criado, é isso que você recebe. A extração não piora nada, mas também não recupera detalhe que o PDF nunca teve.

Dá para tirar as imagens de uma página só?

Não direto, mas são dois passos: extraia aquela página para um PDF próprio e rode a extração de imagens nele. Em documentos longos costuma ser mais rápido do que garimpar um ZIP cheio de cabeçalhos e fios, e os nomes dos arquivos ficam mais limpos.

Ferramentas gratuitas relacionadas