Extraia texto limpo de qualquer página web
Extraia o texto legível de qualquer página da web — títulos, parágrafos, conteúdo principal — limpo e estruturado, pronto para copiar ou baixar.
Seu primeiro scan não exige conta · Resultados em segundos
Conteúdo principal
Extrai o conteúdo principal da página com algoritmos de legibilidade — remove navegação, rodapés, anúncios e boilerplate.
Hierarquia de títulos
Captura os títulos H1–H6 na ordem certa e entrega um esboço estruturado do conteúdo da página.
Saída limpa
O texto bruto é salvo como content/main_text.txt — pronto para colar em documentos, alimentar uma IA ou analisar com scripts.
Como funciona o extrator de texto de sites
Informe qualquer URL
Cole o endereço de qualquer página — artigo, post de blog, landing page ou página de produto.
O SmartScan baixa a página e faz a limpeza
A página é carregada e os algoritmos de legibilidade removem navegação, anúncios, rodapés e boilerplate.
Baixe o texto limpo em um arquivo TXT
Receba o conteúdo principal em um arquivo de texto simples — limpo, estruturado e pronto para usar.
Extração por legibilidade
Usa um algoritmo de legibilidade (parecido com o modo de leitura do Firefox) para isolar o artigo ou bloco de conteúdo principal da página.
Páginas com JS
Mude para o modo dinâmico para extrair texto de apps em React, Vue ou Angular que renderizam o conteúdo via JavaScript.
Estrutura de títulos
A hierarquia H1–H6 é extraída separadamente, para você ver o esboço do conteúdo da página num relance.
Casos de uso populares
Alimente o ChatGPT, o Claude ou outros LLMs com texto limpo, sem ruído de HTML.
Extraia e compare textos de páginas de concorrentes, posts de blog ou landing pages.
Obtenha o texto limpo de qualquer página para usar em ferramentas de comparação.
Envie o texto extraído para pipelines de NLP, análise de sentimento ou ferramentas de palavras-chave.
Perguntas frequentes
- Ele extrai todo o texto ou só o conteúdo principal?
- Você recebe os dois: a versão limpa do "conteúdo principal" (sem boilerplate) e o texto bruto completo da página. Ambos vêm no ZIP do resultado.
- Funciona em páginas renderizadas com JavaScript?
- Sim. Mude para o modo de renderização dinâmica (JS) para extrair texto de SPAs e páginas pesadas em JavaScript.
- Qual é o formato da saída?
- O texto principal é salvo como
content/main_text.txtno seu ZIP. O JSON completo do resultado também traz o texto com a hierarquia de títulos. - Posso extrair texto de várias páginas?
- Sim — use o Crawl do site ou o scan em massa para extrair texto de várias URLs em um único job. Cada página ganha seu próprio arquivo de texto.
- Esta ferramenta é gratuita?
- Sim — o SmartScan é gratuito. Cadastre-se e tenha 1.000 scans/mês. Sem cartão de crédito.
Extraia texto limpo de qualquer site
Grátis — 1.000 scans/mês. Sem cartão de crédito.