Pular para o conteúdo

Word para texto

Tire o texto de um .docx — com a estrutura, ou limpo.

Solte um .docx aqui

ou Escolher arquivo

Só Word · planilha e apresentação guardam o conteúdo em outro lugar

O que está no corpo, e o que nunca esteve

Um .docx guarda o texto em word/document.xml, e a estrutura que interessa está toda lá: parágrafo, estilo de título, item de lista, tabela, negrito e itálico. Essa metade sai daqui inteira.

A outra metade — o layout — não está no corpo. Onde a página quebra, como a coluna flui, o que o cabeçalho e o rodapé fazem, qual fonte o leitor vai substituir: nada disso é conteúdo, é o Word calculando na hora de exibir. É exatamente por isso que este produto não oferece Word para PDF, e é a mesma fronteira que separa uma extração honesta de uma conversão aproximada.

Como extrair

A prévia aparece na própria página antes de qualquer download, porque quem extrai texto quer conferir se veio tudo — e porque na maioria das vezes o destino é a área de transferência, não um arquivo.

  1. Solte o .docx.
  2. Escolha Markdown, se o destino guarda estrutura, ou texto limpo, se não guarda.
  3. Extraia. A contagem de palavras, títulos e tabelas aparece ao lado.
  4. Copie tudo, ou baixe como .md ou .txt.

Markdown ou texto limpo

Markdown é o formato certo quando o destino entende estrutura: um editor, um README, um campo de instrução de IA, um gerador de site. Título vira cabeçalho, lista vira lista, tabela vira tabela com a linha de separação que os leitores exigem, e negrito e itálico sobrevivem.

Texto limpo é o certo quando estrutura atrapalha: contar palavras, buscar um trecho, alimentar um campo que não aceita marcação. Ali os sustenidos e os asteriscos seriam ruído.

A diferença não é cosmética, e por isso a escolha vem antes de extrair e refaz a leitura quando muda.

As duas coisas que a leitura resolve e quase ninguém nota

A primeira é a lista NUMERADA. O parágrafo não diz se a lista tem números ou marcadores — ele traz um identificador, e o formato mora em outro arquivo do pacote, atrás de mais um salto. Sem seguir esses dois saltos, toda lista viraria marcador e uma sequência de passos perderia a ordem que é a razão de ela existir.

A segunda é o título em português. O Word grava o identificador do estilo sem acento em algumas versões, e uma leitura que só reconhece a forma em inglês devolve um documento inteiro sem título nenhum — tudo vira parágrafo. As duas formas são aceitas.

O que ela recusa, e por quê

Planilha e apresentação. Os três formatos são zips de OOXML, mas o corpo de cada um mora em outro lugar do pacote e tem outra gramática: uma planilha são células com referência e tipo, uma apresentação são slides com caixas posicionadas. Aceitar os três aqui devolveria um arquivo vazio sem dizer nada, que é a pior forma de falhar.

E os formatos antigos .doc, .xls e .ppt, que são binários proprietários e não zip. Salve como .docx no próprio Word e traga de volta.

Documento vazio não é erro

Um .docx pode voltar sem texto, e a página diz isso em vez de entregar um arquivo em branco. Acontece com documento montado em caixas de texto, com o que é imagem de ponta a ponta e com o digitalizado.

Esta ferramenta LÊ o corpo do arquivo — ela não faz reconhecimento de caracteres. Para um documento digitalizado o caminho é o OCR do módulo de PDF, que roda o Tesseract no seu navegador.

FAQ & Segurança

Perguntas sobre Word para texto

Qual a diferença entre Markdown e texto limpo?

O Markdown guarda a ESTRUTURA: título vira cabeçalho com sustenidos, lista vira lista, tabela vira tabela e negrito continua negrito. É o que serve para colar num editor, num README ou num campo de IA. O texto limpo são só as palavras — o que serve para contar, buscar ou colar onde formatação atrapalha.

A formatação do documento vem junto?

A estrutura vem; o layout não. Fonte, tamanho, cor, margem, onde a página quebra e o que o cabeçalho e o rodapé fazem não estão no corpo do documento — e nada disso tem representação em texto. É a mesma razão pela qual este produto não oferece Word para PDF: sem o motor de layout do Word, o resultado seria só aproximado.

Serve para .xlsx e .pptx?

Não. Os três são zips de OOXML, mas o corpo de cada um mora em outro lugar do pacote e tem outra gramática — uma planilha são células, uma apresentação são slides. Aceitar os três aqui devolveria vazio em silêncio, então a página recusa e diz por quê. Para planilha existe a conversão para CSV, ao lado.

Meu documento voltou vazio. Por quê?

Porque o conteúdo dele não está no corpo. Acontece com documento montado em caixas de texto, com o que é imagem de ponta a ponta, e com o digitalizado. Esta ferramenta LÊ o corpo do arquivo; ela não faz reconhecimento de caracteres. Para um documento digitalizado, o caminho é o OCR do módulo de PDF.

Ferramentas relacionadas

Tudo aqui embaixo roda nesta mesma aba, sem upload e sem cadastro.