O que está no corpo, e o que nunca esteve
Um .docx guarda o texto em word/document.xml, e a estrutura que interessa está toda lá: parágrafo, estilo de título, item de lista, tabela, negrito e itálico. Essa metade sai daqui inteira.
A outra metade — o layout — não está no corpo. Onde a página quebra, como a coluna flui, o que o cabeçalho e o rodapé fazem, qual fonte o leitor vai substituir: nada disso é conteúdo, é o Word calculando na hora de exibir. É exatamente por isso que este produto não oferece Word para PDF, e é a mesma fronteira que separa uma extração honesta de uma conversão aproximada.
Como extrair
A prévia aparece na própria página antes de qualquer download, porque quem extrai texto quer conferir se veio tudo — e porque na maioria das vezes o destino é a área de transferência, não um arquivo.
- Solte o .docx.
- Escolha Markdown, se o destino guarda estrutura, ou texto limpo, se não guarda.
- Extraia. A contagem de palavras, títulos e tabelas aparece ao lado.
- Copie tudo, ou baixe como .md ou .txt.
Markdown ou texto limpo
Markdown é o formato certo quando o destino entende estrutura: um editor, um README, um campo de instrução de IA, um gerador de site. Título vira cabeçalho, lista vira lista, tabela vira tabela com a linha de separação que os leitores exigem, e negrito e itálico sobrevivem.
Texto limpo é o certo quando estrutura atrapalha: contar palavras, buscar um trecho, alimentar um campo que não aceita marcação. Ali os sustenidos e os asteriscos seriam ruído.
A diferença não é cosmética, e por isso a escolha vem antes de extrair e refaz a leitura quando muda.
As duas coisas que a leitura resolve e quase ninguém nota
A primeira é a lista NUMERADA. O parágrafo não diz se a lista tem números ou marcadores — ele traz um identificador, e o formato mora em outro arquivo do pacote, atrás de mais um salto. Sem seguir esses dois saltos, toda lista viraria marcador e uma sequência de passos perderia a ordem que é a razão de ela existir.
A segunda é o título em português. O Word grava o identificador do estilo sem acento em algumas versões, e uma leitura que só reconhece a forma em inglês devolve um documento inteiro sem título nenhum — tudo vira parágrafo. As duas formas são aceitas.
O que ela recusa, e por quê
Planilha e apresentação. Os três formatos são zips de OOXML, mas o corpo de cada um mora em outro lugar do pacote e tem outra gramática: uma planilha são células com referência e tipo, uma apresentação são slides com caixas posicionadas. Aceitar os três aqui devolveria um arquivo vazio sem dizer nada, que é a pior forma de falhar.
E os formatos antigos .doc, .xls e .ppt, que são binários proprietários e não zip. Salve como .docx no próprio Word e traga de volta.
Documento vazio não é erro
Um .docx pode voltar sem texto, e a página diz isso em vez de entregar um arquivo em branco. Acontece com documento montado em caixas de texto, com o que é imagem de ponta a ponta e com o digitalizado.
Esta ferramenta LÊ o corpo do arquivo — ela não faz reconhecimento de caracteres. Para um documento digitalizado o caminho é o OCR do módulo de PDF, que roda o Tesseract no seu navegador.