Extraer el texto de un PDF
El texto del documento, sin su formato. Los párrafos se recomponen, los guiones de final de línea se reparan y una página a dos columnas se lee columna por columna, no renglón a renglón de lado a lado.
Gratis · 100 % local — no se envía nada- 1Abre tu PDF.
- 2Lanza la extracción.
- 3Descarga el archivo de texto.
Cómo extraer el texto de un PDF
Abre el documento, lanza la extracción y descarga el .txt. Antes de descargar nada verás el texto completo en pantalla, con su recuento de caracteres y de palabras — cómodo cuando una convocatoria limita la memoria a un número de caracteres, o cuando hay que presupuestar una traducción. Lo que separa una extracción decente de un copiar y pegar apresurado son tres detalles que Vélin resuelve: los párrafos se recomponen en vez de partirse en cada final de renglón, las palabras cortadas por un guion se vuelven a unir, y una página a dos columnas se recorre de arriba abajo por cada columna, sin mezclar las dos en cada línea. Las tablas salen con sus columnas separadas por tabuladores, listas para pegarse en una hoja de cálculo. El archivo obtenido es texto plano en UTF-8, con las tildes, las eñes y los signos de apertura en su sitio, y se abre en cualquier editor. El documento no sale de tu equipo en ningún momento.
Copiar el texto de un PDF, o solo un trozo
Cuando lo que quieres es un párrafo y no el documento entero — el artículo que vas a citar, el importe de una factura, la dirección que figura en un contrato —, no hace falta exportar nada: arrastra sobre el texto dentro del editor. La selección toma palabras, no rectángulos, y al copiar devuelve párrafos de verdad: las palabras partidas al final de renglón vuelven a unirse, las columnas salen ordenadas, una tabla pegada conserva sus columnas separadas por tabuladores y un párrafo repartido entre dos páginas se vuelve a coser. En el teléfono, deja el dedo apoyado sobre una palabra y la selección se abre. Es justo lo que falla al copiar desde un visor corriente: se obtiene un texto picado, un renglón por salto de línea, que hay que reformatear a mano antes de poder usarlo. Y como todo ocurre en tu navegador, da igual que el documento sea confidencial: no se sube nada, ni siquiera un fragmento.
Un escaneado no contiene texto
Si tu PDF es una imagen — un acta escaneada en una ventanilla, la foto de una página, un contrato que alguien fotocopió y volvió a digitalizar —, no hay nada que extraer: la extracción devolverá un archivo vacío o casi. La comprobación dura un segundo: intenta seleccionar una palabra con el ratón, y si no se resalta, ahí no hay texto sino píxeles. Pásalo antes por el reconocimiento de caracteres, que coloca una capa de texto debajo de la imagen sin mover su aspecto ni un punto; la extracción dará después lo que el reconocimiento haya leído, con sus aciertos y con sus dudas, que puedes corregir una por una. Si necesitas conservar el formato — los títulos, las negritas, la maquetación — y no solo las palabras, la conversión a Word encaja mejor, y para una tabla de cifras, la conversión a Excel. Un archivo protegido con contraseña tampoco entrega su texto mientras no lo abras con Desbloquear.
Preguntas frecuentes
¿Las columnas se leen en el orden correcto?
Sí. Una página a dos columnas se lee columna tras columna, no línea a línea de lado a lado — el error habitual de los extractores.
¿Y si mi PDF es un escaneado?
Un escaneado no contiene texto. El reconocimiento de caracteres se lo da; la extracción viene después.
¿Se recomponen las palabras cortadas al final de línea?
Sí, el guion de corte se repara, y un párrafo partido por un salto de página se vuelve a coser.
¿Las tablas salen bien?
En texto plano una tabla pierde su cuadrícula: las celdas salen separadas por tabuladores, y así se pegan en una hoja de cálculo. Para obtener celdas de verdad, pasa por Convertir un PDF a Excel.
¿Las notas al pie se mezclan con el texto?
Salen en su sitio dentro de la página, es decir, después del último párrafo de esa página. Es fiel al documento, aunque no siempre cómodo de releer.