Ubah PDF ke teks polos
Isi teks dokumen, tanpa tata letaknya. Paragraf disambung kembali, kata yang terpenggal di ujung baris diperbaiki, dan kolom dibaca dalam urutan yang memang dibaca orang.
Gratis · 100% di perangkat Anda — tidak ada yang dikirim- 1Buka PDF Anda.
- 2Jalankan ekstraksi.
- 3Unduh file teksnya.
Cara mengekstrak teks dari sebuah PDF
Buka dokumennya, jalankan ekstraksi, lalu unduh file .txt-nya; sebelum itu seluruh teksnya bisa dibaca dulu di jendela pratinjau, lengkap dengan jumlah huruf dan jumlah katanya. Yang membedakan ekstraksi yang rapi dari salin-tempel biasa terletak pada tiga hal: paragraf disambung kembali, bukan dipotong di setiap ujung baris; kata yang terpenggal tanda hubung di ujung baris disatukan lagi; dan halaman dua kolom dibaca kolom demi kolom, bukan melintang dari tepi kiri ke tepi kanan. Tabel keluar dengan kolomnya dipisahkan tab, sehingga langsung bisa ditempel ke spreadsheet. Inilah gerakan yang dilakukan sebelum sebuah naskah diolah ulang, sebelum jumlah kata skripsi dihitung, atau sebelum isi sebuah peraturan disalin ke catatan kerja. Dokumennya tidak pergi ke mana pun: ekstraksi berjalan di browser Anda, tanpa akun, tanpa unggahan, tanpa tanda air, dan tanpa batas ukuran yang dipaksakan sebuah server, jadi laporan tahunan tiga ratus halaman diperlakukan sama saja dengan surat satu lembar. Hasilnya teks polos UTF-8 yang terbuka di editor mana pun, juga di ponsel, dan tetap bisa dikerjakan meski sedang offline.
Menyalin sebagian teksnya saja
Kalau yang diperlukan hanya satu paragraf, bukan seluruh dokumen, seret saja kursor di atas tulisannya langsung di editor dengan alat Pilih: seleksinya mengambil kata, bukan kotak, dan hasil salinannya berupa paragraf utuh. Kata yang terpenggal di ujung baris disambung, kolom dibaca berurutan, tabel yang ditempel tetap memisahkan kolomnya dengan tab, dan paragraf yang terbelah oleh pergantian halaman dijahit kembali menjadi satu. Di ponsel, tekan lama untuk membuka seleksi, lalu geser pegangannya sampai kalimat terakhir ikut terambil. Inilah yang paling sering hilang ketika orang menyalin dari aplikasi pembaca PDF bawaan: yang sampai di dokumen tujuan adalah teks tercacah, satu baris satu enter, yang harus dirapikan manual baris demi baris. Kalau tujuannya justru mengganti sebuah kata di dalam dokumennya sendiri dan bukan di luar, alat Cari dan ganti yang mengerjakannya, dan tulisannya tetap berada pada barisnya semula. Salinan yang Anda ambil hanya berpindah ke papan klip perangkat Anda, tidak ke mana-mana lagi.
Hasil pindai tidak memuat teks sama sekali
Kalau PDF Anda sebenarnya gambar — surat keterangan hasil pindai, foto halaman buku yang diambil dengan ponsel, faktur yang difotokopi lalu dipindai ulang — tidak ada apa pun yang bisa diekstrak: hasilnya akan kosong atau nyaris kosong. Kasus ini sangat sering ditemui, karena banyak dokumen resmi beredar hanya sebagai hasil pindai. Jalankan dulu alat Kenali teks (OCR), yang menempatkan lapisan teks di bawah gambarnya; sesudah itu ekstraksi akan memberikan apa yang berhasil dibaca oleh pengenalan karakter. Perlu diingat bahwa mutu hasilnya bergantung pada ketajaman pindaian: halaman yang miring, berbayang, atau dipindai pada resolusi rendah menghasilkan bacaan yang masih perlu dikoreksi. Kalau yang ingin dipertahankan adalah tata letaknya dan bukan sekadar tulisannya, alat PDF → Word lebih tepat; dan kalau isinya tabel angka, alat PDF → Excel yang memberi sel sungguhan, bukan kolom yang sekadar dipisahkan tab. Dokumen pindaian yang sudah terlanjur rusak sebaiknya melewati alat Perbaiki PDF lebih dulu, karena pengenalan karakter membutuhkan halaman yang benar-benar bisa dibuka.
Pertanyaan umum
Apakah kolom dibaca dalam urutan yang benar?
Ya. Halaman dua kolom dibaca kolom demi kolom, bukan baris demi baris melintang halaman — itulah kekeliruan yang biasa dilakukan alat ekstraksi.
Bagaimana kalau PDF saya hasil scan?
Hasil scan tidak memuat teks. Pengenalan karakter (OCR) yang memberinya teks; ekstraksi menyusul setelah itu.
Apakah kata yang terpenggal di ujung baris disambung kembali?
Ya, penggalannya diperbaiki, dan paragraf yang terputus oleh pergantian halaman dijahit kembali jadi satu.
Apakah tabel keluar dengan benar?
Dalam teks polos, tabel kehilangan kisi-kisinya: selnya keluar dipisahkan tab, dan itu bisa ditempel kembali ke spreadsheet. Untuk sel yang sebenarnya, lewat alat Ubah PDF ke Excel.
Apakah catatan kaki tercampur ke dalam teks?
Catatan kaki keluar di tempatnya pada halaman, yaitu setelah paragraf terakhir halaman itu. Setia pada dokumen, meski tidak selalu enak dibaca ulang.