PDFIntact

Lấy bảng và văn bản ra khỏi PDF, nguyên vẹn

PDF hai cột chép ra bị trộn lẫn hai cột

Bạn bôi đen phần thân bài của một bài báo dàn hai cột, sao chép, dán vào Word — và một dòng của cột trái lại nối tiếp một dòng của cột phải, cứ thế lặp lại. Hai mạch văn khác nhau bị bện vào nhau, đến mức không còn biết câu kết thúc ở đâu.

Nguyên nhân là PDF không hề lưu cấu trúc cột. Trong tệp chỉ có những chỉ thị: «vẽ hình chữ này tại toạ độ này». Không chỗ nào ghi cột này bắt đầu từ đâu và cột kia kết thúc ở đâu. Việc sao chép và trích xuất văn bản đi từ trên xuống dưới, từng dòng một, theo vị trí đã vẽ, nên hai cột nằm cùng độ cao bị nhặt xen kẽ, mỗi lần một dòng.

Vì vậy phải đọc lại các cột từ bố cục trang. PDFIntact tìm các khối trên trang — thân bài, tiêu đề, bảng, hình — rồi xếp lại theo đúng thứ tự đọc trước khi ghi ra Word, Markdown và JSON. Bản thân cách dàn cột không được tái tạo: cái bạn nhận được là một tài liệu một cột theo đúng thứ tự đọc.

Thử ngay

Kiểm tra bằng chính tệp PDF của bạn

Việc kiểm tra chạy hoàn toàn trong trình duyệt của bạn. Tệp không hề được gửi đi đâu và cũng không cần tài khoản. Trước khi trả tiền, bạn đã thấy được bao nhiêu trang, bảng và hình có thể bóc tách.

Ví dụ

行の拾われ方が変わります

左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。

コピーしたとき(描かれた位置の順)

左の段 1行目
右の段 1行目
左の段 2行目
右の段 2行目
左の段 3行目
右の段 3行目

PDFIntact を通したとき(読み順)

左の段 1行目
左の段 2行目
左の段 3行目
右の段 1行目
右の段 2行目
右の段 3行目

形式ごとに、どう入るか

同じ読み順でも、書き出す形式によって入り方が違います。

Word(.docx)

読み順のまま、1段の段落として並びます。段組は再現しません。

Markdown(.md)

同じ範囲を、ページごとの見出しの下に読み順で置きます。

JSON

ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。

Excel(.xlsx)

本文は入りません。Excelに書き出すのは表とグラフだけです。

脚注・キャプション・ページ番号

これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。

Câu hỏi thường gặp

Vì sao sao chép PDF hai cột thì hai cột lại đan vào nhau?
Vì PDF không lưu cột như một cột. Trong tệp chỉ có «vẽ hình chữ này tại toạ độ này», không có gì đánh dấu cột này bắt đầu ở đâu và cột kia kết thúc ở đâu. Việc sao chép quét trang từ trên xuống dưới, từng dòng một, nên hai cột nằm cùng độ cao bị nhặt xen kẽ, mỗi lần một dòng.
Thứ tự đọc được khôi phục thế nào?
Các khối trên trang — thân bài, tiêu đề, bảng, hình — được tìm ra trước, rồi mới xếp lại theo thứ tự đọc trước khi ghi bất cứ thứ gì. Bản thân cách dàn hai cột không được tái tạo: Word và Markdown nhận được một tài liệu một cột theo thứ tự đọc.
Chú thích chân trang và chú thích hình thì sao?
Chúng ra thành các khối riêng, dưới dạng đoạn văn, đúng vị trí của chúng trong thứ tự đọc. Trong các lần kiểm tra, chú thích hình vẫn tách khỏi thân bài, mọi thứ nằm dưới đường kẻ chú thích thành một khối riêng, và số trang không bị trộn vào thân bài. Chúng không trở thành chú thích chân trang của Word mà vào dưới dạng đoạn văn.
Văn bản xuất được ra những định dạng nào?
Word, Markdown và JSON. JSON còn mang theo loại khối, số trang và vị trí trong trang, nên bạn truy được một đoạn đến từ cột nào, chỗ nào. Phần thân bài không vào Excel: bản xuất Excel chỉ chứa bảng và biểu đồ.
Thứ tự đọc đúng thì chữ có đúng không?
Đó là hai chuyện khác nhau. Thứ tự đọc có thể vẫn đúng trong khi việc đọc chữ lại hỏng, và chúng tôi đã gặp đúng như vậy ở một mẫu. Vì thế mỗi khối đều mang dải độ tin cậy — đọc được, ước lượng, hoặc không đọc được. Hãy đối chiếu kết quả với PDF gốc.

Kiểm tra một tệp PDF với tất cả triệu chứngMỗi định dạng chứa những gì