PDFIntact

ดึงตารางและเนื้อหาออกจาก PDF ได้ตามเดิม

PDF สองคอลัมน์คัดลอกออกมาแล้วสองคอลัมน์ปนกัน

คุณเลือกเนื้อความของบทความที่จัดเป็นสองคอลัมน์ คัดลอก แล้ววางลงใน Word ผลคือหลังบรรทัดของคอลัมน์ซ้ายจะตามด้วยบรรทัดของคอลัมน์ขวาสลับกันไปเรื่อย ๆ ข้อความสองชุดถูกถักปนกันจนไม่รู้ว่าประโยคหนึ่งจบตรงไหน

สาเหตุคือ PDF ไม่ได้เก็บโครงสร้างของคอลัมน์ไว้เลย สิ่งที่อยู่ในไฟล์คือคำสั่งว่า «วาดรูปอักษรนี้ที่พิกัดนี้» เท่านั้น ไม่มีที่ใดบันทึกว่าคอลัมน์หนึ่งเริ่มตรงไหนและอีกคอลัมน์จบตรงไหน การคัดลอกและการดึงข้อความไล่จากบนลงล่างทีละบรรทัดตามตำแหน่งที่วาด คอลัมน์ซ้ายขวาที่อยู่ระดับเดียวกันจึงถูกหยิบสลับกันทีละบรรทัด

ดังนั้นต้องอ่านคอลัมน์กลับจากการจัดหน้า PDFIntact จะหาบล็อกในหน้า — เนื้อความ หัวเรื่อง ตาราง ภาพ — แล้วเรียงกลับตามลำดับการอ่านก่อนเขียนออกเป็น Word, Markdown และ JSON การจัดคอลัมน์เองไม่ถูกทำซ้ำ สิ่งที่ได้คือเอกสารคอลัมน์เดียวที่เรียงตามลำดับการอ่าน

ลองเลย

ตรวจด้วยไฟล์ PDF ของคุณเอง

การตรวจทำงานภายในเบราว์เซอร์ของคุณทั้งหมด ไฟล์ไม่ถูกส่งไปที่ใด และไม่ต้องสมัครบัญชี คุณจะเห็นว่าดึงออกมาได้กี่หน้า มีตารางและรูปกี่รายการ ก่อนจะจ่ายเงิน

ตัวอย่างจริง

行の拾われ方が変わります

左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。

コピーしたとき(描かれた位置の順)

左の段 1行目
右の段 1行目
左の段 2行目
右の段 2行目
左の段 3行目
右の段 3行目

PDFIntact を通したとき(読み順)

左の段 1行目
左の段 2行目
左の段 3行目
右の段 1行目
右の段 2行目
右の段 3行目

形式ごとに、どう入るか

同じ読み順でも、書き出す形式によって入り方が違います。

Word(.docx)

読み順のまま、1段の段落として並びます。段組は再現しません。

Markdown(.md)

同じ範囲を、ページごとの見出しの下に読み順で置きます。

JSON

ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。

Excel(.xlsx)

本文は入りません。Excelに書き出すのは表とグラフだけです。

脚注・キャプション・ページ番号

これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。

คำถามที่พบบ่อย

ทำไมคัดลอก PDF สองคอลัมน์แล้วสองคอลัมน์จึงสลับกัน
เพราะ PDF ไม่ได้เก็บคอลัมน์ในฐานะคอลัมน์ ในไฟล์มีเพียง «วาดรูปอักษรนี้ที่พิกัดนี้» และไม่มีสิ่งใดระบุว่าคอลัมน์หนึ่งเริ่มตรงไหนและอีกคอลัมน์จบตรงไหน การคัดลอกจะไล่จากบนลงล่างทีละบรรทัด คอลัมน์สองข้างที่อยู่ระดับเดียวกันจึงถูกหยิบสลับกันทีละบรรทัด
ลำดับการอ่านถูกกู้คืนอย่างไร
ระบบจะหาบล็อกในหน้า — เนื้อความ หัวเรื่อง ตาราง ภาพ — ก่อน แล้วจึงเรียงกลับตามลำดับการอ่านก่อนที่จะเขียนอะไรออกมา การจัดสองคอลัมน์เองไม่ถูกทำซ้ำ Word และ Markdown จะได้เอกสารคอลัมน์เดียวที่เรียงตามลำดับการอ่าน
เชิงอรรถและคำบรรยายภาพจะเป็นอย่างไร
ทั้งสองอย่างออกมาเป็นบล็อกของตัวเองในรูปย่อหน้า ณ ตำแหน่งของมันในลำดับการอ่าน ในการทดสอบของเรา คำบรรยายภาพยังแยกจากเนื้อความ ทุกอย่างที่อยู่ใต้เส้นคั่นเชิงอรรถกลายเป็นบล็อกต่างหาก และเลขหน้าไม่ปนเข้ากับเนื้อความ ทั้งสองอย่างไม่ได้กลายเป็นเชิงอรรถของ Word แต่เข้าไปเป็นย่อหน้า
ข้อความส่งออกเป็นรูปแบบใดได้บ้าง
Word, Markdown และ JSON โดย JSON ยังมีชนิดของบล็อก เลขหน้า และตำแหน่งในหน้าด้วย จึงย้อนดูได้ว่าข้อความช่วงหนึ่งมาจากคอลัมน์ไหนตำแหน่งใด เนื้อความไม่เข้าไปใน Excel เพราะไฟล์ Excel ที่ส่งออกมีเฉพาะตารางกับกราฟ
ถ้าลำดับการอ่านถูก แสดงว่าตัวอักษรก็ถูกด้วยหรือไม่
เป็นคนละเรื่องกัน ลำดับการอ่านอาจคงอยู่ในขณะที่การอ่านตัวอักษรพัง และเราพบตัวอย่างที่เป็นเช่นนั้นจริง ด้วยเหตุนี้ทุกบล็อกจึงมีแถบความเชื่อมั่น — อ่านได้ ประมาณ หรืออ่านไม่ได้ กรุณาตรวจผลลัพธ์กับ PDF ต้นฉบับเสมอ

ตรวจไฟล์ PDF ครอบคลุมทุกอาการแต่ละรูปแบบมีอะไรบ้าง