อะไรทำให้ PDF เข้าถึงได้ — และทำไมจึงสำคัญ
Spec: ISO 14289-1ISO 14289-1Spec: ISO 14289-2ISO 14289-2Spec: ISO 32000-2ISO 32000-2Spec: WCAG 2.2WCAG 2.2
ภาพรวมโดยสังเขป
หัวข้อที่มีชื่อว่า “ภาพรวมโดยสังเขป”PDF ที่เข้าถึงได้คือ PDF ที่คนซึ่งมองหน้ากระดาษไม่เห็นยังอ่านได้ ในลำดับที่คุณตั้งใจ โดยมีทุกภาพถูกบรรยายและทุกหัวข้อถูกประกาศว่าเป็นหัวข้อ หน้านี้อธิบายว่า PDF ถ่ายทอดความหมายนั้นอย่างไร — เนื้อหาที่มีแท็ก โครงสร้างต้นไม้ ลำดับการอ่าน ข้อความทางเลือก — และทำไมการทำให้ถูกต้องจึงคุ้มค่า
เหตุใดเรื่องนี้จึงสำคัญ
หัวข้อที่มีชื่อว่า “เหตุใดเรื่องนี้จึงสำคัญ”PDF โดยค่าเริ่มต้นคือชุดของรอยขีดที่พิกัด มันบอกว่า วางอักขระนี้ตรงนี้ และ ระบายภาพนี้ตรงนั้น มันไม่ได้บอกด้วยตัวเองว่า นี่คือหัวข้อ แถวนี้เป็นของคอลัมน์นั้น หรือ ภาพนี้แสดงสัญญาที่ลงนามแล้ว ผู้อ่านที่มองเห็นเติมช่องว่างเหล่านั้นได้ทันทีจากการจัดวาง โปรแกรมอ่านหน้าจอทำไม่ได้ มันมีเพียงสิ่งที่ไฟล์ระบุไว้จริงเท่านั้น
ดังนั้น PDF ที่ไม่มีแท็กจึงดูสมบูรณ์แบบได้แต่อ่านออกมาเป็นเรื่องไร้สาระ คือหน้าสองคอลัมน์ที่ถูกประกาศพาดขวางตรงๆ ตารางข้อมูลที่ถูกแบนราบเป็นกระแสตัวเลขที่ไม่เกี่ยวข้องกัน แผนภูมิที่เงียบสนิท ข้อมูลอยู่บนหน้านั้น เพียงแต่เข้าถึงไม่ได้ สำหรับคนนับล้านนั่นคือความแตกต่างระหว่างเอกสารที่พวกเขาใช้ได้กับเอกสารที่พวกเขาใช้ไม่ได้ — และยิ่งนานวันก็ยิ่งเป็นความแตกต่างระหว่างบริการสาธารณะที่สอดคล้องตามมาตรฐานกับความเสี่ยงทางกฎหมาย
ฉบับย่อ
หัวข้อที่มีชื่อว่า “ฉบับย่อ”- PDF ที่มีแท็ก ถ่ายทอดชั้นของความหมายคู่ขนานทับรอยขีดเชิงภาพ คือ ลำดับอักขระนี้คือหัวข้อ บล็อกนั้นคือรายการ ภูมิภาคนี้คือตาราง
- แท็กเหล่านั้นแขวนอยู่บน โครงสร้างต้นไม้ คือเค้าโครงเชิงตรรกะของเอกสารที่แยกจากตำแหน่งที่สิ่งต่างๆ วางอยู่บนหน้า (Spec: ISO 32000-2, §14.7ISO 32000-2 §14.7)
- ต้นไม้กำหนด ลำดับการอ่าน ตายตัว ดังนั้นเนื้อหาจึงถูกนำเสนอในลำดับที่คุณตั้งใจ ไม่ใช่ลำดับที่อักขระบังเอิญถูกระบายลง
- เนื้อหาที่ไม่ใช่ข้อความมี สิ่งเทียบเท่าทางข้อความ คือคำบรรยาย
/Altสำหรับภาพ และข้อความแทนที่สำหรับลำดับอักขระที่ผู้อ่านจะอ่านผิดเพี้ยน (Spec: ISO 32000-2, §14.8ISO 32000-2 §14.8) - PDF/UA (ISO 14289) คือมาตรฐานที่บอกว่าเมื่อใดสิ่งทั้งหมดนี้มีอยู่และถูกต้อง มันคือสิ่งที่ “PDF ที่เข้าถึงได้” หมายถึงในฐานะคำกล่าวอ้างเชิงวิศวกรรม ไม่ใช่เชิงการตลาด (Spec: ISO 14289-1ISO 14289-1)
แนวทางของ NextPDF ในเรื่องนี้
หัวข้อที่มีชื่อว่า “แนวทางของ NextPDF ในเรื่องนี้”สองชั้น หนึ่งไฟล์
หัวข้อที่มีชื่อว่า “สองชั้น หนึ่งไฟล์”ลองนึกถึง PDF ที่เข้าถึงได้ว่าเป็นสองชั้นที่เดินทางไปด้วยกัน ชั้นเนื้อหา คือสิ่งที่คุณเห็น คืออักขระ เส้น ภาพ ที่วางอยู่ตามพิกัด ส่วน ชั้นโครงสร้าง คือความหมายของมัน คือต้นไม้ของอิลิเมนต์ — เอกสาร หัวข้อ ย่อหน้า รายการ ตาราง รูปภาพ — ที่ตั้งชื่อเนื้อหาแต่ละชิ้นและจัดมันให้เป็นลำดับ
ทั้งสองถูกเย็บเข้าด้วยกันด้วย เนื้อหาที่ถูกกำกับ (marked content) แต่ละลำดับที่มีความหมายบนหน้าถูกห่อและกำหนดตัวระบุให้ ส่วนอิลิเมนต์โครงสร้างที่ตรงกันก็ชี้กลับไปยังตัวระบุนั้น ลิงก์นั้นคือสิ่งที่ทำให้เทคโนโลยีสิ่งอำนวยความสะดวกเดินไปตามต้นไม้เชิงตรรกะ และที่แต่ละโหนดก็พบไบต์ที่ตรงพอดีบนหน้าที่มันบรรยาย ทำลิงก์ให้ถูก แล้วหัวข้อก็ถูกประกาศว่าเป็นหัวข้อ ทำผิด แล้วโครงสร้างก็กลายเป็นเรื่องสมมติที่ไม่ตรงกับสิ่งที่แสดง
ลำดับการอ่านอยู่ในต้นไม้ ไม่ใช่ในการจัดวาง
หัวข้อที่มีชื่อว่า “ลำดับการอ่านอยู่ในต้นไม้ ไม่ใช่ในการจัดวาง”นี่คือแนวคิดที่ทำให้ผู้คนประหลาดใจ ลำดับที่โปรแกรมอ่านหน้าจอใช้คือลำดับของ โครงสร้างต้นไม้ และนั่นเป็นอิสระจากตำแหน่งที่เนื้อหาตกลงบนหน้า (Spec: ISO 32000-2, §14.7ISO 32000-2 §14.7) คุณระบายแถบข้างเป็นสิ่งสุดท้ายและเชิงอรรถเป็นสิ่งแรกได้ ตราบใดที่ต้นไม้ร้อยเรียงมันในลำดับที่ตั้งใจ เอกสารก็อ่านออกมาถูกต้อง ในทางกลับกัน หน้าที่จัดวางสวยงามแต่มีต้นไม้ที่สับสนก็อ่านออกมาผิดอย่างสวยงาม การจัดวางมีไว้สำหรับดวงตา ส่วนต้นไม้มีไว้สำหรับทุกคนที่เหลือ
สิ่งเทียบเท่าทางข้อความสำหรับทุกสิ่งที่ไม่ใช่ข้อความ
หัวข้อที่มีชื่อว่า “สิ่งเทียบเท่าทางข้อความสำหรับทุกสิ่งที่ไม่ใช่ข้อความ”ภาพถ่าย โลโก้ แผนภูมิ เส้นตกแต่ง — ไม่มีสิ่งใดเป็นถ้อยคำ ดังนั้นไม่มีสิ่งใดประกาศอะไรโดยค่าเริ่มต้น PDF ที่มีแท็กปิดช่องว่างนั้นด้วยคำบรรยายทางเลือก คือข้อความ /Alt ของภาพบรรยายสิ่งที่ภาพสื่อ และ /ActualText ให้ข้อความแทนที่ที่สะอาดสำหรับลำดับอักขระที่ไม่เช่นนั้นจะถูกอ่านผิด เช่น ลิเกเจอร์หรืออักษรขึ้นต้นขนาดใหญ่ที่ตกแต่ง (Spec: ISO 32000-2, §14.8ISO 32000-2 §14.8) รอยขีดที่ตกแต่งล้วนๆ ถูกกำกับเป็นอาร์ติแฟกต์ เพื่อให้ถูกข้ามไปแทนที่จะถูกอ่านเป็นเสียงรบกวน กฎเรียบง่าย คือหากมันถ่ายทอดความหมาย มันก็ได้สิ่งเทียบเท่าทางข้อความ หากไม่ มันก็ถูกกำกับให้พ้นทาง
โปรแกรมอ่านหน้าจอประมวลผลไฟล์จริงๆ อย่างไร
หัวข้อที่มีชื่อว่า “โปรแกรมอ่านหน้าจอประมวลผลไฟล์จริงๆ อย่างไร”เมื่อเทคโนโลยีสิ่งอำนวยความสะดวกเปิด PDF ที่มีแท็ก มันไม่ได้อ่านหน้า มันอ่าน ต้นไม้ และใช้ลิงก์ของเนื้อหาที่ถูกกำกับเพื่อนำข้อความของแต่ละอิลิเมนต์ขึ้นมาตามลำดับ
- OpenThe reader finds the structure tree root in the document catalog, the entry point to the logical document.
- Walk the treeIt traverses the logical hierarchy — document, headings, paragraphs, lists, tables — in structure order.
- Map the roleEach structure type maps to a familiar role, so a heading is announced as a heading and a list as a list.
- Read the contentFor each element it reads the linked page text, or the alternate description when the content is an image.
- Skip the noiseAnything tagged as a decorative artifact is passed over, never spoken.
เพราะลำดับคือลำดับของต้นไม้ รายงานสองคอลัมน์ที่มีแท็กถูกต้องจึงอ่านลงคอลัมน์หนึ่งแล้วจึงอีกคอลัมน์ ตารางอ่านทีละเซลล์พร้อมหัวตาราง และรูปภาพประกาศคำบรรยายของมันแทนที่จะเงียบไป ผู้อ่านไม่ต้องเดาเจตนาของผู้เขียนเลย เพราะเจตนานั้นถูกบันทึกไว้ในไฟล์
มาตรฐานที่ตรึงมันไว้: PDF/UA
หัวข้อที่มีชื่อว่า “มาตรฐานที่ตรึงมันไว้: PDF/UA”ทั้งหมดนี้กลายเป็นคำกล่าวอ้างที่ตรวจสอบได้ภายใต้ PDF/UA PDF/UA-1 ซึ่งเผยแพร่เป็น ISO 14289-1 ระบุข้อกำหนดระดับไฟล์สำหรับ PDF ที่เข้าถึงได้บนพื้นฐานของโมเดล PDF ที่มีแท็ก (Spec: ISO 14289-1, §7ISO 14289-1 §7) ส่วน PDF/UA-2 คือ ISO 14289-2 นำข้อกำหนดเหล่านั้นไปสู่พื้นฐาน PDF 2.0 และปรับให้ละเอียดขึ้นว่าเนื้อหาจริงจับคู่เข้ากับโมเดลโครงสร้างอย่างไร (Spec: ISO 14289-2, §8ISO 14289-2 §8) PDF/UA กำกับ โครงสร้าง ของไฟล์ ส่วนแนวทางการเข้าถึงเนื้อหาเว็บ (Web Content Accessibility Guidelines) ที่กว้างกว่าอธิบาย ผลลัพธ์ ที่เอกสารถูกวัดเทียบกับมัน และคำกล่าวอ้างความสอดคล้องระบุระดับที่ทำได้จริง (Spec: WCAG 2.2, §5WCAG 2.2 §5) ทั้งสองทำงานร่วมกัน คือ PDF/UA บอกว่ากลไกมีอยู่และถูกต้อง ส่วน WCAG วางกรอบว่าสิ่งที่ดีมีหน้าตาอย่างไรสำหรับมนุษย์
ตัวอย่างเชิงปฏิบัติ
หัวข้อที่มีชื่อว่า “ตัวอย่างเชิงปฏิบัติ”แท็กมองไม่เห็น ดังนั้นวิธีเดียวที่ซื่อตรงในการตรวจสอบมันคือการดูโครงสร้างที่เครื่องมือรายงาน หน้าที่เข้าถึงได้ขั้นต่ำมีต้นไม้จริง คือ รากของเอกสาร หัวข้อ ย่อหน้า และรูปภาพที่มีคำบรรยายแทนความเงียบ
StructTreeRoot └─ Document ├─ H1 "Quarterly Report" ├─ P "Revenue rose across every region this quarter." └─ Figure /Alt "Bar chart: revenue by region, all four up"ผู้อ่านที่เดินไปตามต้นไม้นี้ประกาศหัวข้อระดับหนึ่ง อ่านย่อหน้า แล้วอ่านคำบรรยายของรูปภาพ — ในลำดับนั้น โดยไม่คำนึงว่าแต่ละอิลิเมนต์ถูกระบายลงตรงไหน ลอกต้นไม้ออกไป แล้วหน้าเดียวกันก็กลายเป็นลำดับอักขระสามชุดที่ขาดการเชื่อมโยงและสี่เหลี่ยมเงียบหนึ่งรูป พิกเซลเหมือนกัน ประสบการณ์ไม่เหมือนกัน
ความเข้าใจผิดที่พบบ่อย
หัวข้อที่มีชื่อว่า “ความเข้าใจผิดที่พบบ่อย”ความเชื่อที่พบบ่อยคือ PDF “เข้าถึงได้เพราะข้อความเลือกได้” ข้อความที่เลือกได้หมายความว่าอักขระเป็นตัวอักษรจริง ไม่ใช่ภาพที่สแกนมา — จำเป็น แต่ห่างไกลจากเพียงพอ ข้อความที่เลือกได้แต่ไม่มีโครงสร้างต้นไม้ก็ยังไม่มีหัวข้อ ไม่มีลำดับการอ่าน ไม่มีความสัมพันธ์ของตาราง และไม่มีคำบรรยายภาพ การเข้าถึงเป็นเรื่องของ โครงสร้างและความหมาย ไม่ใช่เพียงการมีอยู่ของอักขระที่ดึงออกมาได้ ไฟล์ผ่านการคัดลอกและวางได้แต่สอบตกที่โปรแกรมอ่านหน้าจออย่างสิ้นเชิง
กับดักที่สองคือการถือเอา “มีแท็ก” เป็นเหรียญตราแบบใช่หรือไม่ ไฟล์มีแท็กได้แต่ยังผิดได้ คือแท็กที่ติดป้ายเนื้อหาผิด ต้นไม้ที่มีลำดับไม่ตรงกับเจตนา ภาพที่มีข้อความ /Alt ว่างเปล่าหรือไร้ประโยชน์ การมีแท็กคือจุดเริ่มต้นของการสนทนา ไม่ใช่จุดจบของมัน
ข้อจำกัดและขอบเขต
หัวข้อที่มีชื่อว่า “ข้อจำกัดและขอบเขต”หน้านี้อธิบายแนวคิดและมาตรฐานที่นิยามมัน มันไม่ใช่ใบรับรองความสอดคล้อง และไม่มีเครื่องมือใดให้ใบรับรองนั้นได้ด้วยตัวเอง
| Edition | Availability |
|---|---|
| Core | Core เขียน PDF ที่มีแท็ก คือมันปล่อยโครงสร้างต้นไม้ออกมา กำกับเนื้อหาที่ ตกแต่งเป็นอาร์ติแฟกต์ และถ่ายทอดข้อความทางเลือกที่คุณจัดหาให้ |
| Pro | เพิ่มการจับคู่โครงสร้างที่สมบูรณ์ขึ้นสำหรับการจัดวางที่ซับซ้อน — ตารางหลาย ระดับ รายการ และรูปภาพ — เพื่อให้ต้นไม้ตรงกับลำดับการอ่านที่ตั้งใจดียิ่งขึ้น |
| Enterprise | เพิ่มการตรวจสอบและรายงานความสอดคล้องเชิงโครงสร้าง มันยังคงเป็นการตรวจสอบ โครงสร้าง ไม่ใช่การรับรอง — การตัดสินขั้นสุดท้ายเป็นของผู้ตรวจสอบความถูกต้อง และผู้ตรวจทานที่เป็นมนุษย์ |
มีสองขอบเขตที่ควรระบุให้ชัด ประการแรก เอนจินสร้าง โครงสร้าง ที่ถูกต้องได้ แต่มันตัดสิน คุณภาพเชิงบรรณาธิการ ไม่ได้ คือมันจะถ่ายทอดคำบรรยาย /Alt ที่ว่า “ภาพ” อย่างซื่อสัตย์ และนั่นเป็นเรื่องของผู้เขียน ไม่ใช่ของเอนจิน การเข้าถึงเป็นความร่วมมือระหว่างเครื่องมือที่บันทึกความหมายกับมนุษย์ที่จัดหามันให้ ประการที่สอง การตรวจอัตโนมัติ — รวมถึงผู้ตรวจสอบความถูกต้องอย่าง veraPDF — ยืนยันว่ากลไกมีอยู่และมีรูปแบบที่ดี มันไม่ยืนยันว่าคนที่ใช้โปรแกรมอ่านหน้าจอจะเข้าใจผลลัพธ์ได้จริง การอนุมัติขั้นสุดท้ายเป็นของมนุษย์ ดูที่ การตรวจสอบความถูกต้อง PDF/A และ PDF/UA ว่าการตรวจอัตโนมัตินั้นเข้ามาอยู่ตรงไหน
เอกสารที่เกี่ยวข้อง
หัวข้อที่มีชื่อว่า “เอกสารที่เกี่ยวข้อง”- ภูมิทัศน์ของมาตรฐาน — ตำแหน่งของ PDF/UA และ WCAG ในสหพันธ์มาตรฐานที่กว้างขึ้นซึ่ง NextPDF ติดตาม
- ฟอนต์: ส่วนที่ยาก — ทำไมข้อความที่ดูถูกต้องจึงยังค้นหาไม่ได้ และเรื่องนั้นสัมผัสกับการเข้าถึงอย่างไร
- PDF จริงๆ แล้วคืออะไร — โมเดลออบเจกต์ที่โครงสร้างต้นไม้อาศัยอยู่ภายใน
- การตรวจสอบความถูกต้อง PDF/A และ PDF/UA — วิธีรันการตรวจสอบความสอดคล้องอัตโนมัติ และสิ่งที่มันบอกและบอกคุณไม่ได้
อภิธานศัพท์
หัวข้อที่มีชื่อว่า “อภิธานศัพท์”- PDF ที่มีแท็ก (Tagged PDF) — PDF ที่ถ่ายทอดชั้นของแท็กโครงสร้างคู่ขนานทับเนื้อหาเชิงภาพ เพื่อให้เทคโนโลยีสิ่งอำนวยความสะดวกเข้าถึงความหมายของเอกสาร ไม่ใช่เพียงรอยขีดของมัน
- โครงสร้างต้นไม้ (Structure tree) — เค้าโครงเชิงตรรกะของเอกสาร (ราก หัวข้อ ย่อหน้า รายการ ตาราง รูปภาพ) ที่ถูกบันทึกแยกจากการจัดวางหน้า และใช้เพื่อกำหนดลำดับการอ่าน
- ลำดับการอ่าน (Reading order) — ลำดับที่เนื้อหาถูกนำเสนอต่อผู้อ่าน นำมาจากโครงสร้างต้นไม้ แทนที่จะจากตำแหน่งที่อักขระถูกระบายลง
- ข้อความทางเลือก (Alternative text) — สิ่งเทียบเท่าทางข้อความสำหรับเนื้อหาที่ไม่ใช่ข้อความ คือคำบรรยาย
/Altสำหรับภาพ หรือข้อความแทนที่/ActualTextสำหรับลำดับอักขระที่ไม่เช่นนั้นจะถูกอ่านผิด - อาร์ติแฟกต์ (Artifact) — เนื้อหาที่ถูกกำกับว่าเป็นการตกแต่ง (เส้น พื้นหลัง ลายน้ำ) เพื่อให้ผู้อ่านข้ามมันแทนที่จะประกาศมัน
- PDF/UA — PDF/Universal Accessibility คือ ISO 14289 มาตรฐานที่นิยามว่าเมื่อใด PDF ที่มีแท็กเข้าถึงได้อย่างแท้จริง PDF/UA-1 คือ ISO 14289-1 ส่วน PDF/UA-2 คือ ISO 14289-2 บนพื้นฐาน PDF 2.0