Data Quality คืออะไร

Data Quality (คุณภาพข้อมูล)

คำตอบสั้น ๆ

Data Quality (คุณภาพข้อมูล) คือระดับที่ข้อมูลพร้อมใช้ตัดสินใจได้จริง วัดได้จากหกด้าน คือ ความถูกต้อง ความครบถ้วน ความสม่ำเสมอของรูปแบบ ความทันเวลา ความไม่ซ้ำซ้อน และความถูกต้องตามกฎเกณฑ์ทางธุรกิจ ข้อมูลที่ครบแต่ล้าสมัย หรือถูกต้องแต่กรอกคนละรูปแบบในแต่ละระบบ ล้วนถือว่ายังมีคุณภาพไม่พอสำหรับการรวมรายงาน

ทำไมData Qualityจึงสำคัญกับธุรกิจไทย

รายงานที่คนไม่เชื่อถือจะไม่ถูกใช้ และเมื่อไม่ถูกใช้ก็ไม่มีใครแจ้งว่าข้อมูลผิดตรงไหน กลายเป็นวงจรที่ข้อมูลแย่ลงเรื่อย ๆ การวัดคุณภาพข้อมูลเป็นตัวเลขและติดตามเป็นรอบ จึงเปลี่ยนเรื่องนี้จากความรู้สึกว่าข้อมูลไม่น่าเชื่อถือ ให้เป็นรายการที่แก้ได้ทีละข้อและเห็นความคืบหน้า

ข้อเท็จจริงที่ควรรู้

  • หกด้านที่ใช้วัดคือ ถูกต้อง ครบถ้วน สม่ำเสมอ ทันเวลา ไม่ซ้ำ และตรงตามกฎธุรกิจ
  • ข้อมูลที่ถูกต้องแต่มาช้าเกินไป มีค่าเท่ากับไม่มีสำหรับการตัดสินใจนั้น
  • การตรวจสอบอัตโนมัติตอนนำเข้าข้อมูล ป้องกันได้ดีกว่าการไล่แก้ย้อนหลัง
  • ต้นทุนของข้อมูลผิดจะเพิ่มขึ้นตามระยะทางที่มันไหลไปก่อนถูกจับได้

คำถามที่พบบ่อย

ควรเริ่มปรับปรุงคุณภาพข้อมูลจากตรงไหน

เริ่มจากข้อมูลที่ใช้ตัดสินใจเรื่องเงินเป็นอันดับแรก ได้แก่ ราคาขาย ต้นทุน และจำนวนคงเหลือ จากนั้นตั้งกฎตรวจสอบง่าย ๆ ที่จุดนำเข้า เช่น ห้ามให้ต้นทุนเป็นศูนย์ ห้ามรหัสสินค้าซ้ำ และบังคับรูปแบบวันที่ การป้องกันที่ต้นทางให้ผลมากกว่าการตั้งทีมไล่แก้ข้อมูลย้อนหลัง

ข้อมูลไม่ดีพอ แต่อยากเริ่มใช้ AI ได้ไหม

เริ่มได้ แต่ควรเลือกงานที่ทนต่อข้อมูลไม่สมบูรณ์ก่อน เช่น การสรุปข้อความหรือการจัดหมวดเอกสาร ซึ่งผลลัพธ์ตรวจสอบได้ด้วยตาคน ส่วนงานที่ AI ต้องคำนวณหรือพยากรณ์จากตัวเลขในระบบ จะให้ผลผิดตามข้อมูลที่ป้อนเข้าไป โครงการ AI ที่ล้มเหลวส่วนใหญ่ล้มเพราะข้อมูล ไม่ใช่เพราะโมเดล

บริการที่เกี่ยวข้อง

รับทำ Data Platform และ BI

คำที่เกี่ยวข้อง

AI Agent (เอเจนต์ AI)
โปรแกรม AI ที่ทำงานเป็นขั้นตอนแทนคนได้เองตามเป้าหมายที่ตั้งไว้ เช่น ตอบลูกค้า ค้นข้อมูล หรือสรุปงาน
LLM (โมเดลภาษาขนาดใหญ่)
AI ที่เรียนรู้จากข้อความจำนวนมหาศาลจนเข้าใจและสร้างภาษาคนได้ เป็นเทคโนโลยีเบื้องหลังแชตบอตอย่างสมัยใหม่
RAG (การดึงข้อมูลมาเสริมคำตอบ AI)
เทคนิคให้ AI ค้นข้อมูลจากเอกสารหรือฐานความรู้ของบริษัทก่อนตอบ ทำให้คำตอบตรงและอ้างอิงข้อมูลจริงได้
Prompt Engineering (การออกแบบคำสั่ง AI)
ศิลปะการเขียนคำสั่งให้ AI อย่างชัดเจนและมีบริบท เพื่อให้ได้คำตอบที่ตรงและมีคุณภาพมากขึ้น
Machine Learning (การเรียนรู้ของเครื่อง)
วิธีให้คอมพิวเตอร์เรียนรู้รูปแบบจากข้อมูลเพื่อทำนายหรือตัดสินใจ โดยไม่ต้องเขียนกฎทุกอย่างด้วยมือ
OCR (การอ่านตัวอักษรจากภาพ)
เทคโนโลยีแปลงข้อความในรูปภาพหรือเอกสารสแกนให้เป็นข้อความที่แก้ไขได้ เช่น อ่านใบเสร็จเข้าระบบอัตโนมัติ

อ่านต่อเรื่อง Data Quality

สูตรในไฟล์ผิดมาสามเดือนแล้วไม่มีใครรู้ — สี่แบบของข้อผิดพลาดที่มองไม่เห็น

ข้อผิดพลาดในสเปรดชีตที่อันตรายที่สุดไม่ใช่แบบที่ขึ้นข้อความแดง แต่คือแบบที่ให้ตัวเลขซึ่งดูสมเหตุสมผล บทความนี้อธิบายสี่รูปแบบที่เกิดซ้ำที่สุด และการควบคุมที่จับได้ก่อนตัวเลขไปถึงที่ประชุม

Data Catalog: ทำให้คนในองค์กรหาข้อมูลเจอและใช้ซ้ำได้

ข้อมูลมีอยู่ แต่ไม่มีใครรู้ว่าอยู่ไหน หมายความว่าอะไร และเชื่อถือได้แค่ไหน Data Catalog คือสารบัญข้อมูลขององค์กร ที่ทำให้คนหาข้อมูลที่ใช่เจอ และใช้ซ้ำแทนการสร้างใหม่ซ้ำ ๆ

Data Observability: เฝ้าดูสุขภาพของข้อมูล ก่อนรายงานจะผิด

ระบบพังเรามีการเฝ้าระวัง แต่ข้อมูลพังเงียบ ๆ มักไม่มีใครรู้จนตัดสินใจผิดไปแล้ว Data Observability คือการเฝ้าดูสุขภาพของข้อมูล เช่น ครบไหม มาตรงเวลาไหม ค่าผิดปกติหรือเปล่า

Dark Data: ข้อมูลที่เก็บไว้แต่ไม่เคยใช้ คือทั้งโอกาสและภาระ

องค์กรเก็บข้อมูลมหาศาลที่ไม่เคยถูกนำมาใช้ เรียกว่า Dark Data ซึ่งเป็นทั้งโอกาสที่ยังไม่ได้ใช้ และความเสี่ยงกับต้นทุนที่ซ่อนอยู่ เข้าใจว่าจะเปลี่ยนมันเป็นประโยชน์หรือจัดการมันอย่างไร