Data Quality คืออะไร
Data Quality (คุณภาพข้อมูล)
คำตอบสั้น ๆ
Data Quality (คุณภาพข้อมูล) คือระดับที่ข้อมูลพร้อมใช้ตัดสินใจได้จริง วัดได้จากหกด้าน คือ ความถูกต้อง ความครบถ้วน ความสม่ำเสมอของรูปแบบ ความทันเวลา ความไม่ซ้ำซ้อน และความถูกต้องตามกฎเกณฑ์ทางธุรกิจ ข้อมูลที่ครบแต่ล้าสมัย หรือถูกต้องแต่กรอกคนละรูปแบบในแต่ละระบบ ล้วนถือว่ายังมีคุณภาพไม่พอสำหรับการรวมรายงาน
ทำไมData Qualityจึงสำคัญกับธุรกิจไทย
รายงานที่คนไม่เชื่อถือจะไม่ถูกใช้ และเมื่อไม่ถูกใช้ก็ไม่มีใครแจ้งว่าข้อมูลผิดตรงไหน กลายเป็นวงจรที่ข้อมูลแย่ลงเรื่อย ๆ การวัดคุณภาพข้อมูลเป็นตัวเลขและติดตามเป็นรอบ จึงเปลี่ยนเรื่องนี้จากความรู้สึกว่าข้อมูลไม่น่าเชื่อถือ ให้เป็นรายการที่แก้ได้ทีละข้อและเห็นความคืบหน้า
ข้อเท็จจริงที่ควรรู้
- หกด้านที่ใช้วัดคือ ถูกต้อง ครบถ้วน สม่ำเสมอ ทันเวลา ไม่ซ้ำ และตรงตามกฎธุรกิจ
- ข้อมูลที่ถูกต้องแต่มาช้าเกินไป มีค่าเท่ากับไม่มีสำหรับการตัดสินใจนั้น
- การตรวจสอบอัตโนมัติตอนนำเข้าข้อมูล ป้องกันได้ดีกว่าการไล่แก้ย้อนหลัง
- ต้นทุนของข้อมูลผิดจะเพิ่มขึ้นตามระยะทางที่มันไหลไปก่อนถูกจับได้
คำถามที่พบบ่อย
ควรเริ่มปรับปรุงคุณภาพข้อมูลจากตรงไหน
เริ่มจากข้อมูลที่ใช้ตัดสินใจเรื่องเงินเป็นอันดับแรก ได้แก่ ราคาขาย ต้นทุน และจำนวนคงเหลือ จากนั้นตั้งกฎตรวจสอบง่าย ๆ ที่จุดนำเข้า เช่น ห้ามให้ต้นทุนเป็นศูนย์ ห้ามรหัสสินค้าซ้ำ และบังคับรูปแบบวันที่ การป้องกันที่ต้นทางให้ผลมากกว่าการตั้งทีมไล่แก้ข้อมูลย้อนหลัง
ข้อมูลไม่ดีพอ แต่อยากเริ่มใช้ AI ได้ไหม
เริ่มได้ แต่ควรเลือกงานที่ทนต่อข้อมูลไม่สมบูรณ์ก่อน เช่น การสรุปข้อความหรือการจัดหมวดเอกสาร ซึ่งผลลัพธ์ตรวจสอบได้ด้วยตาคน ส่วนงานที่ AI ต้องคำนวณหรือพยากรณ์จากตัวเลขในระบบ จะให้ผลผิดตามข้อมูลที่ป้อนเข้าไป โครงการ AI ที่ล้มเหลวส่วนใหญ่ล้มเพราะข้อมูล ไม่ใช่เพราะโมเดล
บริการที่เกี่ยวข้อง
รับทำ Data Platform และ BI
คำที่เกี่ยวข้อง
- AI Agent (เอเจนต์ AI)
- โปรแกรม AI ที่ทำงานเป็นขั้นตอนแทนคนได้เองตามเป้าหมายที่ตั้งไว้ เช่น ตอบลูกค้า ค้นข้อมูล หรือสรุปงาน
- LLM (โมเดลภาษาขนาดใหญ่)
- AI ที่เรียนรู้จากข้อความจำนวนมหาศาลจนเข้าใจและสร้างภาษาคนได้ เป็นเทคโนโลยีเบื้องหลังแชตบอตอย่างสมัยใหม่
- RAG (การดึงข้อมูลมาเสริมคำตอบ AI)
- เทคนิคให้ AI ค้นข้อมูลจากเอกสารหรือฐานความรู้ของบริษัทก่อนตอบ ทำให้คำตอบตรงและอ้างอิงข้อมูลจริงได้
- Prompt Engineering (การออกแบบคำสั่ง AI)
- ศิลปะการเขียนคำสั่งให้ AI อย่างชัดเจนและมีบริบท เพื่อให้ได้คำตอบที่ตรงและมีคุณภาพมากขึ้น
- Machine Learning (การเรียนรู้ของเครื่อง)
- วิธีให้คอมพิวเตอร์เรียนรู้รูปแบบจากข้อมูลเพื่อทำนายหรือตัดสินใจ โดยไม่ต้องเขียนกฎทุกอย่างด้วยมือ
- OCR (การอ่านตัวอักษรจากภาพ)
- เทคโนโลยีแปลงข้อความในรูปภาพหรือเอกสารสแกนให้เป็นข้อความที่แก้ไขได้ เช่น อ่านใบเสร็จเข้าระบบอัตโนมัติ
อ่านต่อเรื่อง Data Quality

สูตรในไฟล์ผิดมาสามเดือนแล้วไม่มีใครรู้ — สี่แบบของข้อผิดพลาดที่มองไม่เห็น
ข้อผิดพลาดในสเปรดชีตที่อันตรายที่สุดไม่ใช่แบบที่ขึ้นข้อความแดง แต่คือแบบที่ให้ตัวเลขซึ่งดูสมเหตุสมผล บทความนี้อธิบายสี่รูปแบบที่เกิดซ้ำที่สุด และการควบคุมที่จับได้ก่อนตัวเลขไปถึงที่ประชุม

Data Catalog: ทำให้คนในองค์กรหาข้อมูลเจอและใช้ซ้ำได้
ข้อมูลมีอยู่ แต่ไม่มีใครรู้ว่าอยู่ไหน หมายความว่าอะไร และเชื่อถือได้แค่ไหน Data Catalog คือสารบัญข้อมูลขององค์กร ที่ทำให้คนหาข้อมูลที่ใช่เจอ และใช้ซ้ำแทนการสร้างใหม่ซ้ำ ๆ

Data Observability: เฝ้าดูสุขภาพของข้อมูล ก่อนรายงานจะผิด
ระบบพังเรามีการเฝ้าระวัง แต่ข้อมูลพังเงียบ ๆ มักไม่มีใครรู้จนตัดสินใจผิดไปแล้ว Data Observability คือการเฝ้าดูสุขภาพของข้อมูล เช่น ครบไหม มาตรงเวลาไหม ค่าผิดปกติหรือเปล่า

Dark Data: ข้อมูลที่เก็บไว้แต่ไม่เคยใช้ คือทั้งโอกาสและภาระ
องค์กรเก็บข้อมูลมหาศาลที่ไม่เคยถูกนำมาใช้ เรียกว่า Dark Data ซึ่งเป็นทั้งโอกาสที่ยังไม่ได้ใช้ และความเสี่ยงกับต้นทุนที่ซ่อนอยู่ เข้าใจว่าจะเปลี่ยนมันเป็นประโยชน์หรือจัดการมันอย่างไร
