Medallion Architecture: จัดชั้นข้อมูลจากดิบ สู่สะอาด สู่พร้อมใช้

20 พฤษภาคม 2569อ่าน 6 นาที
Medallion Architecture: จัดชั้นข้อมูลจากดิบ สู่สะอาด สู่พร้อมใช้

ถ้าแก้ข้อมูลดิบให้สะอาดทับลงไปเลย วันที่พบว่าสูตรแปลงผิด ก็ย้อนกลับไม่ได้แล้ว Medallion Architecture เก็บข้อมูลเป็นสามชั้น ดิบ สะอาด และพร้อมใช้ ให้ตรวจย้อนและแก้ใหม่ได้เสมอ

ข้อมูลที่ไหลเข้าองค์กรมาจากหลายระบบและมักสกปรก มีทั้งค่าที่หาย รูปแบบไม่ตรงกัน และรายการซ้ำ ก่อนใช้งานจึงต้องผ่านการทำความสะอาดและแปลงหลายขั้น คำถามคือควรเก็บผลลัพธ์ระหว่างทางอย่างไร Medallion Architecture เสนอให้จัดเป็นสามชั้น ชั้น Bronze เก็บข้อมูลดิบตามที่รับมาโดยไม่แก้ไข ชั้น Silver คือข้อมูลที่ทำความสะอาดและจัดรูปแบบแล้ว และชั้น Gold คือข้อมูลที่สรุปพร้อมใช้ตอบโจทย์ธุรกิจ เช่น ยอดขายรายเดือนต่อสาขา

ทำไมต้องเก็บของดิบไว้เสมอ

ชั้นที่คนมักมองข้ามคือ Bronze เพราะรู้สึกว่าเก็บของสกปรกไว้ทำไม แต่มันคือหลักฐานต้นทาง วันที่ตัวเลขในรายงานดูแปลก การมีของดิบทำให้ไล่ย้อนได้ว่าปัญหาอยู่ที่ต้นทางหรือขั้นแปลง และวันที่พบว่าสูตรแปลงผิดมาตลอด ก็แค่แก้สูตรแล้วประมวลผลใหม่จากของดิบทั้งหมดได้ ถ้าไม่มีชั้นนี้ ข้อมูลที่ถูกแปลงผิดคือความจริงเดียวที่เหลืออยู่ การแบ่งชั้นยังทำให้แต่ละขั้นมีหน้าที่ชัด ตรวจสอบง่าย และให้สิทธิ์เข้าถึงต่างกันได้ เช่น ให้ผู้ใช้ทั่วไปเห็นเฉพาะชั้น Gold

  • Bronze เก็บของดิบไม่แก้ไข เป็นหลักฐานให้ย้อนตรวจและแปลงใหม่ได้
  • Silver ทำความสะอาดและจัดมาตรฐาน ให้ทุกงานต่อยอดจากฐานเดียวกัน
  • Gold สรุปพร้อมใช้ตามโจทย์ธุรกิจ และเป็นชั้นที่เปิดให้คนทั่วไปใช้

Medallion Architecture เป็นวิธีจัดระเบียบง่าย ๆ ที่ตอบคำถามใหญ่ของงานข้อมูล คือจะเชื่อตัวเลขนี้ได้อย่างไร เพราะทุกตัวเลขในชั้น Gold ไล่ย้อนกลับไปถึงต้นทางได้เสมอ สำหรับธุรกิจที่กำลังวางระบบข้อมูล การถามทีมว่าเราเก็บข้อมูลดิบไว้ไหม และไล่จากรายงานกลับไปถึงต้นทางได้หรือเปล่า เป็นการตรวจสุขภาพพื้นฐานที่บอกได้มากว่าระบบที่มีอยู่น่าเชื่อถือแค่ไหน

Medallion ArchitectureData LakeData PipelineData Quality

บริการที่เกี่ยวข้อง

บริการ Data Dashboard & Analytics

ออกแบบแดชบอร์ดและวิเคราะห์ข้อมูล ให้เห็นภาพธุรกิจและตัดสินใจได้ด้วยตัวเลข

WhaleScope

ดูโครงสร้างตลาดของทุกหมวดธุรกิจไทย บน WhaleScope

รายชื่อบริษัท ผู้เล่นรายใหญ่ และอัตราคงอยู่ของแต่ละหมวด — จากข้อมูลจดทะเบียน 2 ล้านนิติบุคคล

อ่านต่อ

Data Pipeline: เส้นทางข้อมูลจากต้นทางถึงรายงาน

ตัวเลขในรายงานไม่ได้เกิดเอง แต่เดินทางผ่านหลายขั้น ตั้งแต่เก็บ ทำความสะอาด แปลง จนถึงแสดงผล Data Pipeline คือเส้นทางนั้น ถ้าจุดใดพัง รายงานก็ผิดโดยไม่มีใครรู้

Lakehouse: จุดบรรจบของ Data Lake ที่เก็บได้ทุกอย่าง กับ Warehouse ที่ตอบได้เร็ว

องค์กรจำนวนมากจ่ายสองเด้ง เก็บข้อมูลดิบใน Data Lake แล้วคัดลอกไปตอบคำถามใน Warehouse พร้อมปัญหาข้อมูลสองที่ไม่ตรงกัน Lakehouse คือสถาปัตยกรรมที่พยายามให้ที่เก็บเดียวทำได้ทั้งสองหน้าที่

Data Warehouse คืออะไร ต่างจากฐานข้อมูลทั่วไปยังไง

คู่มือเข้าใจง่ายสำหรับเจ้าของ SME ที่อยากเอาข้อมูลจากหลายระบบมารวมกัน เพื่อดูภาพรวมธุรกิจได้จริง

สูตรในไฟล์ผิดมาสามเดือนแล้วไม่มีใครรู้ — สี่แบบของข้อผิดพลาดที่มองไม่เห็น

ข้อผิดพลาดในสเปรดชีตที่อันตรายที่สุดไม่ใช่แบบที่ขึ้นข้อความแดง แต่คือแบบที่ให้ตัวเลขซึ่งดูสมเหตุสมผล บทความนี้อธิบายสี่รูปแบบที่เกิดซ้ำที่สุด และการควบคุมที่จับได้ก่อนตัวเลขไปถึงที่ประชุม