อยากเทียบย้อนหลังสามปี แต่ระบบเก็บให้แค่หกเดือน

ระบบงานส่วนใหญ่ลบหรือย่อข้อมูลเก่าเพื่อรักษาความเร็ว ทำให้คำถามที่มีค่าที่สุดของธุรกิจ ซึ่งเป็นคำถามเชิงแนวโน้ม ตอบไม่ได้ในวันที่อยากตอบ บทความนี้อธิบายว่าข้อมูลหายไปตอนไหน และเก็บอะไรไว้ตั้งแต่วันนี้จึงจะทัน
คำถามที่เจ้าของธุรกิจถามแล้วมีมูลค่ามากที่สุด มักเป็นคำถามเชิงแนวโน้ม เช่น สินค้ากลุ่มนี้กำไรลดลงมาสองปีหรือเพิ่งลดปีนี้ ลูกค้าที่เคยซื้อประจำหายไปตั้งแต่เมื่อไร และช่วงเทศกาลปีนี้เทียบกับสองปีก่อนเป็นอย่างไร คำถามเหล่านี้ตอบได้ก็ต่อเมื่อมีข้อมูลย้อนหลังในระดับรายละเอียดเดียวกันตลอดช่วงเวลาที่เทียบ ซึ่งเป็นสิ่งที่ระบบงานส่วนใหญ่ไม่ได้เก็บไว้ให้
ข้อมูลหายไปด้วยสามวิธี ไม่ใช่วิธีเดียว
วิธีแรกที่ชัดที่สุดคือการลบทิ้งตามนโยบายเก็บข้อมูล ระบบจำนวนมากตั้งค่าให้ลบรายการที่เก่ากว่าช่วงเวลาหนึ่งโดยอัตโนมัติ เพื่อไม่ให้ฐานข้อมูลโตจนกระทบความเร็ว ผู้ดูแลระบบตั้งค่านี้ด้วยเหตุผลที่ถูกต้องทางเทคนิค และมักไม่มีใครถามฝ่ายธุรกิจก่อนว่าข้อมูลชุดนั้นจะถูกใช้ทำอะไรในอนาคต
วิธีที่สองอันตรายกว่าเพราะมองไม่เห็น คือการย่อข้อมูลเป็นยอดรวม ระบบเก็บยอดขายรายเดือนไว้แต่ลบรายการรายวันทิ้ง เมื่อถึงวันที่อยากรู้ว่ายอดในเดือนนั้นกระจุกอยู่ช่วงต้นเดือนหรือปลายเดือน คำตอบก็ไม่มีอยู่แล้ว ข้อมูลที่ถูกย่อไปแล้วแตกกลับไม่ได้ และไม่มีสัญญาณเตือนใดบอกว่ากำลังจะเสียความละเอียดนี้ไป
วิธีที่สามคือการเขียนทับข้อมูลอ้างอิง เมื่อสินค้าถูกย้ายกลุ่มหรือเปลี่ยนราคามาตรฐาน ระบบส่วนใหญ่แก้ค่าเดิมทับลงไปโดยไม่เก็บว่าค่าก่อนหน้าคืออะไรและใช้ตั้งแต่เมื่อไร ผลคือรายงานย้อนหลังจะคำนวณยอดของปีที่แล้วด้วยกลุ่มสินค้าและราคาของวันนี้ ตัวเลขที่ได้จะดูสมเหตุสมผลแต่ผิด ซึ่งเป็นความผิดพลาดชนิดที่จับได้ยากที่สุด
ยอดขาย
฿82K
กำไร
34%
สต็อก
5 ⚠
สิ่งที่ควรเริ่มเก็บตั้งแต่วันนี้
- รายการธุรกรรมในระดับรายละเอียดที่สุดที่ระบบให้ได้ ไม่ใช่ยอดสรุป เพราะยอดสรุปสร้างจากรายการได้เสมอ แต่ทางกลับกันทำไม่ได้
- ภาพของข้อมูลอ้างอิงตามรอบ เช่น รายการสินค้าและราคาของแต่ละเดือน เพื่อให้รายงานย้อนหลังใช้ค่าของช่วงเวลานั้นจริง
- วันที่และเวลาของเหตุการณ์ตามที่ระบบต้นทางบันทึก ไม่ใช่วันที่ที่คัดลอกข้อมูลออกมา
- บันทึกว่าแต่ละรอบดึงข้อมูลสำเร็จหรือไม่ เพื่อให้รู้ว่าช่วงใดของประวัติมีรูโหว่
คำถามที่พบบ่อย
เก็บข้อมูลย้อนหลังทั้งหมดจะแพงไหม
ถูกกว่าที่คนส่วนใหญ่คาดไว้มาก เพราะข้อมูลธุรกรรมของ SME ไทยทั่วไปมีขนาดเล็กเมื่อเทียบกับราคาพื้นที่จัดเก็บในปัจจุบัน ธุรกิจที่มีรายการหลักหมื่นต่อเดือน มักเก็บข้อมูลสิบปีได้ในขนาดที่ค่าจัดเก็บต่อเดือนต่ำกว่าค่าอาหารกลางวันของทีมหนึ่งวัน ต้นทุนที่แท้จริงอยู่ที่การตั้งระบบดึงข้อมูลครั้งแรก ไม่ใช่ที่การเก็บ
PDPA กำหนดให้ลบข้อมูล จะเก็บย้อนหลังได้อย่างไร
สองเรื่องนี้ไปด้วยกันได้ เพราะข้อกำหนดเรื่องการลบมุ่งไปที่ข้อมูลที่ระบุตัวบุคคลได้ ไม่ใช่ที่ตัวเลขทางธุรกิจ วิธีที่ใช้กันคือเก็บข้อมูลธุรกรรมไว้โดยแทนที่ข้อมูลระบุตัวตนด้วยรหัสอ้างอิง และลบหรือปิดบังข้อมูลส่วนบุคคลตามนโยบายที่กำหนด ผลคือยังวิเคราะห์แนวโน้มยอดขายและพฤติกรรมกลุ่มได้ โดยไม่เก็บสิ่งที่กฎหมายกำหนดให้ลบ
ระบบเดิมลบข้อมูลไปแล้ว ยังกู้คืนได้ไหม
บางส่วนอาจกู้ได้จากสามแหล่ง คือไฟล์สำรองข้อมูลเก่าที่ยังเก็บไว้ รายงานที่เคยส่งออกเป็นไฟล์และยังอยู่ในเครื่องของทีม และเอกสารทางบัญชีที่ต้องเก็บตามกฎหมายอยู่แล้ว ข้อมูลจากสามแหล่งนี้มักหยาบกว่าต้นฉบับและใช้แรงมากในการนำเข้า จึงคุ้มเฉพาะเมื่อช่วงเวลานั้นสำคัญจริง ในทางปฏิบัติการเริ่มเก็บตั้งแต่วันนี้ให้ผลตอบแทนสูงกว่าเสมอ
บริการที่เกี่ยวข้อง
รับทำ Data Platform และ BI
รวมข้อมูลจากทุกระบบไว้ชั้นเดียว กำหนดนิยามตัวชี้วัดให้ตรงกันก่อนทำรายงาน
WhaleScope
ดูโครงสร้างตลาดของทุกหมวดธุรกิจไทย บน WhaleScope
รายชื่อบริษัท ผู้เล่นรายใหญ่ และอัตราคงอยู่ของแต่ละหมวด — จากข้อมูลจดทะเบียน 2 ล้านนิติบุคคล
อ่านต่อ

ยิ่งทำรายงานเยอะ ระบบหน้าร้านยิ่งช้า — ปัญหาที่แก้ที่หน้าจอไม่ได้
เมื่อแดชบอร์ดต่อตรงเข้าฐานข้อมูลที่ใช้ทำงานจริง ทุกครั้งที่มีคนเปิดรายงาน ระบบขายจะช้าลงพร้อมกัน บทความนี้อธิบายว่าทำไมการเพิ่มเครื่องหรือปรับกราฟไม่ช่วย และชั้นข้อมูลกลางแก้ปัญหานี้ที่ตรงไหน

Feature Store: คลังตัวแปรกลาง ที่ทำให้งาน AI ไม่ต้องเริ่มนับหนึ่งทุกครั้ง
ทุกโมเดล AI ต้องการตัวแปรอย่างยอดซื้อเฉลี่ยหรือความถี่การใช้งาน และทุกทีมมักคำนวณเองซ้ำ ๆ ด้วยสูตรที่ต่างกันเล็กน้อยจนผลไม่ตรงกัน Feature Store คือคลังกลางที่นิยามและคำนวณตัวแปรครั้งเดียว ให้ทุกโมเดลใช้ร่วมกัน

Data Mesh: กระจายความเป็นเจ้าของข้อมูล ให้ทีมที่รู้จักข้อมูลดีที่สุด
เมื่อทุกคำขอข้อมูลต้องผ่านทีมกลางทีมเดียว งานจะคอขวดและคนทำก็ไม่รู้จักข้อมูลเท่าเจ้าของงาน Data Mesh เสนอให้แต่ละทีมดูแลข้อมูลของตัวเองเหมือนเป็นสินค้า ภายใต้มาตรฐานกลางเดียวกัน

สูตรในไฟล์ผิดมาสามเดือนแล้วไม่มีใครรู้ — สี่แบบของข้อผิดพลาดที่มองไม่เห็น
ข้อผิดพลาดในสเปรดชีตที่อันตรายที่สุดไม่ใช่แบบที่ขึ้นข้อความแดง แต่คือแบบที่ให้ตัวเลขซึ่งดูสมเหตุสมผล บทความนี้อธิบายสี่รูปแบบที่เกิดซ้ำที่สุด และการควบคุมที่จับได้ก่อนตัวเลขไปถึงที่ประชุม
