SLO และ Error Budget: ตกลงกันให้ชัดว่าระบบพังได้แค่ไหน

2 มิถุนายน 2569อ่าน 7 นาที
SLO และ Error Budget: ตกลงกันให้ชัดว่าระบบพังได้แค่ไหน

ระบบที่ไม่ล่มเลยไม่มีจริง มีแต่แพงขึ้นเรื่อย ๆ ตามเลขเก้าที่เพิ่ม SLO คือการตกลงเป้าความพร้อมใช้งานที่ธุรกิจต้องการจริง และ Error Budget คือโควตาความพังที่เหลือ ซึ่งกลายเป็นเครื่องมือตัดสินใจว่าจะเร่งฟีเจอร์หรือหยุดเสริมความเสถียร

เมื่อถามว่าอยากให้ระบบเสถียรแค่ไหน คำตอบจากทุกคนคือร้อยเปอร์เซ็นต์ แต่คำตอบนี้ไม่มีอยู่จริงในทางวิศวกรรม และการไล่ตามมันแพงขึ้นแบบทวีคูณ จาก 99.9 เปอร์เซ็นต์ไป 99.99 เปอร์เซ็นต์ อาจหมายถึงต้นทุนเพิ่มหลายเท่า เพื่อลดเวลาล่มจากปีละแปดชั่วโมงเหลือห้าสิบนาที คำถามที่ถูกจึงไม่ใช่ทำให้ไม่ล่มได้ไหม แต่คือธุรกิจของเรารับความล่มได้แค่ไหนโดยไม่เจ็บจริง SLO หรือ Service Level Objective คือคำตอบของคำถามนั้นที่เขียนเป็นตัวเลขชัดเจน เช่น หน้าชำระเงินต้องสำเร็จ 99.9 เปอร์เซ็นต์ วัดเป็นรายเดือน

โควตาความพัง ที่เปลี่ยนการเถียงเป็นกติกา

ความฉลาดของแนวคิดนี้อยู่ที่ด้านกลับของ SLO ถ้าเป้าคือ 99.9 เปอร์เซ็นต์ แปลว่ามีพื้นที่ให้พังได้ 0.1 เปอร์เซ็นต์ นี่คือ Error Budget หรือโควตาความพังประจำเดือน ซึ่งเปลี่ยนความขัดแย้งอมตะระหว่างฝั่งที่อยากปล่อยฟีเจอร์เร็วกับฝั่งที่อยากให้ระบบนิ่ง ให้กลายเป็นกติกาที่ตกลงกันล่วงหน้า ตราบใดที่โควตายังเหลือ ทีมปล่อยของใหม่ได้เต็มความเร็ว แต่เมื่อไรที่ความล่มสะสมจนโควตาหมด งานฟีเจอร์ต้องหยุดชั่วคราว แล้วหันมาเสริมความเสถียรจนกลับมาอยู่ในเป้า การตัดสินใจว่าจะเร่งหรือเบรกจึงไม่ต้องอาศัยเสียงที่ดังที่สุดในห้องประชุมอีกต่อไป แต่ดูจากตัวเลขที่ทั้งสองฝ่ายยอมรับร่วมกันตั้งแต่ต้น

  • ตั้ง SLO ตามความเจ็บจริงของธุรกิจ ไม่ใช่ตามตัวเลขที่ฟังดูดี
  • ระบบต่างส่วนควรมีเป้าต่างกัน หน้าจ่ายเงินเข้มกว่าหน้าบทความได้
  • โควตาหมดแล้วต้องเบรกจริง กติกาที่ไม่เคยถูกใช้คือกติกาที่ไม่มี

SLO และ Error Budget เป็นเครื่องมือการบริหารพอ ๆ กับเครื่องมือวิศวกรรม เพราะมันบังคับให้ธุรกิจตอบคำถามที่มักถูกเลี่ยง คือความเสถียรมีราคา และเราตั้งใจซื้อที่ระดับไหน สำหรับผู้บริหาร การถามทีมว่าระบบสำคัญของเรามีเป้าความพร้อมใช้งานเป็นตัวเลขไหม และเดือนนี้ใช้โควตาความพังไปเท่าไรแล้ว คือการยกบทสนทนาเรื่องความเสถียรจากความรู้สึก มาสู่ตัวเลขที่บริหารได้จริง

SLOError BudgetReliabilitySRE

บริการที่เกี่ยวข้อง

รับพัฒนาเว็บแอปพลิเคชัน

สร้างเว็บแอปที่รองรับการเติบโตและเชื่อมกับระบบอื่นได้

WhaleScope

ดูโครงสร้างตลาดของทุกหมวดธุรกิจไทย บน WhaleScope

รายชื่อบริษัท ผู้เล่นรายใหญ่ และอัตราคงอยู่ของแต่ละหมวด — จากข้อมูลจดทะเบียน 2 ล้านนิติบุคคล

อ่านต่อ

Observability ไม่ใช่แค่ Logging: Metrics, Traces และ SLO ที่ธุรกิจควรเข้าใจ

เมื่อระบบช้าหรือล่ม คำถามแรกคือ รู้ได้ยังไงและรู้เร็วแค่ไหน Observability คือความสามารถในการเข้าใจสิ่งที่เกิดในระบบจากภายนอก และ SLO คือสัญญาคุณภาพที่แปลงเรื่องเทคนิคเป็นภาษาธุรกิจ

Uptime Monitoring คืออะไร: รู้ว่าเว็บล่มก่อนลูกค้าโทรมาบอก

เว็บหรือระบบล่มตอนกลางคืนหรือช่วงที่ไม่มีใครดู อาจไม่มีใครรู้จนลูกค้าบ่นหรือยอดขายหาย Uptime monitoring คือระบบที่คอยเช็กว่าเว็บและระบบยังทำงานอยู่ตลอดเวลา และแจ้งเตือนทันทีที่ล่ม เพื่อให้แก้ได้ก่อนความเสียหายลาม

Containerization: แพ็กแอปให้รันเหมือนกันทุกที่

ปัญหาคลาสสิกคือ บนเครื่องผมมันรันได้ แต่ขึ้นเซิร์ฟเวอร์กลับพัง Containerization แก้ด้วยการแพ็กแอปพร้อมทุกอย่างที่ต้องใช้ ให้รันเหมือนกันทุกที่ ลดปัญหาความต่างของสภาพแวดล้อม

Dead Letter Queue: จัดการงานที่ทำไม่สำเร็จ ไม่ให้หายเงียบ

ในระบบที่ใช้คิวงาน บางงานทำไม่สำเร็จซ้ำ ๆ ถ้าปล่อยทิ้ง งานสำคัญอาจหายเงียบ Dead Letter Queue คือที่พักของงานที่พลาด เพื่อให้ตรวจสอบและกู้คืนได้ ไม่ใช่หายไปโดยไม่มีใครรู้