เมื่อ LLM เป็นส่วนหนึ่งของระบบ: ออกแบบ Guardrails, Evaluation และ Fallback ให้พึ่งพาได้

การต่อ LLM เข้ากับระบบจริงไม่ใช่แค่เรียก API แต่คือการออกแบบขอบเขต การวัดผล และทางหนีทีไล่ เมื่อโมเดลตอบผิด บทความนี้สรุปสามชั้นที่ทำให้ฟีเจอร์ AI พึ่งพาได้
ฟีเจอร์ AI ที่สาธิตได้สวยในห้องประชุม มักพังเงียบ ๆ ตอนเจอผู้ใช้จริง เพราะ LLM ไม่ได้ให้คำตอบเดิมทุกครั้ง และไม่เคยบอกว่าตัวเองไม่รู้ การนำ LLM เข้าระบบจริงจึงไม่ใช่งานเรียก API แต่คือการออกแบบสามชั้นรอบโมเดล ได้แก่ ขอบเขต การวัดผล และทางถอย
ชั้นที่ 1: Guardrails คือขอบเขตที่โมเดลห้ามข้าม
Guardrails คือกติกาที่บังคับก่อนและหลังโมเดลทำงาน เช่น ตรวจ input ว่าไม่ใช่คำสั่งหลอก (prompt injection) จำกัดหัวข้อที่ตอบได้ บังคับรูปแบบผลลัพธ์ให้เป็นโครงสร้างที่ระบบอ่านต่อได้ และกรอง output ที่มีข้อมูลส่วนบุคคลหรือคำแนะนำที่เกินขอบเขตธุรกิจ จุดสำคัญคือ guardrails ต้องเป็นโค้ดที่ตรวจสอบได้ ไม่ใช่แค่ข้อความใน prompt ที่ขอร้องโมเดลให้ทำตัวดี
- ตรวจ schema ของผลลัพธ์ ถ้าไม่ตรงให้ปฏิเสธหรือสั่งโมเดลทำใหม่
- จำกัดสิทธิ์ของเครื่องมือที่ AI เรียกได้ (ดูได้แต่ห้ามลบ ห้ามจ่ายเงิน)
- บันทึก input/output ทุกครั้งเพื่อตรวจย้อนหลังเมื่อเกิดปัญหา
ชั้นที่ 2: Evaluation วัดว่าดีพอหรือยัง ก่อนปล่อยและหลังปล่อย
ระบบเดิมทดสอบด้วยคำตอบที่ถูกต้องเพียงคำตอบเดียว แต่ LLM ตอบได้หลายแบบที่ถูกพอ ๆ กัน เราจึงต้องมีชุดตัวอย่าง (eval set) ที่สะท้อนงานจริง และให้คะแนนด้วยกฎ ด้วยโมเดลอื่นเป็นกรรมการ หรือด้วยคนสุ่มตรวจ การวัดต้องทำซ้ำได้ทุกครั้งที่เปลี่ยน prompt หรือเปลี่ยนรุ่นโมเดล ไม่งั้นคุณจะอัปเกรดแล้วของพังโดยไม่รู้ตัว
ชั้นที่ 3: Fallback ทางถอยเมื่อโมเดลไม่มั่นใจหรือพัง
ฟีเจอร์ AI ที่ดีต้องตอบได้ว่าไม่รู้ ดีกว่าเดาแล้วมั่นใจผิด ๆ ออกแบบให้มีเกณฑ์ความเชื่อมั่น ถ้าต่ำกว่าเกณฑ์ให้ส่งต่อให้คนหรือใช้กระบวนการเดิม รวมถึงต้องรับมือกรณี API ช้าหรือล่ม ด้วย timeout ที่ชัดเจนและคำตอบสำรอง ผู้ใช้ไม่ควรเห็นหน้าค้างเพราะรอโมเดล
สามชั้นนี้ไม่ได้ทำให้ AI ฉลาดขึ้น แต่ทำให้ธุรกิจกล้าพึ่งพามันได้ เพราะคุณรู้ว่ามันจะผิดตรงไหน วัดได้แค่ไหน และเมื่อผิดแล้วจะเกิดอะไรขึ้น นั่นคือความต่างระหว่างของเล่นกับระบบที่ใช้งานจริง
บริการที่เกี่ยวข้อง
รับพัฒนาระบบและซอฟต์แวร์เฉพาะทาง
ออกแบบและวางระบบตามความต้องการเฉพาะของธุรกิจคุณ ตั้งแต่ต้นจนใช้งานจริง
WhaleScope
ดูโครงสร้างตลาดของทุกหมวดธุรกิจไทย บน WhaleScope
รายชื่อบริษัท ผู้เล่นรายใหญ่ และอัตราคงอยู่ของแต่ละหมวด — จากข้อมูลจดทะเบียน 2 ล้านนิติบุคคล
อ่านต่อ

Hallucination ใน LLM: ทำไม AI ตอบผิดอย่างมั่นใจ และจะลดได้อย่างไร
LLM ถูกออกแบบให้ตอบให้ฟังดูน่าเชื่อ ไม่ใช่ให้ถูกต้องเสมอ จึงบางครั้งแต่งคำตอบขึ้นมาอย่างมั่นใจ เข้าใจว่าทำไม Hallucination ถึงเกิด และวิธีลดความเสี่ยงก่อนนำ AI ไปใช้กับงานจริง

Few-shot: สอน AI ด้วยตัวอย่างในคำสั่ง โดยไม่ต้องเทรนใหม่
อยากให้ AI ตอบในรูปแบบเฉพาะของเรา ไม่จำเป็นต้องเทรนโมเดลใหม่ แค่ใส่ตัวอย่างที่ดีลงในคำสั่ง AI ก็เลียนแบบได้ Few-shot คือเทคนิคง่ายแต่ทรงพลัง เข้าใจว่าใช้เมื่อไรและมีขีดจำกัดแค่ไหน

Chain-of-Thought: ทำไมการให้ AI คิดเป็นขั้นตอน ช่วยลดคำตอบผิด
เมื่อถาม AI โจทย์ที่ต้องคิดหลายขั้น การบังคับให้มันแสดงเหตุผลทีละขั้นก่อนตอบ มักได้คำตอบที่ถูกต้องกว่า เข้าใจหลัก Chain-of-Thought และข้อจำกัดที่ต้องระวัง

Semantic Caching: ลดค่า AI ด้วยการจำคำตอบของคำถามที่คล้ายกัน
คำถามที่ผู้ใช้ถาม AI ส่วนใหญ่ซ้ำเดิมในรูปประโยคต่างกัน ถ้าเรียกโมเดลใหม่ทุกครั้งก็จ่ายซ้ำทุกครั้ง Semantic Caching จำคำตอบไว้แล้วจับคู่คำถามใหม่ที่ความหมายเหมือนเดิม ช่วยลดทั้งค่าใช้จ่ายและเวลารอ
