O ORPAON
SCADA และระบบควบคุมส่วนบน

SCADA สำรองและความพร้อมใช้สูง: Hot Standby, RAID, ทำงาน 7×24

ระบบ SCADA ที่พนักงานเฝ้าดูตลอดวันตลอดคืน ในหลายโรงงานยังอยู่บนเซิร์ฟเวอร์เครื่องเดียว เมื่อเครื่องนั้นล่ม สายผลิตจะไม่รอให้ใครไปหาดิสก์สำรอง ความพร้อมใช้สูงไม่ใช่ตัวเลือกบนใบอนุญาต แต่เป็นชุดการตัดสินใจว่าจะทำสำเนาอะไร ทดสอบการสลับอย่างไร และโรงงานทนความล้มเหลวแบบใดได้ บทความนี้ชี้ว่าเมื่อใดที่ติดตั้งเครื่องเดียวกลายเป็นความเสี่ยงหยุดผลิต hot standby กับคลัสเตอร์ต้องซิงก์อะไร — ฐานข้อมูลเรียลไทม์ คลังประวัติ โปรเจกต์ HMI และช่องสื่อสาร — RAID อยู่ชั้นไหนบนเซิร์ฟเวอร์ ตารางตรวจรับทีละชั้น และบันทึกสั้นเรื่องแยกเครือข่ายกับสิทธิ์ แนวปฏิบัติชั้นสถาปัตยกรรมที่เราส่งมอบ ได้แก่ คลัสเตอร์สำรอง ระบบสำรองร้อน RAID1 ฐานข้อมูล ทำงาน 7×24 และรีเฟรชหน้าจอระดับวินาที นั่นคือมาตรการทางวิศวกรรม ไม่ใช่ตัวเลขความพร้อมใช้หน้างานที่ประกาศ และจะตั้งได้ก็ต่อเมื่อทดสอบการสลับที่หน้างานแล้ว

เมื่อใดที่ติดตั้งเซิร์ฟเวอร์เครื่องเดียวกลายเป็นความเสี่ยงหยุดสาย

เซิร์ฟเวอร์ SCADA เครื่องเดียวเหมาะกับสายนำร่อง ห้องทดลอง หรือโรงงานที่เดินเครื่องได้หลายชั่วโมงโดยไม่มี HMI สด มันไม่เหมาะอีกต่อไปเมื่อกะพึ่งหน้าจอนั้นเพื่อให้ผลิตเดิน เมื่อสัญญาณเตือนคือสัญญาณเตือนล่วงหน้าที่กะใช้จริง หรือเมื่อเครื่องเดียวกันยังเก็บประวัติที่รายงานคุณภาพและพลังงานอ่าน

ความล้มเหลวที่เจ็บแทบไม่ใช่การพังแบบดราม่า บ่อยกว่านั้นคือดิสก์เต็ม อัปเดต Windows ค้าง พาวเวอร์ซัพพลายดับ การ์ดเครือข่ายหลุด จนกะถัดไปเปิดเทรนด์ไม่ได้ คำถามไม่ใช่ว่าเซิร์ฟเวอร์จะพังหรือไม่ แต่เป็นว่าการผลิตอยู่ได้กี่ชั่วโมงเมื่อไม่มีมัน และข้อมูลไม่กี่นาทีสุดท้ายยังอยู่เมื่อมันกลับมา

  • ผลิตต่อเนื่องไม่มีหน้าต่างว่าง: สายผลิตทั่วไป หน่วยกระบวนการ สถานีสูบน้ำ หรือระบบสาธารณูปโภคโรงงาน รอติดตั้งใหม่ไม่ได้
  • HMI คือตำแหน่งปฏิบัติงาน: สตาร์ท/สต็อป โหลดสูตร รับทราบสัญญาณเตือนเกิดบนจอนั้น ไม่ใช่แค่ที่แผงข้างเครื่อง
  • ประวัติอยู่ดิสก์เดียวกับรันไทม์: ดิสก์พังลบทั้งภาพสดและหลักฐานสำหรับคุณภาพหรือพลังงาน
  • ไดรเวอร์สื่อสารอยู่บนโฮสต์นั้นเท่านั้น: เซสชัน PLC, OPC, เกตเวย์ตายพร้อมกล่อง แม้มีพีซีสำรองก็ไม่เห็นหน้างานจนกว่าจะสร้างช่องใหม่
  • เวร 7×24 แต่กะดึกคนบาง: ผู้เวรรับทราบสัญญาณเตือนได้ แต่กู้ภาพเซิร์ฟเวอร์ตอนตีสองไม่ได้

ถ้าเข้าได้สองข้อขึ้นไป การออกแบบเครื่องเดียวไม่ใช่การประหยัดอีกต่อไป นั่นคือการตัดสินใจโดยนัยว่าความล้มเหลวของเซิร์ฟเวอร์คือการหยุดผลิตที่ยอมรับได้

Hot standby กับคลัสเตอร์ต้องซิงก์อะไร

ซื้อไลเซนส์อีกชุดแล้ววางพีซีอีกเครื่องข้าง ๆ ยังไม่ใช่ hot standby การสลับจะสำเร็จก็ต่อเมื่อเครื่องสำรองถือสำเนาที่ใช้ได้ของทุกอย่างที่พนักงานต้องการในไม่กี่วินาทีหลังสลับแล้ว สี่คลังที่มักลืมจนกว่าจะสลับจริงครั้งแรก ได้แก่ ฐานข้อมูลเรียลไทม์ ฐานประวัติ โปรเจกต์ HMI และช่องสื่อสาร

ในการส่งมอบ เราถือคลัสเตอร์สำรองและระบบสำรองร้อนเป็นการเลือกสถาปัตยกรรม ไม่ใช่ช่องติ๊กบนใบเสนอราคา คู่เครื่องต้องตกลงว่าใครแอ็กทีฟ คัดลอกสถานะอย่างไร และพนักงานเห็นอะไรระหว่างสลับ การรีเฟรชหน้าจอระดับวินาทีบนโหนดที่รอดมีประโยชน์ก็ต่อเมื่อแท็กหลังจอยังถูกโพลอยู่

  • ฐานข้อมูลเรียลไทม์: ค่าแท็กปัจจุบัน สถานะสัญญาณเตือน อินเตอร์ล็อก และเซตพอยต์ในหน่วยความจำ ถ้าเครื่องสำรองช้าแม้ไม่กี่วินาที กะจะทำงานบนภาพที่ผิดแล้ว
  • ฐานประวัติ: เทรนด์ บันทึกเหตุการณ์ และเส้นโค้งกระบวนการ RAID1 บนดิสก์ไม่เท่ากับเรพลิกาบนโหนดที่สอง ช่องว่างประวัติหลังสลับเป็นเรื่องคุณภาพและตรวจบัญชี ไม่ใช่แค่ไอที
  • โปรเจกต์ HMI: หน้าจอ การผูกแท็ก สคริปต์ สิทธิ์ผู้ใช้ และชุดภาษา รันไทม์ที่ขึ้นด้วยไฟล์โปรเจกต์ของเมื่อวานจะแสดงภาพผิดแม้ฐานข้อมูลจะเป็นปัจจุบัน
  • ช่องสื่อสาร: เส้นทาง PLC เซสชัน OPC UA/DA ลิงก์เกตเวย์ และ NIC ที่ผูกอยู่ ช่องที่มีเฉพาะเครื่องหลักหมายความว่าเครื่องสำรองบูตเข้าโรงงานว่าง

การทดสอบที่ใช้ได้จริงคือดึงเครื่องหลักขณะพนักงานกำลังดูเทรนด์และรับทราบสัญญาณเตือน ถ้าเครื่องสำรองไม่แสดงแท็กชุดเดียวกัน รายการสัญญาณเตือนชุดเดียวกัน และประวัติช่วงที่เพิ่งผ่าน คู่นั้นยังไม่ใช่ระบบสำรอง

RAID และเซิร์ฟเวอร์ที่มันนั่งอยู่

RAID1 บนดิสก์ฐานข้อมูลป้องกันดิสก์แผ่นเดียวตาย มันไม่ป้องกันเมนบอร์ดพัง ระบบปฏิบัติการค้าง การเข้ารหัสกระจกทั้งสองด้าน หรือ UPS ที่ไม่เคยทดสอบ ความซ้ำซ้อนของดิสก์กับความซ้ำซ้อนของแอปอยู่คนละชั้น การปนกันในข้อเสนอทำให้โรงงานมี RAID แต่สายยังหยุด

เซิร์ฟเวอร์ที่วาง SCADA ยังต้องการเส้นทางไฟ เส้นทางระบายความร้อน และเส้นทางเครือข่ายที่สอดคล้องกับความพร้อมใช้ที่โรงงานต้องการจริง การ์ดเครือข่ายสองใบมีประโยชน์เมื่อแยกเครือข่ายอุตสาหกรรมจากเครือข่ายสำนักงาน ไม่ใช่แค่เมื่อรวมเพื่อเพิ่มแบนด์วิดท์ RAID1 ฐานข้อมูล ระบบสำรองร้อน และคลัสเตอร์สำรองอยู่ห้องเดียวกันแล้วยังล้มพร้อมกันได้ถ้าใช้สวิตช์ตัวเดียว UPS ตัวเดียว และพัดลมตู้ตัวเดียว

  • RAID1 สำหรับโวลุ่มฐานข้อมูล: ดิสก์พังแผ่นหนึ่งไม่ควรทำให้คลังประวัติล่ม การซ้อมกู้ยังต้องพิสูจน์ว่าสำเนาสำรองอ่านได้
  • พาวเวอร์ซัพพลายคู่และ UPS ที่วัดเวลาทำงานแล้ว ไม่ใช่ดูจากป้ายชื่อ
  • การ์ดเครือข่ายสองใบที่มีวัตถุประสงค์บันทึกไว้: หน้าหนึ่งสู่เครือข่ายอุตสาหกรรม อีกหน้าสู่สำนักงานหรือเครือข่ายฮิสทอเรียน ไม่ใช่สายสองเส้นเข้า VLAN เดียวกัน
  • แยกคู่เครื่องทางกายภาพ: สองเครื่องในแร็คเดียวแข็งกว่าเครื่องเดียวแล้ว สองเครื่องบนวงจร UPS สองวงและสวิตช์เข้าถึงสองตัวคือแบบที่ทนความล้มเหลวของตู้เดียว

ชั้น วิธีสำรอง และสิ่งที่งานตรวจรับต้องพิสูจน์

ข้อเสนอที่เขียนว่า "สำรอง" ทดสอบไม่ได้ ตารางด้านล่างเขียนให้คนที่สามที่ไม่มีประวัติโครงการรันการทดสอบแล้วบันทึกใช่หรือไม่ คอลัมน์ที่สามให้ใส่ตัวเลขของโรงงานเอง — เวลาสลับ ช่องว่างประวัติ ใครมีสิทธิ์สลับ — อย่าคัดลอกค่าเริ่มต้นของผู้ขาย

ชั้นวิธีสำรองตรวจรับต้องทดสอบอะไร
รันไทม์ SCADAระบบสำรองร้อนหรือคลัสเตอร์สำรองบังคับให้เครื่องหลักล้ม บันทึกเวลาเข้าครอบครอง ไคลเอนต์ต่อใหม่หรือไม่ และสิทธิ์เซสชันของพนักงานยังอยู่หรือไม่
ฐานข้อมูลเรียลไทม์เรพลิกาแบบซิงโครนัสหรือใกล้ซิงค์บนเครื่องสำรองหลังสลับ ค่าสุดท้ายและสถานะสัญญาณเตือนที่เขียนก่อนตัดยังอยู่บนโหนดที่รอด
ฐานประวัติRAID1 บนโวลุ่มบวกเรพลิกาหรือสำรองตามตารางกู้สำเนาสำรอง ยืนยันว่าช่องว่างประวัติข้ามจุดตัดอยู่ในหน้าต่างที่ตกลงในข้อตกลงทางเทคนิค
โปรเจกต์ HMI และสิทธิ์สำเนาโปรเจกต์มีเวอร์ชันบนทั้งสองโหนด ชุดผู้ใช้และบทบาทเดียวกันเปิดหน้าจอชุดเดิมหลังสลับ ตรวจการผูกแท็ก ชุดภาษา และใครเขียนเซตพอยต์ได้
ช่องสื่อสารสองเส้นทาง การ์ดเครือข่ายสองใบ เซสชัน OPC หรือไดรเวอร์สำรองตัดเส้นทางหนึ่ง ยืนยันว่าแท็กยังอัปเดต และ store-and-forward ถ้าอยู่ในขอบเขต เติมช่องว่างได้

แนวปฏิบัติชั้นสถาปัตยกรรมที่ใช้ในโครงการ ได้แก่ คลัสเตอร์สำรอง ระบบสำรองร้อน RAID1 ฐานข้อมูล ทำงาน 7×24 และรีเฟรชหน้าจอระดับวินาที นั่นคือรายการตรวจรับ ไม่ใช่เปอร์เซ็นต์ความพร้อมใช้หน้างาน การเก็บสามปีแล้วย้ายเข้าคลังประวัติเป็นการตัดสินใจชั้นข้อมูลแยกต่างหาก ควรเขียนข้างการออกแบบ RAID และเรพลิกา ไม่ใช่แทนที่มัน

แยกเครือข่ายและสิทธิ์ — เท่าที่ความพร้อมใช้ต้องการ

ความพร้อมใช้สูงพังถ้าเครือข่ายสำนักงานท่วมเครือข่ายอุตสาหกรรม หรือบัญชีที่ถูกเจาะบัญชีเดียวหยุดได้ทั้งสองโหนด นี่ไม่ใช่บทความ OT ซีเคียวริตี จุดด้านล่างคือสิ่งที่โผล่ในการทดสอบสลับและงานตรวจโรงงาน

ในโครงการขนาดใหญ่เราแยกเครือข่ายอุตสาหกรรมกับสำนักงานเป็นเส้นทางกายภาพคนละสาย พร้อมสวิตช์เลเยอร์ 3 ไฟเบอร์กิกะบิต แยกการ์ดเครือข่ายสองใบบนเซิร์ฟเวอร์ RAID1 สิทธิ์ตามระดับ และกรองไฟล์ความเสี่ยงสูง สิทธิ์ บทบาท และบันทึกตรวจสอบปรับตามข้อกำหนดความปลอดภัยของโรงงาน ออกแบบและเอกสารจัดตามขอบเขตโครงการ ใช้ในงานตรวจโรงงาน การยอมรับ และการประเมินโดยบุคคลที่สาม ข้อสรุปยึดหลักฐานโครงการ

  • แยกเครือข่ายอุตสาหกรรมจากเครือข่ายสำนักงาน เพื่อไม่ให้พายุบรอดแคสต์หรือมัลแวร์ฝั่งเดสก์ท็อปลากโหนด SCADA ทั้งสองไปด้วย
  • ผูกการ์ดเครือข่ายสองใบตามหน้าที่: ทราฟฟิกกระบวนการหน้าหนึ่ง สำนักงานหรือฮิสทอเรียนอีกหน้า ไม่ทำสะพานมั่ว
  • สิทธิ์เขียน โหลดสูตร และเข้าถึงงานวิศวกรรมให้อยู่หลังบทบาทที่มีชื่อ และเก็บร่องรอยว่าใครเปลี่ยนอะไร
  • กรองชนิดไฟล์ความเสี่ยงสูงบนโฮสต์ SCADA สำเนาตัวติดตั้งจาก USB เป็นทางที่พบบ่อยที่ทำให้ทั้งสองโหนดได้ซอฟต์แวร์ไม่พึงประสงค์ชุดเดียวกัน

ถ้าโรงงานมีโปรแกรมความปลอดภัย OT อยู่แล้ว ความซ้ำซ้อนของ SCADA ควรอยู่ข้างใน ไม่ใช่อยู่ข้าง ๆ การทดสอบตรวจรับในตารางด้านบนยังใช้ได้: คู่ที่แยกเครือข่ายดีแต่สลับไม่ได้ ยังไม่ใช่ระบบพร้อมใช้สูง

สรุป

SCADA เครื่องเดียวเป็นความเสี่ยงการผลิตเมื่อหน้าจอคือตำแหน่งปฏิบัติงาน ประวัติอยู่ดิสก์เดียวกับรันไทม์ และกะดึกกู้โฮสต์ไม่ได้ Hot standby กับคลัสเตอร์มีค่าเมื่อฐานเรียลไทม์ คลังประวัติ โปรเจกต์ HMI และช่องสื่อสารเดินพร้อมกัน RAID1 ปกป้องดิสก์ ไม่ใช่เมนบอร์ด การ์ดเครือข่ายสองใบปกป้องเครือข่ายเมื่อแยกเครือข่ายเท่านั้น

เขียนชั้น วิธีการ และการทดสอบลงในข้อตกลงทางเทคนิค คลัสเตอร์สำรอง ระบบสำรองร้อน RAID1 ฐานข้อมูล ทำงาน 7×24 และรีเฟรชหน้าจอระดับวินาทีคือแนวปฏิบัติทางวิศวกรรมที่เราส่งมอบ มันเป็นจริงเมื่อมีคนดึงเครื่องหลักแล้วยังมีภาพที่หน้างาน

ตรวจการออกแบบสำรองของ SCADA หน้างาน

ส่งผังเซิร์ฟเวอร์ปัจจุบัน ว่ามีโฮสต์ที่สองแล้วหรือยัง และสายผลิตอยู่ได้กี่ชั่วโมงเมื่อไม่มี HMI สด เราจะร่างแนวทางวินิจฉัยจุดล้มเหลวจุดเดียวและแผนสำรองเป็นขั้น ๆ ได้

ติดต่อเรา