Dự phòng SCADA và sẵn sàng cao: hot standby, RAID, vận hành 7×24
Hệ SCADA mà ca trực nhìn suốt ngày đêm, trên nhiều nhà máy vẫn chỉ là một máy chủ. Khi máy đó dừng, dây chuyền không chờ ai đi tìm đĩa dự phòng. Sẵn sàng cao không phải tùy chọn giấy phép; đó là một nhóm quyết định: sao chép cái gì, thử chuyển mạch ra sao, hiện trường chịu được loại sự cố nào. Bài này nêu khi nào triển khai một máy trở thành rủi ro dừng sản xuất; hot standby và cluster phải giữ đồng bộ những gì — cơ sở dữ liệu thời gian thực, kho lịch sử, dự án HMI và kênh truyền thông; RAID đứng ở tầng nào trên máy chủ; bảng nghiệm thu theo tầng; và vài điểm về cách ly mạng cùng phân quyền. Thực tiễn tầng kiến trúc chúng tôi giao gồm cluster dự phòng, hai máy chạy nóng dự phòng, RAID1 cơ sở dữ liệu, vận hành 7×24 và giao diện cập nhật cấp giây. Đó là biện pháp kỹ thuật, không phải con số tỷ lệ sẵn sàng hiện trường đã công bố, và chỉ đứng vững khi chuyển mạch đã được thử tại chỗ.
Khi nào triển khai một máy chủ trở thành rủi ro dừng dây chuyền
Một máy chủ SCADA phù hợp cho dây chuyền thí điểm, phòng thí nghiệm, hoặc nhà máy chạy được nhiều giờ không cần màn hình HMI sống. Nó hết phù hợp khi ca vận hành dựa vào màn đó để giữ sản xuất, khi cảnh báo là tín hiệu sớm ca thực sự dùng, hoặc khi cùng một máy còn giữ lịch sử cho báo cáo chất lượng và năng lượng.
Sự cố đau thường không phải cú sập kịch tính. Thường hơn là đĩa đầy, bản cập nhật Windows treo, nguồn chết, card mạng rớt — đến ca sau mới thấy không mở được xu hướng. Câu hỏi không phải máy chủ có hỏng hay không, mà sản xuất chịu được bao lâu khi không có nó, và vài phút dữ liệu cuối còn đó khi nó trở lại.
- Sản xuất liên tục không có cửa sổ dừng: dây điện tử hay dệt may, cụm công nghệ, trạm bơm hoặc hệ thống tiện ích không chờ được cài lại một máy
- HMI là vị trí thao tác: khởi động/dừng, nạp công thức, xác nhận cảnh báo diễn ra trên màn đó, không chỉ trên tủ tại máy
- Lịch sử nằm cùng đĩa với runtime: hỏng đĩa xóa cả bức tranh sống và bằng chứng cho chất lượng hay năng lượng
- Driver truyền thông chỉ trên host đó: phiên PLC, OPC, gateway chết cùng thùng máy, kể cả PC dự phòng cũng không thấy hiện trường cho đến khi kênh được dựng lại
- Trực 7×24 nhưng ca đêm mỏng: người trực xác nhận được cảnh báo, nhưng không khôi phục được ảnh máy chủ lúc 02:00
Nếu đúng từ hai điều trở lên, thiết kế một máy không còn là tiết kiệm chi phí. Đó là quyết định ngầm rằng sự cố máy chủ là lần dừng sản xuất có thể chấp nhận.
Hot standby và cluster phải giữ đồng bộ những gì
Mua thêm một giấy phép rồi đặt thêm một PC bên cạnh chưa phải hot standby. Chuyển mạch chỉ thành khi máy dự phòng đã cầm bản sao dùng được của mọi thứ ca cần trong vài giây sau khi cắt. Bốn kho dễ bị quên đến lần chuyển mạch thật đầu tiên: cơ sở dữ liệu thời gian thực, cơ sở lịch sử, dự án HMI và kênh truyền thông.
Trong giao hàng, chúng tôi coi cluster dự phòng và hai máy chạy nóng dự phòng là lựa chọn kiến trúc, không phải ô tích trên báo giá. Cặp máy phải thống nhất ai đang active, trạng thái sao chép thế nào, và ca thấy gì lúc chuyển. Giao diện cập nhật cấp giây trên nút còn sống chỉ có ích nếu các tag sau màn hình vẫn đang được quét.
- Cơ sở dữ liệu thời gian thực: giá trị tag hiện tại, trạng thái cảnh báo, liên động và setpoint trong bộ nhớ. Máy dự phòng chậm vài giây thôi, ca đã thao tác trên bức tranh sai
- Cơ sở lịch sử: xu hướng, nhật ký sự kiện và đường cong công nghệ. RAID1 trên đĩa không phải bản sao trên nút thứ hai; lỗ hổng lịch sử sau chuyển mạch là vấn đề chất lượng và kiểm toán, không chỉ IT
- Dự án HMI: màn hình, ràng buộc tag, script, quyền người dùng và tài nguyên ngôn ngữ. Runtime đứng trên file dự án của hôm qua sẽ hiện bức tranh sai dù cơ sở dữ liệu đã mới
- Kênh truyền thông: đường PLC, phiên OPC UA/DA, liên kết gateway và NIC chúng gắn vào. Kênh chỉ sống trên máy chính nghĩa là máy dự phòng khởi động vào một nhà máy trống
Phép thử thực tế: rút máy chính khi ca đang xem xu hướng và xác nhận cảnh báo. Nếu máy dự phòng không hiện cùng tag, cùng danh sách cảnh báo và cùng lịch sử vừa qua, cặp đó chưa phải hệ thống dự phòng.
RAID và máy chủ nó nằm trên
RAID1 trên đĩa cơ sở dữ liệu chống một đĩa chết. Nó không chống bo mạch chủ hỏng, hệ điều hành treo, mã hóa cả hai mặt gương, hay UPS chưa từng được thử. Dự phòng đĩa và dự phòng ứng dụng không cùng tầng; trộn hai tầng trong đề xuất khiến nhà máy có RAID mà dây chuyền vẫn dừng.
Máy chủ chạy SCADA còn cần đường nguồn, đường làm mát và đường mạng khớp với mức sẵn sàng nhà máy thực sự muốn. Hai card mạng có ích khi cách ly mạng công nghiệp khỏi mạng văn phòng, không chỉ khi ghép để tăng thông lượng. RAID1 cơ sở dữ liệu, hai máy chạy nóng dự phòng và cluster dự phòng có thể chung một phòng rồi cùng đổ nếu chung một switch, một UPS và một quạt tủ.
- RAID1 cho volume cơ sở dữ liệu: hỏng một đĩa không được kéo sập kho lịch sử; diễn tập khôi phục vẫn phải chứng minh bản sao lưu đọc được
- Nguồn kép và UPS có thời gian chạy đã đo, không lấy từ nhãn định mức
- Hai card mạng với mục đích đã ghi: một mặt về mạng công nghiệp, một mặt về mạng văn phòng hoặc historian, chứ không phải hai dây vào cùng VLAN
- Tách vật lý cặp máy: hai máy trong một tủ đã chắc hơn một máy; hai máy trên hai mạch UPS và hai switch truy cập mới chịu được sự cố một tủ
Tầng, biện pháp dự phòng, và nghiệm thu phải chứng minh gì
Đề xuất viết "dự phòng" thì không thử được. Bảng dưới viết để người thứ ba, không có lịch sử dự án, chạy phép thử và ghi có hoặc không. Cột thứ ba điền số của chính nhà máy — thời gian chuyển mạch, lỗ hổng lịch sử, ai được phép chuyển — chứ không chép giá trị mặc định của nhà cung cấp.
| Tầng | Biện pháp dự phòng | Nghiệm thu cần thử gì |
|---|---|---|
| Runtime SCADA | Hai máy chạy nóng dự phòng hoặc cluster dự phòng | Ép hỏng máy chính; ghi thời gian tiếp quản, client có kết nối lại, quyền phiên của ca còn không |
| Cơ sở dữ liệu thời gian thực | Bản sao đồng bộ hoặc gần đồng bộ trên máy dự phòng | Sau chuyển mạch, giá trị và trạng thái cảnh báo ghi trước khi cắt vẫn có trên nút còn sống |
| Cơ sở lịch sử | RAID1 trên volume cộng bản sao hoặc sao lưu định kỳ | Khôi phục một bản sao lưu; xác nhận lỗ hổng lịch sử qua lần cắt nằm trong cửa sổ thỏa thuận kỹ thuật |
| Dự án HMI và quyền | Bản sao dự án có phiên bản trên cả hai nút, cùng tập người dùng và vai trò | Mở cùng các màn sau chuyển mạch; đối chiếu ràng buộc tag, tài nguyên ngôn ngữ và ai được ghi setpoint |
| Kênh truyền thông | Hai đường, hai card mạng, phiên OPC hoặc driver dự phòng | Cắt một đường; xác nhận tag tiếp tục cập nhật và store-and-forward, nếu nằm trong phạm vi, bù được khoảng trống |
Thực tiễn tầng kiến trúc chúng tôi dùng trên dự án gồm cluster dự phòng, hai máy chạy nóng dự phòng, RAID1 cơ sở dữ liệu, vận hành 7×24 và giao diện cập nhật cấp giây. Đó là hạng mục nghiệm thu, không phải phần trăm sẵn sàng hiện trường. Lưu ba năm rồi chuyển vào kho lịch sử là quyết định riêng tầng dữ liệu, nên viết cạnh thiết kế RAID và bản sao, không thay thế chúng.
Cách ly mạng và phân quyền — vừa đủ cho sẵn sàng
Sẵn sàng cao sụp nếu mạng văn phòng tràn sang mạng công nghiệp, hoặc một tài khoản bị chiếm dừng được cả hai nút. Đây không phải bài chuyên về an ninh OT; các điểm dưới là những gì hiện ra trong thử chuyển mạch và đánh giá nhà máy.
Trên dự án quy mô lớn chúng tôi đã đặt mạng công nghiệp và mạng văn phòng trên đường vật lý tách biệt với switch Layer 3 quang gigabit, cách ly hai card mạng trên máy chủ, RAID1, phân quyền theo cấp và lọc tệp rủi ro cao. Quyền, vai trò và kiểm toán cấu hình theo yêu cầu an ninh của nhà máy. Thiết kế và tài liệu cung cấp theo phạm vi dự án, phục vụ đánh giá nhà máy, nghiệm thu và đánh giá bên thứ ba; kết luận dựa trên bằng chứng dự án.
- Cách ly mạng công nghiệp khỏi mạng văn phòng để bão broadcast hoặc mã độc phía máy bàn không kéo theo cả hai nút SCADA
- Gắn hai card mạng theo chức năng: lưu lượng công nghệ một mặt, văn phòng hoặc historian mặt kia, không bắc cầu tùy tiện
- Quyền ghi, nạp công thức và truy cập kỹ thuật đứng sau vai trò có tên, và giữ nhật ký ai đã đổi gì
- Lọc loại tệp rủi ro cao trên host SCADA; bản cài từ USB là đường thường gặp để cả hai nút nhận cùng phần mềm không mong muốn
Nếu nhà máy đã có chương trình an ninh OT, dự phòng SCADA nên nằm trong đó chứ không đứng cạnh. Các phép thử nghiệm thu ở bảng trên vẫn áp dụng: một cặp cách ly tốt nhưng không chuyển mạch được thì chưa phải hệ thống sẵn sàng cao.
Tóm tắt
SCADA một máy là rủi ro sản xuất khi màn hình là vị trí thao tác, lịch sử nằm cùng đĩa với runtime, và ca đêm không khôi phục được host. Hot standby và cluster chỉ tính khi cơ sở thời gian thực, kho lịch sử, dự án HMI và kênh truyền thông đi cùng nhịp. RAID1 bảo vệ đĩa, không bảo vệ bo mạch chủ; hai card mạng chỉ bảo vệ mạng khi chúng cách ly mạng.
Ghi tầng, biện pháp và phép thử vào thỏa thuận kỹ thuật. Cluster dự phòng, hai máy chạy nóng dự phòng, RAID1 cơ sở dữ liệu, vận hành 7×24 và giao diện cập nhật cấp giây là thực tiễn kỹ thuật chúng tôi giao; chúng trở thành thật chỉ khi có người rút máy chính mà hiện trường vẫn còn bức tranh.
Đối chiếu thiết kế dự phòng SCADA của nhà máy
Gửi bố trí máy chủ hiện tại, đã có host thứ hai hay chưa, và dây chuyền chạy được bao lâu khi không có HMI sống. Chúng tôi có thể phác chẩn đoán điểm sự cố đơn và kế hoạch dự phòng theo giai đoạn.
Liên hệ