Khi Data Center không còn là đáp án: từ DC Proposal đến Infrastructure Consolidation
Capacity Planning, TCO, Proxmox/PBS và lý do một phương án ban đầu có thể thay đổi khi nhìn kỹ hơn vào nhu cầu vận hành và recovery.
Đọc bài →Những ghi chép từ các project, những lần thay đổi hệ thống và công việc vận hành hằng ngày.
Những câu chuyện mình thấy đáng ghi lại sau khi đi qua design, cutover, troubleshooting hoặc vận hành thực tế.
Capacity Planning, TCO, Proxmox/PBS và lý do một phương án ban đầu có thể thay đổi khi nhìn kỹ hơn vào nhu cầu vận hành và recovery.
Đọc bài →PA-3050 → PA-3410, GlobalProtect Pre-logon, UAT, rollback và khoảng cách giữa device healthy với service thực sự hoạt động.
Đọc bài →Dual WAN, DMVPN, OSPF và lý do tunnel UP chưa đủ để kết luận application giữa các site đã thông.
Đọc bài →Mình làm Infrastructure đã nhiều năm, đi qua Network, Systems, Security, Cloud và IT Operations. Trong quãng thời gian đó có những project lớn, những thay đổi nhỏ, những lần cutover khá yên ắng và cả những tình huống chỉ khi vận hành thật mới thấy vấn đề.
Ở đây mình ghi lại những chuyện như vậy: vì sao một phương án được chọn, điều gì có thể hỏng, team kiểm tra bằng cách nào, khi nào nên rollback, và sau go-live còn phải nhìn thêm điều gì. Công nghệ thay đổi theo thời gian; những câu hỏi vận hành thì thường quay lại dưới những hình thức khác nhau.
Zabbix, Grafana, Loki, log tập trung, baseline và alert — với trọng tâm là nhìn ra vấn đề đủ sớm và giảm những cảnh báo không giúp ích cho vận hành.
Firewall, IPS, VPN, WAN, failover và migration. Phần mình quan tâm nhiều nhất thường nằm ở dependency, service validation và rollback hơn là chỉ nhìn trạng thái thiết bị.
AWS, Terraform, PowerShell, Python và Microsoft Graph cho những công việc có thể chuẩn hóa, lặp lại và kiểm soát được.
Backup job chỉ là điểm bắt đầu. Mình quan tâm nhiều hơn đến restore test, recovery path, dependency và việc có đủ bằng chứng để biết hệ thống thực sự phục hồi được hay không.
Entra ID, Microsoft 365, identity lifecycle, least privilege và các integration cần cân bằng giữa vận hành thuận tiện với quyền truy cập đủ chặt.
Backup/restore, audit evidence và ICT readiness cho business continuity — những phần rất dễ trở thành giấy tờ nếu không gắn lại với cách hệ thống thực sự được vận hành và kiểm tra.
Infrastructure, Microsoft platforms, Security, Monitoring, Backup/DR và Automation.
Network/Security projects với AWS/Terraform, Cisco, Palo Alto, Fortinet, IPS, Peplink, Meraki và Trellix DLP Endpoint.
Infrastructure cho hệ thống giao dịch chứng khoán, kết nối tài chính, vendor coordination và vận hành kỹ thuật.
Infrastructure Operations tại HCM, Network/Security, Identity và các nền tảng văn phòng.
Multi-site Systems, Microsoft Infrastructure, Enterprise Networking, Virtualization, Backup và Security.
Kiểm thử thiết bị Cisco và hỗ trợ kỹ thuật cho khách hàng.
Một thiết kế dễ hiểu và dễ troubleshoot thường có giá trị hơn một kiến trúc phức tạp chỉ để trông đẹp trên diagram.
Trước một thay đổi lớn, mình muốn biết rollback ở đâu, mất bao lâu và sau rollback sẽ kiểm tra service bằng cách nào.
HA, tunnel, backup job hay dashboard đều cần được kiểm tra tiếp ở service hoặc recovery thực tế.
Tự động hóa nên giảm thao tác lặp lại nhưng vẫn cần log, exception handling và cách dừng khi có điều bất thường.