Pull down to refresh stories
Courses Write Login VITi?ng Vi?t Store
Verified

Cách AWS dùng Amazon Bedrock để phát hiện lỗi nội dung dashboard ở quy mô lớn

Bạn sẽ làm gì khi máy chủ báo 'Healthy', API phản hồi tốt, nhưng người dùng lại thấy một biểu đồ trống rỗng ngay trước cuộc họp quan trọng?

Bằng cách kết hợp AI trên Amazon Bedrock với kiến trúc serverless, AWS đã giảm thời gian phát hiện lỗi từ 72 giờ xuống còn dưới 1 giờ, đảm bảo tính toàn vẹn cho hàng trăm dashboard quản trị.

Reference image for: Cách AWS dùng Amazon Bedrock để phát hiện lỗi nội dung dashboard ở quy mô lớn
Reference image from AWS ML Blog. AWS ML Blog

Đội ngũ AWS đã xây dựng giải pháp tự động hóa việc kiểm tra nội dung lớp cuối (last-mile), sử dụng mô hình ngôn ngữ lớn (LLM) để phát hiện các biểu đồ trống hoặc sai lệch số liệu mà các hệ thống giám sát hạ tầng truyền thống thường bỏ sót.

What happened

Trong các hệ thống Business Intelligence (BI) quy mô lớn, các công cụ như Amazon CloudWatch Synthetics thường chỉ xác nhận dịch vụ đang chạy hoặc trang web đã tải. Tuy nhiên, lỗi nội dung (content failure) như biểu đồ trống, dữ liệu cũ hoặc sai số do cấu hình bộ lọc vẫn xảy ra âm thầm. Dữ liệu thực tế cho thấy chưa đến 1% các lỗi này được người dùng báo cáo, khiến chúng trở nên vô hình đối với các kênh hỗ trợ phản ứng nhanh, trong khi rủi ro tăng cao khi dữ liệu này được nạp vào các hệ thống AI tạo báo cáo cho lãnh đạo.

Thay đổi kỹ thuật: Quy trình xác thực 5 giai đoạn

Giải pháp sử dụng kiến trúc serverless gồm 5 giai đoạn: (1) Lập lịch qua Amazon EventBridge và quản lý danh mục bằng Amazon Redshift (2) Chụp ảnh màn hình dashboard qua AWS Lambda và ẩn danh dữ liệu nhạy cảm bằng Amazon Rekognition (3) Phân tích AI song song bằng mô hình Anthropic Claude trên Amazon Bedrock để kiểm tra tính toàn vẹn thị giác và tính nhất quán của con số (4) Định tuyến cảnh báo qua Slack và tạo ticket tự động (5) Lưu trữ dữ liệu đo lường để phân tích xu hướng.

The evidence so far

Sau 30 ngày triển khai, hệ thống đã thực hiện 153. 000 lượt kiểm tra trên hàng trăm dashboard, phát hiện 802 trường hợp lỗi nội dung (tỷ lệ 0,52%). Quan trọng nhất, thời gian phát hiện lỗi trung bình (MTTD) đã giảm từ mức tối đa 72 giờ xuống còn dưới 1 giờ. Cơ chế xác thực số liệu cũng giúp phát hiện các lỗi hệ thống ảnh hưởng đến cả một nhóm chỉ số liên quan trước khi chúng tiếp cận đến người tiêu dùng dữ liệu cuối cùng.

Giới hạn và rủi ro: Bài học về độ chính xác của AI

Thách thức lớn nhất là các trường hợp gây nhiễu (false positives), ví dụ như một biểu đồ trống do bộ lọc thực sự không có dữ liệu chứ không phải do lỗi hệ thống. Đội ngũ kỹ thuật nhấn mạnh việc ưu tiên suy luận ngữ cảnh hơn là tốc độ thô. Ngoài ra, một rủi ro khác là khả năng tính toán của LLM ban đầu AI được dùng để so sánh số liệu nhưng vẫn xảy ra sai sót về logic làm tròn hoặc đơn vị, gây ảnh hưởng đến lòng tin của người dùng vào hệ thống cảnh báo.

What is still unclear

Trong giai đoạn tiếp theo, AWS tập trung vào ba khả năng mới: Kiểm tra tính nhất quán chéo giữa các dashboard khác nhau trong ứng dụng AWS Insights Xây dựng hệ thống khuyến nghị tự động dựa trên dữ liệu lịch sử để gợi ý cách khắc phục lỗi và phát triển phân tích dự báo để dự đoán các vấn đề trước khi chúng thực sự tác động đến người dùng. Nguyên tắc cốt lõi vẫn là: dùng AI cho các tác vụ ngữ cảnh (nhìn, đọc, điều hướng) và dùng mã nguồn xác định (deterministic code) cho các quyết định cần độ chính xác tuyệt đối.

Source notes

Related stories

Apps & SoftwareHow to use AI plans without stacking duplicate appsApps & SoftwareThe practical tech tips worth saving right now: which AI, workspace, and app moves actually helpApps & SoftwareWhy is Apple so quiet about what it offers the enterprise