Tóm tắt nhanh

  • Một dashboard Application Metrics cho thấy công thức AI đề xuất làm file video thực tế lớn hơn dự đoán tới 83%, trong khi công thức bitrate mới sai lệch khoảng 5%.
  • Code do AI tạo vẫn cần được kiểm chứng bằng telemetry production và một mô hình đo lường gắn trực tiếp với kết quả người dùng.
  • Thêm metric so sánh predicted/actual cho logic AI tạo, đặt ngưỡng sai số và kiểm thử bằng dữ liệu chuẩn trước rollout.

Điều gì đã xảy ra

Khi công thức có vẻ hợp lý nhưng sai

Một công cụ chuyển đổi video cần dự đoán kích thước đầu ra trước khi người dùng chờ quá trình encode. Phiên bản đầu do trợ lý AI đề xuất lấy kích thước nguồn nhân với tỷ lệ chiều cao đích và nguồn. Công thức nghe có vẻ liên quan đến độ phân giải nhưng bỏ qua thực tế rằng khi encode theo bitrate, số bit mỗi giây và thời lượng mới quyết định gần đúng dung lượng file.

Sentry Application Metrics ghi lại tỷ lệ giữa kích thước thực tế và dự đoán. Dashboard cho thấy công thức cũ có tỷ lệ trung bình 1,57 và có trường hợp 1,83, tức file lớn hơn dự báo tới 83%. Sau khi thay bằng công thức dựa trên bitrate, tỷ lệ trung bình đạt 0,97 và kết quả thường nằm trong khoảng sai lệch khoảng 5%.

Telemetry là bài kiểm tra cho code AI

Metric dạng số không bị sampling như một số luồng log và có thể nhóm theo loại estimator, định dạng nguồn, định dạng đích hoặc chế độ chuyển đổi. Nhờ vậy đội phát triển không chỉ thấy bug chính mà còn phát hiện chế độ copy ước lượng cao khoảng 16% và GIF cao khoảng 9%. Đây là dữ liệu có thể chuyển trực tiếp thành backlog cải tiến.

Bài học không phải là tránh dùng AI để viết code, mà là không coi đầu ra của AI như bằng chứng đúng. Với logic định lượng, đội ngũ nên xác định invariant, tạo tập dữ liệu chuẩn, ghi cả dự đoán lẫn kết quả và đặt cảnh báo theo tỷ lệ sai số. Production observability trở thành vòng phản hồi giúp phát hiện giả định sai trước khi chúng làm giảm niềm tin của người dùng.

Bài viết liên quan

Nguồn tham khảo

Application Metrics caught my broken size estimator

Vì sao developer cần quan tâm

Code do AI tạo vẫn cần được kiểm chứng bằng telemetry production và một mô hình đo lường gắn trực tiếp với kết quả người dùng.

  1. 1Thêm metric so sánh predicted/actual cho logic AI tạo, đặt ngưỡng sai số và kiểm thử bằng dữ liệu chuẩn trước rollout.