빠른 요약

  • AWS 아키텍처는 교육 영상을 SOP로 바꾸고 RAG로 ticket 해결을 안내하며 ML로 SLA 위험을 예측하는 통합 운영 시스템을 제시한다.
  • 개별 ticket에 chatbot을 붙이는 대신 분산된 지식과 전체 업무 흐름을 개선하는 접근이다.
  • 명확한 ticket 한 종류로 pilot하고 SOP owner와 retrieval 품질을 관리하며 상태 변경에는 사람의 승인을 유지한다.

무슨 일이 있었나

흩어진 문서에서 운영 시스템으로

지원팀은 ticket 증가, 오래된 SOP, 교육 영상에 갇힌 지식과 소수 전문가 의존을 동시에 겪는다. AWS가 설명한 구조는 실행과 분석을 연결한다. 실제 운영에서 지식을 수집하고 ticket 처리 시점에 안내를 제공하며 지연이 드러나기 전에 SLA 위험을 찾는다.

Workspace 계층은 Amazon Bedrock과 Strands Agents SDK를 사용한다. Video-to-SOP pipeline은 화면, 음성, interface action을 단계별 절차로 바꾼다. Ticket analyzer는 semantic retrieval과 RAG로 관련 SOP와 policy를 찾아 상황별 안내를 만든다. Agent가 tagging, comment, status update를 수행할 수 있지만 통제와 audit를 위해 human-in-the-loop 안에서 실행한다.

분석 결과를 workflow로 돌려보내기

Decision intelligence 계층은 workload 분포, 복잡도와 analyst capacity를 관찰한다. ML model은 ticket을 분류하고 SLA risk score를 부여해 우선 처리할 case를 드러낸다. 과거 보고서에 머물지 않고 추천을 queue에 돌려보내 deadline 위반 전에 업무를 재배치한다.

RAG 품질은 지식 관리와 접근 권한에 달려 있다. 각 SOP에는 owner, version, effective date와 적용 범위가 필요하다. Retrieval은 ACL을 지켜야 하며 citation과 analyst feedback을 저장해 오래된 안내를 찾아야 한다. 자동화가 사람의 책임을 없애서는 안 된다.

검색 시간, first-contact resolution, rework, SLA breach와 추천 수용률을 측정한다. 절차가 명확한 한 종류의 ticket으로 시작해 ground truth를 만들고 retrieval 품질과 audit trail이 기준을 넘을 때만 agent action을 확대한다.

관련 글

참고 자료

Modernizing and scaling support operations with generative AI on AWS

개발자가 주목해야 하는 이유

개별 ticket에 chatbot을 붙이는 대신 분산된 지식과 전체 업무 흐름을 개선하는 접근이다.

  1. 1명확한 ticket 한 종류로 pilot하고 SOP owner와 retrieval 품질을 관리하며 상태 변경에는 사람의 승인을 유지한다.