테스트 업그레이드: 실제 대화로 구축하는 AI 에이전트 테스트 세트

테스트 업그레이드: 실제 대화로 구축하는 AI 에이전트 테스트 세트

인위적인 입력값으로 만든 테스트 사례는 시간이 지날수록 실제 고객 행동과 어긋나기 쉽습니다. 사례를 하나씩 작성하는 데도 많은 시간이 들고, 한 번 만든 테스트는 처음 설정한 환경에서만 실행할 수 있습니다. 개발, 스테이징, 프로덕션 환경을 모두 검증하려면 같은 테스트를 환경별로 다시 만들어야 합니다. 또한 실패 원인을 파악하는 일 역시 쉽지 않습니다. 테스트 결과가 통과 또는 실패로만 표시되면 문제가 발생했다는 사실은 알 수 있지만, 어디부터 살펴봐야 하는지는 알기 어렵기 때문입니다. 테스트 세트가 커질수록 관리 부담도 커집니다. 라벨과 그룹화 기능이 없거나 원하는 사례만 따로 실행할 수 없다면, 필요한 테스트를 찾고 운영하기 더욱 까다로워집니다.

이처럼 테스트 세트와 실제 프로덕션 환경 사이의 간극이 커질수록 테스트 결과에 대한 신뢰도도 낮아질 수밖에 없습니다.

테스트 업그레이드는 실제 대화에서 테스트 사례를 일괄 생성하고, 하나의 테스트 세트를 여러 환경에서 재사용하며, 실패 원인까지 분석할 수 있도록 합니다. 이를 통해 관리 중인 테스트 사례와 실제로 검증해야 하는 AI 에이전트의 행동 사이의 간극을 줄입니다.

Test result details

작동 방식

  • 실제 대화 기반 테스트 사례 일괄 생성: 대화 목록에서 여러 대화를 선택한 뒤 한 번에 테스트 사례로 전환할 수 있습니다.
  • 대화 ID를 활용한 AI 테스트 사례 생성: 새 테스트 사례를 만들 때 소스로 '사용자 대화'를 선택하고 대화 ID를 입력한 뒤 '생성'을 클릭하세요. AI가 대화를 분석해 필요한 테스트 자료를 미리 작성합니다. 처음부터 새로 만들 필요 없이, 구체적인 초안을 바탕으로 테스트 사례를 검토하고 다듬을 수 있습니다.
  • 라벨, 일괄 선택, 개별 실행: 테스트 사례에 라벨을 지정해 원하는 기준으로 그룹화하고 필터링할 수 있습니다. 여러 사례를 선택해 일괄 작업을 수행하거나, 별도의 테스트 실행을 설정하지 않고도 목록에서 원하는 사례 하나만 바로 실행할 수 있습니다.
  • 여러 환경에서 재사용하는 테스트 세트: 이제 테스트 세트를 복제하지 않고도 개발, 스테이징, 프로덕션 중 원하는 환경에서 실행할 수 있습니다. 테스트 세트는 한 번만 만들고, 모든 환경에서 검증하세요. 예약 실행과 결과 화면에는 어떤 환경에서 테스트했는지도 함께 표시됩니다.
  • 테스트 세트 실패 분석: 테스트 실행 중 실패한 사례가 발생하면 AI가 여러 실패 사례를 종합해 무엇이 잘못됐는지 요약합니다. 각 결과를 하나씩 열어보지 않아도 문제의 공통점과 디버깅을 시작할 지점을 빠르게 파악할 수 있습니다.

주요 변경 사항

  • 메시지 매치(Message Match) 지원 종료: '메시지 매치(Message Match)' 테스트 유형은 더 이상 제공되지 않으며, 기존 메시지 매치 테스트 사례에도 접근할 수 없습니다. 앞으로 모든 테스트에는 '대화 체크(Conversation Check)'가 사용됩니다.
  • 새 기준선 설정을 위한 테스트 재실행: 평가 로직이 개선되었습니다. 업데이트 후에는 테스트 세트를 다시 실행해 새로운 기준선을 설정하는 것을 권장합니다. 이전 평가 결과의 신뢰도가 낮았던 경우, 과거에 통과했던 테스트에서도 다른 결과가 나타날 수 있습니다.

테스트 업그레이드는 Trust OS의 일부로 실제 고객 행동을 바탕으로 테스트 세트를 구축하고, 어느 환경에서나 실행하며, 바로 조치할 수 있을 만큼 충분한 맥락과 함께 실패 원인을 파악할 수 있도록 합니다.