커스텀 세이프가드 카테고리: AI의 대응 방식뿐 아니라, 감지 대상을 직접 정의해 보세요

커스텀 세이프가드 카테고리: AI의 대응 방식뿐 아니라, 감지 대상을 직접 정의해 보세요

AI 에이전트는 기본적으로 세이프가드 카테고리 4가지를 갖추고 있습니다. 유해 콘텐츠, 적대적 공격, 컨텍스트 인젝션, 금지어로 대부분은 이 정도로 충분하지만, 위험의 성격은 업종마다 다릅니다. 금융 서비스와 리테일이 마주하는 위험이 다르고, 헬스케어 어시스턴트에는 일반 세이프가드 목록이 예상하지 못한 컴플라이언스 이슈가 있으며, B2B 플랫폼은 경쟁사 언급을 고객에게 닿기 전에 걸러야 할 수도 있습니다.

지금까지는 감지 범위를 넓히려면 금지어나 금지 문구를 추가하는 것 말고는 방법이 없었습니다. 기본 4가지 카테고리 밖의 카테고리와 키워드로도 안 잡히는 주제는 그냥 놓칠 수밖에 없었습니다.

커스텀 세이프가드 카테고리는 이러한 문제를 해결합니다. 이제 대시보드에서 에이전트마다 커스텀 감지 카테고리를 최대 10개까지 직접 만들 수 있습니다. 기본 로직은 건드릴 필요 없이, 제품과 업종, 리스크 프로파일에 맞춰 새로 정의하면 됩니다.

Dashboard operators can now define up to 10 detection categories of their own, tailored to their product, their industry, and their risk profile

커스텀 세이프가드 카테고리 소개

  • 커스텀 감지 카테고리: 에이전트마다 커스텀 세이프가드 카테고리를 최대 10개까지 추가할 수 있습니다. 제품, 업종, 리스크 프로파일에 맞게 자유롭게 만들어 보세요.
  • 기본 카테고리 정밀 제어: 사용 사례에 따라 기본 카테고리를 하나씩 켜고 끌 수 있습니다. 적대적 공격 감지만 항상 켜져 있고, 나머지는 다 조정 가능합니다.
  • 커스텀 카테고리 분석: 커스텀 카테고리도 기본 4가지와 함께 Flagged Messages와 세이프가드 비율 통계에 나타납니다. 어떤 것이 걸러지고 있는지 전체 그림을 한눈에 볼 수 있습니다.
  • 세이프가드 설정 버전 이력: 설정을 바꾸면 자동으로 기록이 남습니다. 언제 뭘 켰는지, 껐는지, 다시 정의했는지 명확하게 추적할 수 있습니다.

커스텀 세이프가드 카테고리는 Trust OS의 일부입니다. 일반적인 감지 체계가 아니라, 현재 리스크 환경에 딱 맞는 감지 레이어를 제공합니다.