커스텀 세이프가드 카테고리: AI의 대응 방식뿐 아니라, 감지 대상을 직접 정의해 보세요
Jun 18, 2026

AI 에이전트는 기본적으로 세이프가드 카테고리 4가지를 갖추고 있습니다. 유해 콘텐츠, 적대적 공격, 컨텍스트 인젝션, 금지어로 대부분은 이 정도로 충분하지만, 위험의 성격은 업종마다 다릅니다. 금융 서비스와 리테일이 마주하는 위험이 다르고, 헬스케어 어시스턴트에는 일반 세이프가드 목록이 예상하지 못한 컴플라이언스 이슈가 있으며, B2B 플랫폼은 경쟁사 언급을 고객에게 닿기 전에 걸러야 할 수도 있습니다.
지금까지는 감지 범위를 넓히려면 금지어나 금지 문구를 추가하는 것 말고는 방법이 없었습니다. 기본 4가지 카테고리 밖의 카테고리와 키워드로도 안 잡히는 주제는 그냥 놓칠 수밖에 없었습니다.
커스텀 세이프가드 카테고리는 이러한 문제를 해결합니다. 이제 대시보드에서 에이전트마다 커스텀 감지 카테고리를 최대 10개까지 직접 만들 수 있습니다. 기본 로직은 건드릴 필요 없이, 제품과 업종, 리스크 프로파일에 맞춰 새로 정의하면 됩니다.

커스텀 세이프가드 카테고리 소개
- 커스텀 감지 카테고리: 에이전트마다 커스텀 세이프가드 카테고리를 최대 10개까지 추가할 수 있습니다. 제품, 업종, 리스크 프로파일에 맞게 자유롭게 만들어 보세요.
- 기본 카테고리 정밀 제어: 사용 사례에 따라 기본 카테고리를 하나씩 켜고 끌 수 있습니다. 적대적 공격 감지만 항상 켜져 있고, 나머지는 다 조정 가능합니다.
- 커스텀 카테고리 분석: 커스텀 카테고리도 기본 4가지와 함께 Flagged Messages와 세이프가드 비율 통계에 나타납니다. 어떤 것이 걸러지고 있는지 전체 그림을 한눈에 볼 수 있습니다.
- 세이프가드 설정 버전 이력: 설정을 바꾸면 자동으로 기록이 남습니다. 언제 뭘 켰는지, 껐는지, 다시 정의했는지 명확하게 추적할 수 있습니다.
커스텀 세이프가드 카테고리는 Trust OS의 일부입니다. 일반적인 감지 체계가 아니라, 현재 리스크 환경에 딱 맞는 감지 레이어를 제공합니다.