서킷 브레이킹
Circuit Breaking
AI의 문제 행동이 일정 횟수 이상 쌓이면 사람이 안전을 확인할 때까지 그 행동을 자동으로 막는 차단 장치
쉽게 말하면
서킷 브레이킹은 AI가 문제가 되는 행동을 일정 횟수 이상 저질렀을 때, 사람이 안전하다고 확인해줄 때까지 그 행동 자체를 아예 못 하게 자동으로 막는 장치다.
집에 있는 두꺼비집을 떠올리면 된다. 전류가 갑자기 세지면 두꺼비집이 저절로 내려가 전기를 끊어버린다. 불이 나기 전에 먼저 차단하는 것이다. 누군가 원인을 확인하고 손으로 다시 올려야만 전기가 들어온다. AI 시스템의 서킷 브레이킹도 똑같다. 감시 장치가 위험한 신호를 여러 번 잡아내면, 사람이 개입해 괜찮다고 판단할 때까지 그 종류의 행동을 시스템이 스스로 잠가버린다.
한 번 걸러졌다고 바로 멈추는 건 아니고, 걸러진 건수가 어느 정도 쌓여야 작동한다는 점에서 두꺼비집의 과부하 기준과 비슷하다. AI 회사들이 내부적으로 이런 장치를 얼마나 갖췄는지는 외부에서 잘 보이지 않는데, 최근 비영리단체의 평가에서 이 항목이 회사별 안전 관리 수준을 가르는 기준 중 하나로 쓰였다.
