적대적 필터링
adversarial filtering
AI가 내놓은 후보 결과를 일부러 여러 각도에서 의심하고 반박해 걸러내는 검증 절차.
쉽게 말하면
적대적 필터링은 AI가 스스로 만들어낸 답을 곧바로 믿지 않고, 일부러 트집을 잡아가며 살아남는 것만 통과시키는 검증 절차다. 마치 논문 심사에서 여러 심사위원이 돌아가며 「이 결과가 우연 아니냐」 「다른 이유로도 설명되지 않느냐」를 캐묻는 것과 비슷하다. 한 번의 그럴듯한 답으로는 부족하고, 여러 번의 반박을 버텨내야 최종 후보로 인정받는다.
이런 절차가 필요한 이유는 AI가 데이터에서 그럴듯해 보이는 패턴을 곧잘 찾아내지만, 그중 상당수가 우연히 겹친 상관관계이거나 답을 미리 살짝 엿본 것 같은 착시일 수 있기 때문이다. 그래서 안정성은 있는지, 특정 집단에서만 우연히 맞는 건 아닌지, 다른 원인으로도 똑같이 설명되지는 않는지를 차례로 점검한다. 이 과정을 여러 단계에 걸쳐 통과한 결과만 사람이 검토할 만한 가설로 남긴다.
결국 적대적 필터링은 AI의 창의적인 추측과, 그 추측이 정말 믿을 만한지 따지는 깐깐한 검증을 분리해두는 장치다. 아이디어를 내는 쪽과 그 아이디어를 의심하는 쪽을 다르게 두면, 그럴듯하지만 틀린 결과가 최종 결과물에 섞여 들어갈 가능성이 줄어든다.
기사에서 이렇게 나와요
기사에서는 「후보 지표는 특징 구성과 목표 신호를 엄격히 분리하고, 11개 항목으로 이뤄진 적대적 필터링 단계를 통과해야 최종 후보로 남는다」고 설명한다. 여기서 「적대적」은 AI 시스템끼리 서로 싸운다는 뜻이 아니라, 후보 결과를 일부러 의심하며 여러 항목으로 검증한다는 뜻이다.
