每天早上一封邮件,把昨天的 AI 梳理好订阅邮件›
AI 용어사전/ㄹ/안전과 논쟁
Red Teaming
출시 전에 일부러 공격해 보는 역할. 「우리가 먼저 뚫어 본다」가 AI 안전의 표준 절차가 됐다.
제품을 내놓기 전에 일부러 공격해 보는 역할, 또는 그 활동입니다. 군사 훈련에서 아군(블루팀)을 공격하는 가상 적군(레드팀)에서 온 말로, 보안 업계를 거쳐 AI의 표준 절차가 됐습니다.
새 모델 출시 전 수백 명이 탈옥·위험 답변·편향을 쥐어짜듯 시험하고, 그 결과가 모델 카드에 실립니다. 「외부 레드팀에 몇 개월간 검증받았다」는 문구가 출시 발표의 신뢰 장치로 쓰입니다. 정부 규제들도 프론티어 모델에 레드팀 의무를 넣는 추세입니다.