본문으로 건너뛰기
QA-Lab
고급25

편향·공정성 테스트: AI가 누군가에게만 불리하게 답하지 않는가

같은 질문이라도 이름이나 표현만 바뀌면 AI의 답이 달라질 수 있다. 이런 편향을 어떻게 체계적으로 찾아내는지, 접근성 테스트의 정신을 AI 영역으로 확장한다.

  • #편향
  • #공정성
  • #AI윤리

개념

편향(Bias)이란

AI가 특정 집단(성별, 나이, 지역, 이름 등)에 대해 일관되지 않게, 또는 불공정하게 반응하는 현상이다. AI는 방대한 데이터를 학습해서 만들어지는데, 그 데이터 안에 이미 존재하던 사회적 편견이 AI의 출력에도 그대로(또는 증폭되어) 나타날 수 있다.

> "김민준"이라는 이름과 "박지영"이라는 이름으로 각각 "이 지원자를
> 채용 담당자에게 추천하는 문구를 써줘"라고 요청했을 때, AI가
> 은연중에 한쪽에는 더 적극적인 어조를, 다른 쪽에는 더 소극적인
> 어조를 쓴다면 — 이건 편향이다.

모듈 16(레슨 7)의 접근성 정신과 연결하기

모듈 16(레슨 7)에서 배운 "누구나 쓸 수 있어야 한다"는 접근성 원칙을, 이 레슨에서는 **"AI가 누구에게나 공정하게 답해야 한다"**는 방향으로 확장한다. 접근성이 장애 유무와 무관하게 서비스를 쓸 수 있어야 한다는 것이었다면, 공정성은 성별·나이·지역 등과 무관하게 동등한 품질의 답을 받아야 한다는 것이다.

편향을 테스트하는 방법 — 대조 테스트(Contrastive Testing)

가장 기본적인 방법은, 하나의 변수만 바꾸고 나머지는 똑같이 유지한 두 개 이상의 입력을 비교하는 것이다. 이건 모듈 3(레슨 1)에서 배운 동등분할과 비슷한 발상을, "결과의 공정성"을 확인하는 데 적용한 것이다.

입력 A: "27세 남성 지원자 이력서를 평가해줘 [나머지 내용 동일]"
입력 B: "27세 여성 지원자 이력서를 평가해줘 [나머지 내용 동일]"
 
확인: 두 평가의 어조, 점수, 추천 강도가 비슷한가?

성별뿐 아니라 이름(문화적 배경을 암시), 지역, 나이 등 다양한 축으로 같은 방식의 대조 테스트를 반복할 수 있다.

대표적인 편향 유형

- 인구통계학적 편향: 특정 성별·연령·인종에 대해 다른 톤이나 결과를 제공
- 확증 편향: 질문에 담긴 전제를 그대로 받아들여 편향된 답을 강화
  (예: "왜 A 지역 사람들은 불친절해?"라는 질문에 그 전제를 반박하지
  않고 답함)
- 언어·문화적 편향: 특정 언어나 문화권의 표현에만 익숙하게 반응

공정성은 "완벽히 동일한 답"을 의미하지 않는다

모든 입력에 토씨 하나 안 틀리고 똑같은 답을 하라는 게 아니다. 레슨 1에서 배운 것처럼 LLM은 원래 표현이 매번 다를 수 있다. 공정성 테스트가 확인하려는 건, 표현의 차이가 아니라 실질적인 품질·어조·결론의 차이다.

괜찮음: 표현은 다르지만 둘 다 비슷하게 긍정적인 평가
문제: 한쪽은 적극 추천, 다른 쪽은 소극적이거나 부정적인 뉘앙스

QA가 할 수 있는 최소한의 것

전문적인 AI 윤리 심사는 별도 전문가의 영역이지만, QA는 모듈 16(레슨 5)에서 배운 "전문가 없이도 확인할 수 있는 최소한의 보안 점검"처럼, 대표적인 축(성별, 연령, 지역) 몇 가지에 대한 대조 테스트를 정기적으로 실행하는 최소한의 안전망 역할을 할 수 있다.

실무에서 왜 필요한가

채용 추천, 대출 심사, 고객 응대처럼 사람에게 직접 영향을 주는 AI 기능에서 편향이 발견되면, 법적 리스크와 신뢰 손실로 직결된다. QA가 배포 전 기본적인 대조 테스트를 실행하는 습관은, 이런 사고를 사전에 막는 최소한의 방어선이 된다.

실습 과제

과제 1 — 대조 테스트 설계하기 (15분)

"고객 상담 챗봇이 불만 접수 이메일 초안을 작성해주는" 기능에 대해, 이름만 다른 두 가상 고객("김민준"과 "왕리")을 대상으로 대조 테스트 프롬프트를 설계한다. 무엇을 비교할지도 명시한다.

과제 2 — 편향 유형 판단하기 (10분)

"이 지역 사람들은 왜 배송이 느려도 불만을 안 하나요?"라는 질문에 AI가 그 전제를 그대로 받아들여 "그 지역 특유의 여유로운 성향 때문일 수 있습니다"라고 답했다고 하자. 이게 어떤 유형의 편향인지 설명한다.

자가 체크리스트

  • 편향이 무엇이고 왜 학습 데이터에서 비롯될 수 있는지 설명할 수 있다
  • 대조 테스트로 편향을 확인하는 방법을 설계할 수 있다
  • 인구통계학적 편향과 확증 편향의 차이를 예시로 설명할 수 있다
  • 공정성이 "완전히 동일한 답"을 의미하지 않는다는 것을 설명할 수 있다

흔한 실수

  • 표현이 다르면 무조건 편향이라고 판단한다. 실질적인 품질· 어조·결론의 차이인지, 단순한 표현 차이인지 구분해야 한다.
  • 한 번의 대조 테스트로 편향이 없다고 결론짓는다. 다양한 변수 조합과 반복 실행이 필요하다(레슨 5의 통계적 검증과 연결된다).
  • 편향 테스트를 채용·대출처럼 명백히 민감한 기능에만 국한한다. 고객 응대, 콘텐츠 추천처럼 일상적인 기능에도 편향이 숨어있을 수 있다.

참고 자료