IT

목소리는 이제 인증 수단이 아니다

ndev-note 2026. 9. 10. 16:11

 

보안에서 오래 통용된 전제 하나가 최근 몇 년 사이 무너졌습니다. 목소리는 그 사람 고유의 것이라는 전제요.

상용 AI 음성 합성 서비스는 짧은 샘플만으로 톤과 말투를 정밀하게 복제합니다. 3~5초 분량으로 상당한 정확도가 나온다는 얘기까지 나옵니다. SNS에 올린 30초 영상 하나가 충분한 재료가 되는 셈입니다.

무엇이 달라졌나

기존 보이스피싱은 걸러낼 여지가 있었습니다. 억양이 어색하고, 말투가 부자연스럽고, 무엇보다 모르는 사람의 목소리였으니까요. "이상하다"는 직감이 작동했습니다.



AI 음성 복제는 이 직감을 무력화합니다. 톤과 말투는 물론 감정까지 재현되고, 무엇보다 내가 아는 사람의 목소리로 들립니다. 판단하기 전에 감정이 먼저 반응하죠.

실제 사례들을 보면 구조가 비슷합니다. 자녀 목소리로 울음소리를 들려주고 협박하거나, 가족을 사칭해 급전을 요구하는 식으로 판단할 시간을 주지 않습니다. 딸 목소리를 믿고 2천만원을 송금한 사례도 보고됐습니다.

기업 대상 공격도 있습니다. 2024년 엔지니어링 기업 아럽은 딥페이크 화상회의로 약 2,500만 달러 피해를 입었습니다. CFO와 임원의 얼굴과 목소리를 복제한 회의에 직원 한 명이 참여했다가 송금한 사건이었습니다.

왜 갑자기 늘었나

기술 발전만으로는 설명이 부족합니다. 결정적인 변화는 범죄의 서비스화입니다.

딥페이크 생성 모델과 음성 합성 도구, 자동화 스크립트를 묶어 파는 형태가 다크웹에서 유통되고 있습니다. 공격자가 직접 모델을 만들 필요가 없어졌다는 뜻입니다. 이렇게 진입 장벽이 사라지면 공격 시도 자체가 기하급수적으로 늘어납니다. 딥페이크가 전 세계 사기 활동의 11%를 차지한다는 집계도 있습니다.

여기에 조합 공격이 붙습니다. 악성 앱을 설치하게 만들어 피해자 휴대전화의 통화를 장악하는 수법이 대표적입니다. 이러면 피해자가 경찰이나 은행에 확인 전화를 걸어도 사기 조직으로 연결됩니다. 공공기관 번호 수십 개를 미리 조작해두는 사례도 보고됐습니다.

흥미로운 비대칭

이 문제에서 눈여겨볼 만한 대목이 있습니다. Z세대와 밀레니얼 세대가 다른 연령층보다 사기 시도에 더 많이 노출되고, 동시에 스스로 위협을 식별할 수 있다고 답한 비율도 가장 높았다는 조사입니다.

이 과신이 취약점입니다. AI 피싱은 기술적 허점을 노리는 게 아니라 신뢰와 감정을 모방합니다. 디지털에 익숙하다는 것과 감정을 조작하는 공격에 강한 것은 별개의 문제죠. 개발자나 IT 종사자가 오히려 방심하기 쉬운 영역이라고 생각합니다.

대응은 기술이 아니라 절차



목소리로 진위를 판단할 수 없다면, 목소리 밖에서 검증해야 합니다. 실무적으로 가장 효과적인 방법은 단순합니다.

가족 암호. 가족끼리 미리 단어 하나를 정해두는 겁니다. AI는 목소리는 복제하지만 두 사람만 아는 정보는 알 수 없습니다. 급한 돈 요구를 받았을 때 이걸 물으면 1초에 판별됩니다. 원시적으로 보이지만, 사전 공유 비밀(pre-shared secret)이라는 인증 원리 그대로입니다.

콜백 원칙. 받은 번호로 되걸지 않고, 저장된 원래 번호로 직접 전화합니다. 통화 장악 수법을 감안하면 가능하면 다른 기기로 확인하는 게 낫습니다.

끊는 것부터. 대화를 이어가면 판단력이 무너지도록 설계된 공격입니다. 일단 끊는 게 첫 단계입니다.

시스템 측면

금융권은 AI 기반 FDS(이상거래탐지시스템)로 대응하고 있습니다. KB국민은행은 FDS로 작년에 약 1,720억원 규모의 피해를 차단했다고 밝혔습니다. 사람이 속아도 거래 패턴에서 이상을 잡아내는 구조인데, 개인의 주의력에 의존하지 않는다는 점에서 방향이 맞다고 봅니다.

제도 쪽도 움직입니다. 금융회사의 고의·과실 여부와 무관하게 일정 금액을 배상하도록 하는 통신사기피해환급법 개정안이 국회에 계류돼 있습니다. 최대 5천만원 범위에서 시행령으로 정하는 방안이 거론됩니다. 무과실 배상은 금융사에 큰 부담이지만, 그만큼 예방 투자를 강제하는 효과가 있죠.

정리

앞서 패스키 글에서 "보안을 사람의 판단에서 프로토콜로 옮기는 게 맞는 방향"이라고 썼는데, 여기도 같은 얘기가 됩니다. 목소리는 생체 정보처럼 보이지만 복제 가능한 데이터일 뿐이라, 단독 인증 수단으로 신뢰할 수 없습니다.

서비스를 만드는 입장이라면 음성 확인을 인증 절차의 일부로 두고 있는지 점검해볼 만합니다. 그리고 개인적으로는, 가족들과 암호 하나 정해두시길 권합니다. 이 글에서 실질적으로 가장 유용한 조언은 그거라고 생각합니다.