IT

정확도가 아니라 무엇을 표방하느냐

ndev-note 2026. 9. 30. 14:48

스마트워치가 심박 이상을 알려주고, 앱이 피부 사진을 찍어 분석해주는 시대입니다. 그런데 이런 기능 중 어떤 건 의료기기로 규제받고 어떤 건 아닙니다.

기준이 정확도일 거라고 생각했는데, 알아보니 아니었습니다. 사용목적이더군요.

같은 기능, 다른 분류



식약처는 헬스케어 소프트웨어가 의료기기에 해당하는지를 사용목적과 위해도로 판단합니다.

여기서 사용목적이란 제조자가 의도해서 표방한 기능과 용도입니다. 제품이 "질병을 진단, 치료, 예방한다"고 직접 표방하면 디지털의료기기에 해당할 가능성이 높습니다. 반대로 "건강 상태 참고용"이라고 하면 일반 건강관리 앱으로 분류되고요.

같은 알고리즘을 쓰더라도 "부정맥을 진단합니다"와 "심박 패턴을 기록합니다"는 규제 경로가 갈립니다. 전자는 허가·심사를 거쳐야 하고 후자는 아닙니다.

이 기준이 합리적인 이유는 규제가 결국 사용자가 그 결과를 어떻게 받아들이느냐를 다루기 때문입니다. "진단"이라고 하면 사람들은 그걸 근거로 행동하고, 틀렸을 때 피해가 생깁니다. 정확도가 얼마든 그 구조는 같고요.

다만 부작용도 있습니다. 실질적으로 진단에 가까운 기능인데 표현만 완화해서 규제를 피하는 사례가 나올 수 있습니다. 그래서 식약처는 개인 건강관리용을 표방하더라도 실제 기능과 위해도를 함께 본다는 입장입니다.

생성형 AI가 들어오면서 생긴 문제

2025년 1월 식약처가 생성형 인공지능 의료기기 허가·심사 가이드라인을 내놨습니다. 기존 의료 AI와 성격이 달라서 별도 기준이 필요했던 거죠.

기존 의료 AI는 대개 분류 문제를 풀었습니다. 영상을 보고 병변 유무를 판정하는 식이요. 입력과 출력이 정해져 있어서 성능 검증이 상대적으로 명확했습니다.

생성형 AI는 다릅니다. 출력이 열려 있고, 환각이 발생할 수 있습니다. 의료 맥락에서 그럴듯한 거짓을 생성하는 건 위험도가 다른 문제죠.

가이드라인이 강조하는 항목들을 보면 방향이 드러납니다. 편향 가능성을 사전에 점검하는 데이터 전략, 의료인의 판단과 개입이 가능하도록 하는 시스템 설계, 환각과 편향에 대응하는 내부 윤리 기준.

6일차 AI 기본법에서 고영향 AI에 요구되는 것들, 19일차 AI 채용 글에서 다룬 설명 가능성과 같은 얘기입니다. 사람이 최종 판단에 개입할 수 있어야 한다는 원칙이 반복됩니다.

지금 어디에 쓰이나



영상 판독 보조가 가장 성숙한 영역입니다. 방사선, 초음파, 병리, 피부, 안과 영상 분석에 적용되고 있습니다.

지역 의료 격차 완화는 설득력 있는 활용처입니다. 정부가 지원하는 사례 중에 심전도 데이터로 부정맥 진단 정확도를 높이고 분석 근거까지 제시하는 AI가 있는데, 목표가 순환기내과 전문의가 없는 지역 병·의원의 심전도 판독 지원입니다.

이 방향이 중요한 이유는 AI가 전문의를 대체하는 게 아니라 전문의가 없는 곳을 메운다는 점입니다. 같은 기술이라도 어디에 배치하느냐에 따라 사회적 의미가 달라집니다.

기록 업무 자동화는 가장 빠르게 확산되는 영역입니다. 진단이 아니라 행정 부담을 줄이는 쪽이라 규제 부담도 적고 효과도 즉각적입니다.

남은 과제

데이터 편향. 학습 데이터에 특정 집단이 적게 포함되면 그 집단에서 성능이 떨어집니다. 피부 병변 진단 AI가 피부색에 따라 정확도 차이를 보인 사례가 대표적입니다. 데이터를 모으는 단계부터 다양성을 고려해야 하는데, 의료 데이터는 수집 자체가 어려워서 쉬운 문제가 아닙니다.

데이터 접근. 그래서 정부가 의료데이터 바우처 지원을 2025년 8개 과제에서 2026년 40개로 늘렸습니다. 보건의료빅데이터플랫폼에 국립대병원 임상데이터를 연계하고, 2028년까지 국가통합바이오빅데이터를 77만 명 규모로 구축해 단계적으로 개방할 계획이고요.

검증 체계. 성능이 좋다고 발표하는 것과 실제 임상 환경에서 효과가 있는 건 다릅니다. 2026년에 20개 의료 AI 실증 과제를 지원하는 것도 이 간극을 메우려는 시도입니다. 37일차 전고체 배터리, 28일차 휴머노이드에서 반복적으로 나온 "시연과 실전의 거리" 문제가 의료에서는 더 엄격하게 다뤄져야 하는 영역입니다.

정리

의료 AI 규제의 핵심은 기술 성능이 아니라 책임 구조입니다. 누가 판단하고 누가 책임지는가.

그래서 지금 방향은 AI가 결정하는 게 아니라 의료진이 더 잘 결정하도록 돕는 쪽으로 정리되고 있습니다. 개발하는 입장에서는 "얼마나 정확한가"만큼 "판단 근거를 어떻게 보여줄 것인가"가 요구사항이 된 셈입니다.