IT

AI가 서버를 떠나 내 기기로 들어온다 - 온디바이스 AI와 NPU

ndev-note 2026. 8. 29. 12:21



노트북 살 때 CPU 몇 코어인지, 램은 몇 기가인지 보는 게 오랜 습관이었습니다. 그런데 요즘 스펙표를 보면 낯선 줄이 하나 더 붙어 있습니다. NPU 40 TOPS, 이런 식으로요.

AI가 전부 클라우드에서 돌아가는 줄 알았는데, 왜 내 노트북에 AI 전용 칩이 들어가고 있을까요. 온디바이스 AI 얘기를 정리해봤습니다.

서버로 안 보내고 기기에서 처리한다

온디바이스 AI는 말 그대로 AI 연산을 기기 내부에서 끝내는 방식입니다. 클라우드 AI가 데이터를 서버로 보내고 결과를 받아오는 구조라면, 이건 왕복 자체가 없습니다.



장점은 셋입니다. 네트워크 왕복이 없으니 지연이 사라지고, 오프라인에서도 동작하고, 무엇보다 데이터가 기기 밖으로 나가지 않습니다.

마지막 항목이 생각보다 큽니다. 통화 녹음 요약이나 사진 속 인물 인식 같은 기능은 클라우드로 보내는 순간 개인정보 이슈가 걸립니다. 기기 안에서 처리하면 그 논쟁 자체를 우회할 수 있죠. 갤럭시 워치의 심전도 분석이 기기 내에서 돌아가는 것도 같은 맥락입니다.

부수적으로 서비스 제공자 입장의 이득도 있습니다. 추론 비용이 사용자 기기로 넘어가니까요. 사용자 수만큼 GPU를 쌓아야 하는 클라우드 방식과 비교하면 원가 구조가 달라집니다.

NPU가 뭐길래

CPU도 GPU도 있는데 왜 또 새 칩이냐 싶은데, 역할이 다릅니다.



AI 연산은 결국 행렬 곱셈의 반복입니다. 복잡한 분기 처리는 거의 없고 단순 계산이 어마어마하게 많은 형태죠. CPU는 복잡한 일을 순서대로 잘 처리하도록 만들어져서 이런 물량전에 비효율적이고, GPU는 잘하긴 하는데 전력을 많이 먹습니다.

NPU는 그 반복 연산만 하도록 특화해서 전력 대비 성능을 끌어올린 칩입니다. 배터리로 돌아가는 스마트폰에서는 이 차이가 결정적입니다. 성능 단위로 TOPS(초당 조 단위 연산)를 쓰는데, 코파일럿+ PC 요건이 40 TOPS 이상인 것도 여기서 나온 기준입니다.

어디까지 와 있나

스마트폰은 이미 일상입니다. 야간 모드 사진 보정, 실시간 통번역, 음성 인식 상당수가 기기 안에서 돌아갑니다. 삼성은 엑시노스 NPU를 키워왔고 구글의 Gemini Nano, 안드로이드 AICore와 엮여 있습니다.

PC 쪽은 인텔 코어 울트라 시리즈가 40 TOPS급 NPU를 얹으면서 판이 열렸습니다. 화상회의 배경 처리, 실시간 자막, 로컬 요약 같은 기능이 인터넷 없이 돌아갑니다.

자동차와 가전으로도 번지는 중입니다. 제네시스 GV80이 차량 카메라 12개 데이터를 클라우드 없이 실시간 분석한다는 사례가 그렇고, 이쪽은 지연이 안전과 직결되니 온디바이스가 선택이 아니라 필수인 영역입니다.

그렇다고 클라우드가 사라지진 않는다

여기서 냉정해질 필요가 있습니다. 기기에서 돌릴 수 있는 모델은 파라미터를 줄이고 양자화한 경량 모델(sLLM)입니다. GPT급 대형 모델을 스마트폰에 넣는 건 메모리와 전력 양쪽에서 불가능합니다.

그래서 실제로는 하이브리드로 갑니다. 간단한 요약, 음성 인식, 이미지 처리는 기기에서 즉시 처리하고, 무거운 추론은 클라우드로 넘기는 식으로요. 애플 인텔리전스가 취한 구조도 이겁니다.

개발자 입장에서 알아둘 만한 건, NPU를 쓰려면 애플리케이션이 ONNX Runtime, DirectML, OpenVINO 같은 가속 프레임워크를 지원해야 한다는 점입니다. 칩이 있다고 자동으로 빨라지지 않습니다. 프론트 쪽에서도 WebNN 같은 표준이 논의되고 있어서, 브라우저에서 NPU를 쓰는 그림도 멀지 않았습니다.

정리

온디바이스 AI는 성능 경쟁이라기보다 비용과 프라이버시 문제에 대한 답에 가깝습니다. 모든 걸 클라우드에서 돌리는 건 비싸고, 개인 데이터를 전부 서버로 보내는 것도 부담이니까요.

노트북이나 폰을 새로 살 계획이 있다면 NPU TOPS 수치를 한 번쯤 보시길. 지금 당장은 활용처가 제한적이지만, 앞으로 몇 년간 기기 수명을 가르는 스펙이 될 가능성이 높습니다.