온디바이스 추론은 모델의 계산을 사용자 기기에서 수행하는 방식입니다. 서버 요청을 줄일 수 있지만 모델 다운로드, 업데이트와 로그 같은 데이터 흐름도 함께 확인해야 합니다.
모델 크기와 메모리 요구
모델 가중치뿐 아니라 입력 길이와 생성 과정의 캐시가 메모리를 사용합니다. 작은 모델이나 양자화를 선택하면 사용량을 줄일 수 있지만 답변의 정확성과 지원 기능도 따로 평가해야 합니다. 매개변수 수만으로 모든 기기의 속도를 비교할 수는 없습니다.
브라우저에서의 실행
WebLLM은 브라우저에서 언어모델 추론을 수행하는 프로젝트입니다. WebGPU 지원과 실제 장치의 자원에 따라 동작 조건이 달라집니다. 브라우저 GPU 실행을 모든 모바일 기기의 NPU가 자동으로 사용되는 방식으로 설명하지 않습니다.
실제 앱에서의 점검
첫 실행의 다운로드 시간, 재실행 시간과 생성 속도를 나눠 측정합니다. 메모리 부족과 기능 미지원 상태의 안내도 확인합니다. 입력이 기기 안에서만 처리되는지 판단하려면 추론 경로 외에 분석·오류 보고·동기화 요청도 살펴야 합니다. “로컬 모델”이라는 이름만으로 개인정보가 절대 전송되지 않는다고 주장하지 않습니다.