LLM
방대한 텍스트 데이터로 학습한 대형 언어 AI 모델
정의와 배경
LLM은 수천억 개 이상의 파라미터(가중치)를 보유한 신경망 모델로, 대규모 텍스트 코퍼스를 사전학습(pre-training)함으로써 언어의 문법·의미·맥락을 통계적으로 내재화한다. 2017년 구글이 발표한 트랜스포머(Transformer) 아키텍처가 LLM 발전의 결정적 토대가 되었으며, 이후 모델 규모와 학습 데이터가 급격히 확대되면서 성능이 비약적으로 향상되었다.
파라미터 수가 수십억~수천억 규모에 달하는 만큼, 학습과 추론 모두 GPU를 대량으로 집적한 AIDC(AI 데이터센터)에 의존한다. 대한민국의 AIDC 메가프로젝트(550조) 역시 이러한 LLM 수요 급증에 대응하기 위한 컴퓨팅 인프라 구축을 핵심 목표로 삼고 있다.
작동 원리와 주요 유형
LLM은 '다음 단어(토큰) 예측'이라는 단순한 자기지도학습(self-supervised learning) 목표로 사전학습된 뒤, 특정 과제에 맞게 미세조정(fine-tuning)하거나 RLHF(인간 피드백 강화학습) 등으로 정렬(alignment)한다. 사용자의 질문이 입력되면 모델은 학습된 확률 분포에 따라 토큰을 순차 생성하는 추론(inference) 과정을 거쳐 응답을 출력한다.
파생 유형으로는 경량화한 SLM(소형언어모델), 이미지·영상을 함께 처리하는 VLM(비전언어모델)·멀티모달LLM, 소스코드 생성에 특화된 코드LLM, 그리고 가중치가 공개된 오픈소스LLM 등이 있다. 각 유형은 활용 목적과 자원 제약에 따라 선택적으로 적용된다.
정책·산업적 중요성
LLM은 행정 문서 자동화, 민원 응대 챗봇, 법령 검색, 의료 기록 분석 등 공공 서비스 전반에 적용 가능성이 높아 정부 차원의 관심이 크다. 동시에 국내 LLM 경쟁력 확보 여부가 AI 산업 생태계의 자립도를 결정하는 핵심 변수로 부상하고 있다.
파운데이션 모델 개발에는 막대한 GPU 자원이 필요하므로, AIDC 인프라 투자와 LLM 역량은 사실상 불가분의 관계다. 또한 오픈소스LLM의 확산은 중소기업·스타트업의 진입 장벽을 낮추는 반면, 보안·저작권·환각(hallucination) 등 리스크 관리 과제도 함께 제기하고 있어 정책적 균형이 요구된다.