한글 공감
특집기사7

인공지능 시대 한국어와 한글의 현재와 미래

박진호 (서울대 국어국문학과 교수)

박진호 서울대 국어국문학과 교수 프로필 사진이다.
생성형 인공지능, 특히 대형언어모델(large language model, 이하 LLM)이 급속히 발달하면서 많은 사람들의 업무, 연구, 일상 생활 속에 깊숙이 스며들고 있다. 이것이 인간의 삶, 특히 언어 생활에 점점 더 큰 영향을 끼칠 터이므로, 그 성질에 대해 잘 알 필요가 있다. 특히 한국어와 한글을 통해 LLM과 소통할 때 어떤 특징이나 함정이 있는지 알아 두면 좋을 것이다.
첫째, LLM 사용시의 토큰 소비량의 문제가 있다. LLM에게 동일한 내용을 영어로 물었을 때에 비해 한국어로 물으면 토큰 소비량이 두 배쯤 된다. LLM을 포함한 인공 신경망은 입력으로 들어온 문장을 우선 토큰 단위로 쪼개는데, 이를 토큰화라고 하고, 토큰화를 자동으로 수행하는 컴퓨터 프로그램을 토크나이저라고 한다. 하나의 토큰은 하나의 단어와 일치하는 경우도 있고 단어보다 작은 단위인 경우도 있다. ‘I love you.’라는 영어 문장을 토큰화하면 ‘I’, ‘love’, ‘you’, ‘.’ 이렇게 4개의 토큰으로 쪼개진다. 반면에 ‘나는 너를 사랑한다.’라는 한국어 문장을 토큰화하면 ‘나’, ‘는’, ‘너’, ‘를’, ‘사랑’, ‘한’, ‘다’, ‘.’ 이렇게 8개의 토큰으로 쪼개진다. (모델에 따라 토큰화 방식에 차이가 있긴 하나, 대략적인 수치는 이러하다.)
유료 LLM은 사용자가 입력한 질문과 그에 대해 LLM이 생성한 답변 전체의 토큰 수에 비례해서 요금을 부과한다. 따라서 동일한 내용을 LLM에게 질문했을 때, 영어 사용자에 비해 한국어 사용자는 2배의 요금을 내게 되는 것이다. 무료 LLM이라고 마냥 마음 편하게 생각할 수는 없다. LLM과 대화할 때 질문과 대답의 토큰 수만큼 전기와 전산 자원이 소비되며, 전 세계의 인공지능 사용량이 엄청나고 점점 증가하고 있으므로 이것이 환경에 미치는 영향도 상당하다. 영어에 비해 한국어로 LLM과 소통하면 환경에 2배의 악영향을 미치는 셈이므로 사용자의 마음이 불편할 수 있다.
이렇게 된 데는 한국어와 한글의 특성이 영향을 미친 탓도 있지만, 현재 널리 사용되는 토크나이저가 한국어의 특성을 존중하지 않고 있는 탓이 크다. 한국어는 하나의 어절이 ‘체언 + 조사’, ‘용언 어간 + 어미’의 구조로 되어 있는 경우가 많은데, 토크나이저는 이렇게 복수의 형태소로 이루어진 어절을 형태소 단위로 쪼개는 게 이상적이다. 예컨대 ‘나는 너를 사랑한다.’라는 문장은 ‘나’, ‘는’, ‘너’, ‘를’, ‘사랑하’, ‘ㄴ다’, ‘.’와 같이 쪼개는 것이 좋다. 그래야 각 토큰이 나름의 고유한 의미를 유지할 수 있고, LLM이 그 후의 처리를 할 때도 전체 문장의 의미가 충실하게 보존될 수 있다. 그런데 현재 널리 사용되고 있는 토크나이저는 특정 언어에 종속되지 않고 모든 언어, 모든 문자에 적용되는 범용 알고리즘을 사용하고 있고, 그저 어떤 글자들이 인접해서 자주 출현하는가 하는 통계적 정보만을 고려한다. 그래서 한글 한 글자가 초성, 중성, 종성으로 이루어져 있다는 것, 어떤 음절은 2개의 형태소로 이루어져 있다는 것(예: 난=나+ㄴ) 같은 한국어나 한글에 특화된 지식은 전혀 고려하지 않는다. 이런 토큰화 방식은 한국어 문장의 의미를 정확히 포착하는 데 장애물이 될 수 있고, 또 다른 한편으로는 너무 잘게 토큰화하여 토큰 비용을 상승시키는 요인도 되고 있다. 미래에는 한국어와 한글의 특성을 충분히 존중하는 토크나이저와 LLM이 개발될 필요가 있다.
인공지능을 형상화한 이미지다. 붉은색과 보라색 배경 위에 점과 선으로 연결된 사람의 옆얼굴과 여러 개의 원형 도식이 표현되어 있다. 서울대학교 AI연구원(AIIS) 소개 책자에 수록된 이미지다.

출처: 서울대학교 AI 연구원(AIIS) 소개 책자

둘째, LLM이 내놓는 답변에서의 환각(hallucination) 현상, 그리고 환각과 LLM 훈련 자료의 관계를 이해할 필요가 있다. 최근 나오는 LLM들은 온갖 텍스트, 특히 인터넷에서 구할 수 있는 엄청난 양의 텍스트를 자료로 하여 훈련시킨다. 훈련 자료 전체를 그대로 통째로 기억하는 것은 아니지만 훈련 자료를 인공 신경망 속에 압축해서 저장한다고 할 수 있다. 그런데 인터넷에서 쉽게 구할 수 없는 자료는 LLM의 훈련 자료에 포함되지 않기 십상이고, LLM은 훈련 시에 접하지 못했던 것에 대해 질문을 받으면, 훈련 시에 보았던 자료들을 짜깁기해서 답변을 날조해 내고 이 때문에 환각 현상이 생긴다. 마치 학생이 시험을 볼 때 공부하지 않은 데서 문제가 나오면 공부한 내용을 이리저리 짜깁기해서 겉보기에 그럴듯하게 답변을 작성하는 것과 비슷하다.
최근 나오고 있는 LLM의 훈련 자료는 영어, 중국어 같은 패권 언어로 된 것이 대종을 이루며, 한국어를 포함한 기타 언어의 자료는 비중이 매우 적다. 따라서 영어 등의 패권 언어로 된 자료에서는 찾을 수 없고 한국어로 된 자료에서만 찾아볼 수 있는 내용에 대해 물으면, 그것이 LLM의 훈련 자료에 포함되지 않았을 가능성이 높고, 환각이 일어날 가능성도 그에 비례해서 높아진다. LLM이 일반화되기 전에도 구글 같은 검색 사이트에서 같은 내용을 영어로 검색했을 때에 비해서 한국어로 검색하면 검색 결과의 품질이 한결 떨어지는 현상이 있었는데, LLM에서도 마찬가지로 같은 질문을 영어로 했을 때에 비해 한국어로 하면 답변 품질이 떨어지고 환각이 더 잘 일어나는 현상이 있는 것이다. LLM의 환각을 줄이고 답변 품질을 높이는 것이 중요한 과제로 대두하고 있고, 한국어를 포함한 비패권 언어의 경우 그 과제가 더 첨예하게 문제가 되고 있다.
이 문제에 대한 빠른 해결책은 찾기 어려울 것이다. 시간이 매우 많이 걸리겠지만 한국어로 된 인터넷 콘텐츠의 양을 늘리고 질을 높이는 것이 정공법이다. 한국이 여러 측면에서 엄청나게 발전해서 선진국 대열에 들어섰다고 하지만, 몇몇 분야나 측면에서는 아직 갈 길이 멀다. 위키백과에 수록된 항목의 수, 각 항목에 대한 설명의 양과 질에서 한국어 위키백과는 한국의 경제적 지위에 비해 순위가 한참 떨어진다. 상당히 전문적인 것을 검색하면 영어로 된 유익한 웹사이트는 많이 나오지만 한국어로 된 웹사이트는 훨씬 적고 그 품질도 떨어지는 일이 많다. 가끔 한국어로 된 전문 지식 웹사이트가 나오는데, 원래 영어로 돼 있는 웹사이트를 그냥 기계번역한 수준이라서 한국어 문장이 매우 부자연스러워 읽기에 꺽꺽한 경우도 많다. 양질의 웹 콘텐츠를 꾸준히 늘려 가면 한국어 검색 품질, LLM의 한국어 답변 품질도 그에 비례해서 향상될 것이다.
사람의 손과 흰색 로봇 손이 서로 악수하고 있다. 서울대학교 AI연구원(AIIS) 소개 책자에 수록된 이미지다.

출처: 서울대학교 AI 연구원(AIIS) 소개 책자

셋째, LLM 훈련 자료의 독성(毒性, toxicity) 문제가 있다. LLM은 훈련 시에 공부한 텍스트의 언어적 패턴을 고스란히 모방하여 텍스트를 생성한다. 만약 훈련 자료 속에 비윤리적인 내용, 부적절한 말이 들어 있다 하더라도 인공신경망은 이를 구별하지 않고 학습한다. LLM이 유해한 텍스트를 생성하지 않도록 하기 위해, 우선 훈련자료에서 유해한 것들을 걸러내면 좋을 것이다. LLM을 만드는 회사들이 그러한 노력을 하기는 하지만, 유해 콘텐츠를 완벽히 걸러내는 것은 쉬운 일이 아니다. 그 다음으로, LLM의 사전 훈련(pre-training)이 끝난 뒤 사후 훈련(post-training) 단계에서 유해한 텍스트를 생성하지 않도록 하는 기법이 많이 사용되고 있다. 비유하자면, LLM은 인간이 내뱉은 온갖 유해한 말들을 일단은 고스란히 배우지만, 그 다음 단계에서 사후적 노력으로 유해한 말을 내뱉지 않도록 참는 훈련을 추가로 하는 셈이다.
어떤 언어의 웹 콘텐츠에 유해한 것이 많으면 많을수록 LLM이 그 언어로 답변을 할 때 유해 콘텐츠를 생성하지 않도록 하는 일 역시 점점 더 어려워진다. 비유를 이어서 하자면, 아이가 밖에 나가서 듣는 말 중에 욕설이 매우 적다면 그 아이가 욕설을 하지 않도록 하는 게 쉽지만, 아이가 밖에 나가서 욕설을 엄청나게 많이 듣고 온다면 그 아이가 욕설을 하지 않게 하기가 어려워질 것이다. 그렇다면 한국어로 된 웹 콘텐츠에서 유해한 것을 줄이려는 노력이 필요하다. 뉴스 기사의 댓글, SNS, 프로야구나 바둑 같은 경기 생중계 사이트의 댓글 창 등을 보면 폭력적인 말들이 쏟아져 나오고 있다. 이것을 정부 당국이 검열하거나 걸러내는 것도 이상적인 일은 아니므로, 인터넷 사용자들이 스스로 알아서 유해한 말을 자제하는 것이 좋다. 내가 인터넷에 올린 말 한 마디 한 마디가 인공지능을 훈련시키는 자료로 사용됨을 기억할 필요가 있다.
이상으로 인공지능 시대에 한국어, 한글과 관련하여 생각해 볼 거리를 세 가지 제시했다. 인공지능이 한국어로 훌륭한 콘텐츠를 우리에게 제공하게 하려면 우리 스스로 노력할 필요가 있다. 그것은 인공지능을 만드는 전문가뿐 아니라 우리 모두의 몫이다.