가이드 › 1장. AI 핵심 용어
토큰, 컨텍스트 윈도우, 할루시네이션
AI 사용량을 재는 토큰, 한 채팅창의 용량인 컨텍스트 윈도우, 그럴듯한 오답인 할루시네이션을 실무에서 조심할 점 중심으로 정리합니다.
이 장에서 할 일
토큰이 무엇이고 언제 닳는지, 토큰을 아끼는 원칙과 구독 한도·API 요금이 어떻게 매겨지는지 이해합니다. 컨텍스트 윈도우가 찼을 때 생기는 문제와 할루시네이션이 생기는 이유, 대비하는 방법을 익힙니다.
AI를 실무에 오래 쓰다 보면 한 시간째 이어 온 대화에서 처음에 부탁한 표 양식을 AI가 어느새 잊어버리거나, 한창 일하는 중에 "사용량 한도에 도달했습니다"라는 메시지가 뜨거나, 자신 있게 인용한 기준서 문단이 실제로는 없는 경우를 겪게 됩니다. 세 가지는 서로 다른 문제처럼 보이지만 모두 AI가 글을 읽고 쓰는 방식에서 비롯되며, 이를 이해하는 데 필요한 용어가 토큰, 컨텍스트 윈도우, 할루시네이션입니다.
이번 장에서는 세 용어의 뜻은 짧게 설명하고, 실무에서 무엇을 조심해야 하는지에 무게를 두어 차례로 살펴보겠습니다.
1. 토큰
1.1. AI 사용량을 재는 단위
'토큰(Token)'은 지금까지 글 곳곳에서 계속 등장했던 용어입니다. 1.1장에서는 "코드가 실행되는 동안에는 토큰이 들지 않는다"고 말씀드렸고, 1.2장에서는 이미지를 넣으면 토큰을 훨씬 많이 쓴다고 했으며, 도입에서 두 번째로 든 "사용량 한도에 도달했습니다"라는 메시지도 결국 이 토큰을 다 썼다는 뜻입니다. 모두 같은 대상을 가리키는 용어이므로, 여기서 다시 한번 정리해 보겠습니다.
LLM은 오직 글을 읽고 쓰는 AI이며, 토큰은 AI가 글을 읽고 쓰는 최소 조각의 단위이자, 요금과 사용량 한도가 매겨지는 단위입니다. 대부분의 LLM 서비스는 이 토큰 단위로 사용량, 즉 비용을 책정합니다. 전기를 쓸 때 계량기가 kWh 단위로 돌아가듯 AI를 쓸 때는 토큰 단위로 계량기가 돌아가며, 다음 절에서 살펴볼 한 채팅창의 기억 용량도 토큰 단위로 매겨집니다.
토큰, AI 사용량을 재는 단위
그림은 세 칸으로 구성되어 있으며, 이 절에서는 각 칸의 내용을 차례로 풀어 보겠습니다.
- 왼쪽: 토큰이 무엇인지
- 가운데: 토큰이 언제 쓰이는지
- 오른쪽: 그 사용량에 한도와 값이 어떻게 매겨지는지
토큰은 한글의 한 음절이나 영어의 한 단어와 정확히 일치하지는 않습니다. AI는 글을 글자 단위도 단어 단위도 아닌 조각 단위로 읽는데, 예를 들어 "대손충당금을"은 '대', '손', '충당', '금', '을'처럼 여러 조각으로 나뉠 수 있습니다.
또한 언어마다 쪼개지는 조각 수가 다릅니다. 모델이 글을 조각내는 방식은 영어 중심으로 짜인 경우가 많고, 한국어는 단어의 어미 변화와 음절 결합 구조 때문에 같은 뜻이라도 영어보다 대체로 1.5~2배 잘게 쪼개지며 그 차이의 크기는 모델마다 다릅니다. 그렇다고 한국어 사용을 피할 필요는 없고, 긴 한국어 자료를 넣을 때 그만큼 여유를 잡아 두면 됩니다.
같은 뜻도 한국어는 더 잘게 쪼개진다, 조각 수가 곧 사용량이다
1.2. 언제 닳나
우리에게 중요한 것은 토큰의 사전적 의미보다 "토큰이 언제 소모되고, 어떻게 해야 아껴 쓸 수 있는가"입니다. 토큰은 딱 두 가지 경우, 즉 AI가 글을 읽을 때(입력)와 글을 쓸 때(출력)에만 소모됩니다.
- 입력(읽을 때): 내가 입력한 질문, 첨부한 파일, 스킬, MCP로 가져온 자료를 AI가 읽을 때 듭니다.
- 출력(쓸 때): 답변과 코드를 쓸 때, 그리고 답하기 전에 혼자 생각하는 과정에서 듭니다.
생각하는 과정에도 토큰이 드는 이유는 AI가 글을 써 내려가는 방식으로만 생각할 수 있기 때문입니다. '생각 중…'이 떠 있는 동안 AI는 사람처럼 머릿속으로 조용히 고민하지 않고, 우리에게 보이지 않는 연습장에 풀이 과정을 한 조각씩 적어 내려갑니다. 이 풀이도 AI가 쓴 글이므로 출력 토큰으로 계산되며, 1.1장에서 살펴본 추론 수준을 높이면 연습장이 길어지는 만큼 토큰도 더 듭니다.
반면 1.1장에서 살펴본 것처럼 AI가 쓴 코드를 컴퓨터가 실행하는 동안에는, 실행이 10초 걸리든 1분 걸리든 토큰이 들지 않습니다. 코드 실행은 모델이 관여하지 않고 컴퓨터가 맡는 일이기 때문입니다.
같은 내용이라도 어떤 형태로 건네느냐에 따라 드는 토큰의 양이 크게 달라집니다.
| 같은 자료를 건네는 방식 | 토큰 | 이유 |
|---|---|---|
| 마크다운·일반 텍스트·표 | 적다 | 글자와 최소한의 구조 기호뿐 |
| 텍스트가 살아 있는 PDF | 수 배 | 머리글·쪽번호 같은 잡음이 섞이고, 서비스에 따라 페이지 이미지까지 함께 읽는다 |
| 스캔 PDF·사진 | 수십 배 | 이미지로 들어가므로 글자 수와 무관하게 해상도에 따라 토큰이 매겨진다 |
토큰 열은 같은 분량을 기준으로 한 대략의 방향입니다. 실제 수치는 모델과 서비스마다 다릅니다.
따라서 자료는 가능하면 표와 텍스트로 건네는 것이 좋습니다. 두고두고 물어볼 스캔 계약서라면 AI에게 한 번 텍스트로 옮기게 하고 그 결과를 사람이 검토해 파일로 남겨 두면, 이후의 질문은 매번 적은 토큰으로 검토된 원문 위에서 처리됩니다.
1.3. 토큰을 아끼는 네 가지 원칙
지금까지 다룬 내용들을 종합하면, 실무에서 토큰을 아끼기 위해 기억해야 할 핵심 원칙은 다음 네 가지입니다.
- 코드를 실행할 때는 토큰이 전혀 소모되지 않습니다.
AI가 코드를 작성하는 순간에만 출력 토큰이 들 뿐, 작성된 코드가 컴퓨터에서 수만 줄의 데이터를 처리하는 동안에는 토큰이 들지 않습니다. - 이미지나 스캔본보다 텍스트와 마크다운으로 넘겨야 토큰이 적게 듭니다.
같은 내용이라도 이미지를 텍스트로 판독해 읽는 과정은 순수 텍스트보다 수십 배 많은 입력 토큰을 소모합니다. - 상위 모델을 쓸수록, 추론 수준을 높일수록 토큰 소모량이 크게 늘어납니다.
상위 모델은 단가 자체가 높을뿐더러, AI가 답변하기 전에 혼자 거치는 깊은 생각(추론 과정) 역시 보이지 않는 연습장에 쓰는 출력 토큰으로 고스란히 계산되기 때문입니다. - 대화가 길어질수록(컨텍스트 윈도우가 가득 찰수록) 토큰 소모량이 불어납니다.
AI는 질문을 던질 때마다 이전 대화 맥락 전체를 처음부터 다시 읽으므로, 한 대화창을 오래 쓸수록 질문 한 번에 소모되는 입력 토큰이 계속 누적됩니다. 컨텍스트 윈도우는 다음 절에서 다룹니다.
1.4. 토큰 예산: 구독 한도와 요금표
토큰은 곧 예산이며, 클로드를 쓰는 방식에 따라 예산이 매겨지는 모양이 다릅니다(2026년 9월 기준, 수시로 바뀜).
우리가 흔히 쓰는 챗GPT Plus나 Claude Pro 같은 구독 요금제는 월정액이지만 무제한이 아닙니다. 클로드의 경우 5시간마다 초기화되는 세션 한도와 주간 한도가 함께 걸려 있어 이것이 곧 토큰 예산이 되며, 작업 중 "사용량 한도에 도달했습니다"라는 메시지가 떴다면 주어진 토큰 예산을 다 쓴 상태입니다. 이 시리즈의 실습을 따라 하다가도 이 메시지를 만날 수 있으며, 지금 얼마나 썼는지와 언제 초기화되는지는 설정 → 사용량에서 확인합니다.
한도가 빨리 줄어드는 이유는 개발자용 API 요금표에서 분명히 드러납니다. API는 개발자가 프로그램에서 모델을 부를 때 쓰는 방식으로, 쓴 만큼 돈을 내며 100만 토큰당 가격은 다음과 같습니다.
| 모델 | 입력 | 출력 |
|---|---|---|
| Haiku 4.5 | $1 | $5 |
| Sonnet 5 | $2 | $10 |
| Opus 5.5 | $4 | $20 |
| Opus 5 | $5 | $25 |
- 출력 토큰은 입력 토큰보다 5배 비쌉니다. (Sonnet 5 기준 입력 $2 vs 출력 $10)
- 상위 모델은 경량 모델보다 5배 비쌉니다. (입력 기준 Haiku 4.5 $1 vs Opus 5 $5)
긴 대화 누적, 무거운 PDF 첨부, 커넥터로 가져오는 많은 자료, 상위 모델과 높은 추론 수준이 결합하면 유료 구독 한도가 순식간에 소진됩니다. 이 시리즈의 실습은 구독 요금제로 진행하므로 API 요금을 직접 낼 일은 없지만, 이 비율을 알아 두면 어떤 작업이 한도를 빨리 닳게 하는지 가늠하는 데 도움이 됩니다.
하지만 위의 네 가지 원칙을 잘 기억하고 실천한다면 불필요한 토큰 낭비를 크게 줄일 수 있고, 실무 자동화 정도라면 굳이 비싼 요금제를 구독하지 않아도 충분할 수 있습니다.
2. 컨텍스트 윈도우
1.2장에서 AI에게 건네는 정보를 컨텍스트라고 했는데, 이 컨텍스트에는 용량의 한계가 있습니다. 컨텍스트 윈도우(Context Window)는 한 대화에서 AI가 한 번에 기억하고 읽어 낼 수 있는 용량, 곧 한 채팅창에 담을 수 있는 컨텍스트의 양입니다. 쉽게 말해 AI의 작업 기억을 담는 '책상'이라고 생각하면 되며, 내가 보낸 메시지와 첨부한 파일, 설정해 둔 지침, AI가 앞서 한 답까지 모두 이 책상 위에 올라갑니다.
컨텍스트 윈도우는 그동안 크게 넓어졌습니다. 챗GPT가 처음 나온 초창기(2022~2023년) 모델의 컨텍스트 윈도우는 약 4천 토큰, A4 몇 장 수준에 불과해서 PDF는 몇 장 이상 첨부할 수 없었고 대화가 조금만 길어져도 더 이어지지 않았습니다. 지금은 100만 토큰, 책 여러 권 분량까지 늘어나 웬만한 문서를 통째로 집어넣는 것도 가능해졌습니다.
컨텍스트 윈도우, 한 채팅창에 담기는 용량
그림 왼쪽의 막대 두 개가 그 변화로, 4천 토큰 막대는 100만 토큰 막대 옆에서 거의 보이지 않을 만큼 짧습니다. 하지만 이렇게 용량이 넉넉해졌다고 해서 한 대화창을 무작정 꽉 채워 쓰는 것은 피하는 편이 좋습니다. AI는 대화를 사람처럼 기억하지 않고, 답할 때마다 책상 위에 놓인 내용을 처음부터 다시 읽기 때문입니다.
대화가 길어질수록 책상이 차고, 맨 처음 준 규칙은 더미 아래로 묻힌다
이 때문에 컨텍스트 윈도우가 찰수록 두 가지 문제가 함께 커집니다.
첫째, 답변의 품질이 떨어집니다. 머릿속에 잡생각이 가득하면 일에 집중하기 어렵듯, AI도 지금 작업과 상관없는 정보가 쌓이면 엉뚱한 맥락을 끄집어내기 쉽습니다. 앞에서 시도했다가 버린 안이나 틀렸던 중간 결과가 치워지지 않고 남아 엉뚱한 답의 재료가 되고, 긴 대화의 초반에 준 지시는 뒤로 갈수록 덜 지켜집니다. 서비스에 따라서는 컨텍스트 윈도우가 넘치기 직전에 앞부분을 요약해 정리하면서 세부 조건이 빠지기도 하는데, 이 장 첫머리에서 든 '잊힌 표 양식'이 바로 이런 경우입니다.
둘째, 사용량과 비용이 증가합니다. AI는 대화를 이어 갈 때마다 그때까지 쌓인 맥락을 처음부터 다시 읽습니다. 한 줄짜리 질문을 던져도 그 앞의 긴 대화를 전부 다시 읽으므로, 대화가 길어질수록 질문 한 번에 읽는 양이 늘어나고 앞 절에서 설명한 한도도 그만큼 빨리 닳습니다.
따라서 컨텍스트 윈도우가 넓어졌더라도 꽉 채워 쓰지 말고, 새 작업은 새 채팅창에서 시작합니다. 실무에서 지킬 요령은 다음 세 가지입니다.
- 작업 단위마다 새 대화: 오전에 정산표를 다룬 대화에서 오후의 주석 작업까지 이어 가지 말고, 필요한 결론 몇 줄만 들고 새 대화로 옮깁니다. 예를 들어 작업을 마칠 때 "지금까지 확정된 설정률, 개별평가 대상, 최종 충당금 금액을 5줄 이내로 정리해 줘"라고 요청하고, 그 몇 줄만 복사해 새 대화의 첫머리에 붙여 넣는 식입니다.
- 필요한 시트와 범위만 전달: 엑셀은 워크북 전체를 건네기보다 '매출채권 시트의 A1:H200'처럼 좁혀 줄수록 컨텍스트가 깨끗하게 유지됩니다.
- 반복 요구는 대화 밖으로: 대화마다 첫머리에 붙여 넣던 양식 규칙은 지침이나 스킬로 고정해 둡니다. 이 둘은 1.4장에서 미리 살펴보고, 스킬은 3부에서 직접 만듭니다.
셋 중 하나만 고르라면 저는 첫째를 권합니다. 어지러워진 대화를 정리하는 가장 확실한 방법은 새 대화로 옮기는 것이고, 그때 무엇을 옮길지 고르는 과정에서 작업의 결론도 한 번 정리되기 때문입니다.
또한 Claude Code 같은 도구에서 지원하는 /compact(대화 내역의 군더더기를 털어 내고 핵심만 압축하는 기능)처럼 컨텍스트를 주기적으로 정리해 주는 기능을 활용하는 것도 좋은 방법입니다. 어떤 방식을 쓰든 필요한 핵심 맥락은 유지하면서 쌓인 잡음을 비우고 토큰 낭비를 줄이는 것이 핵심이며, 필요한 컨텍스트의 양이 많아질수록 무엇을 비울지가 더 중요해집니다.
3. 할루시네이션
하지만 컨텍스트에 근거가 없을 때도 AI는 '모르겠다'며 멈추지 않습니다.
3.1. 없는 문단을 자신 있게 인용한다
할루시네이션(환각, Hallucination)은 AI가 사실이 아니거나 모르는 내용을 마치 진실인 것처럼 그럴듯하게 지어내는 현상을 말합니다. AI에게는 속일 의도가 없다는 점에서 거짓말과는 다르며, 우리 실무에서 마주치는 가장 위험한 형태는 존재하지 않는 회계기준서 또는 세법 조문을 당당하게 지어내 인용하는 경우입니다.
예를 들어 재고자산 평가손실 환입 규정에 대해 AI에게 질의하면 다음과 같은 답변이 돌아오곤 합니다.
할루시네이션, 모르는 것도 그럴듯하게 지어낸다
그림 위쪽은 질문과 답입니다. "재고자산 평가손실 환입 근거 문단이 뭐야?"라는 질문에 AI는 K-IFRS 제1002호 문단 34의2에 따르면 평가손실 환입은 당기 매출원가에서 차감하고, 환입 한도는 문단 34의3에서 직전 3개년 평균으로 정한다고 답했습니다.
얼핏 보면 형식상 흠잡을 데가 전혀 없습니다. 기준서 번호(제1002호)가 정확하고, 실제 기준서처럼 문단 번호에 '의2', '의3'이 자연스럽게 붙어 있으며, 문체 또한 전형적인 기준서 문장입니다. 하지만 K-IFRS 기준서 원문을 직접 확인해 보면 제1002호에는 '문단 34의2'나 '문단 34의3'이라는 문단 자체가 존재하지 않으며, 그림의 도장이 이를 표시합니다.
이러한 답변이 특히 위험한 이유는 절반의 진실이 섞여 있기 때문입니다. 매출원가에서 차감한다는 설명은 실제 문단 34와 일치하지만, 없는 문단 번호와 잘못된 환입 한도 요건이 같은 확신의 어조로 나란히 적혀 있습니다. 맞는 내용이 섞여 있다 보니 실무자가 틀린 부분까지 덩달아 신뢰해 버리기 쉽습니다. 그림 아래 두 칸은 이런 일이 왜 생기는지와 어떻게 막는지를 보여 주며, 이 절의 나머지에서 차례로 다룹니다.
3.2. 왜 생기나
할루시네이션은 AI가 사용자를 악의적으로 속이려 해서 일어나는 일이 아닙니다. 1.1장에서 살펴본 LLM의 세 번째 단어, 즉 'Model(확률 모델)'이라는 본질에서 필연적으로 발생하는 구조적 현상입니다.
LLM은 사실 여부를 객관적으로 대조·검증한 뒤 글을 쓰지 않습니다. 1.1장의 대손충당금 예시처럼, AI는 앞선 단어 뒤에 올 "확률상 가장 그럴듯한 다음 단어"를 통계적으로 골라 이어 붙입니다. AI의 지식은 기준서를 한 권씩 꽂아 둔 서가보다는, 훈련 때 읽은 방대한 글에서 '어떤 말 뒤에 어떤 말이 오는가'의 패턴을 익혀 둔 것에 가깝습니다. 따라서 AI가 "제1002호 문단 34" 뒤에 "의2"라는 글자를 이어 붙이는 과정에는 해당 문단이 기준서에 실제로 있는지 확인하는 검증 절차가 원천적으로 결여되어 있고, 컨텍스트에 원문이 없으면 익힌 패턴만으로 빈칸을 채웁니다. 훈련 이후에 개정된 내용이라면 이런 일이 더 쉽게 일어납니다.
회계 실무에서 이 원리가 특히 까다로워지는 곳은 '구조화된 인용'입니다. 질의회신 번호, 기준서 문단 번호, 법령 조항처럼 정해진 틀이 있는 인용은 AI가 수없이 본 패턴이라 틀 자체는 쉽게 만들어지지만, 그 번호가 가리키는 실제 문서가 무엇인지는 패턴 속에 들어 있지 않습니다. 따라서 근거가 생명인 결산 검토 자료와 검토의견에서는 이 확인을 건너뛰는 순간 사고로 이어집니다.
할루시네이션은 1.1장에서 살펴본, 같은 질문에도 답이 조금씩 달라지는 성질과도 구분해 둘 필요가 있습니다. 둘 다 같은 확률 원리에서 나오지만 현상은 달라서, 할루시네이션은 답이 흔들리지 않아도 틀릴 수 있는 그럴듯한 오답입니다. 다섯 번 물어 다섯 번 모두 똑같이 없는 문단을 댈 수도 있습니다.
3.3. 어떻게 대비하나
할루시네이션에 대응하는 첫걸음은, AI 답변에 숫자, 법령 조문, 기준서 문단 번호가 등장할 때마다 출처를 명시하게 하고 원문을 직접 교차 검증하는 습관입니다. 질문 단계에서부터 검증 가능한 형태로 답변을 요구하면 실수를 대폭 줄일 수 있습니다.
근거 문단은 기준서 번호, 문단 번호, 원문 문장을 함께 제시해 줘.
원문을 직접 확인하지 못한 문단은 '미확인'으로 표시하고, 절대로 추정해서 지어내지 마.
그러나 이 지시문 역시 프롬프트라는 확률의 영역에 머물러 있습니다. AI는 출처마저 그럴듯하게 지어낼 수 있으므로, AI가 '확인 완료'라고 적어 낸 문단조차 사람이 원천 자료(공식 기준서 웹사이트 등)에서 최종 대조해야 합니다. 즉, 출처를 받고 원문에서 그 문단을 직접 확인하는 것까지가 한 세트입니다. AI의 답변은 정답이 아니라 '원문을 찾아가는 출발점'으로 삼고, 실제 업무에는 공인된 원천에서 직접 확인한 규정과 문장만을 옮겨 적어야 합니다.
더 근본적인 해결책은 근거를 기억에서 꺼내게 하지 말고, AI가 공인된 원문 데이터베이스를 직접 조회하게 하는 데 있습니다. 원문을 책상 위에 올려 주고 그 안에서 답하게 하는 방식이며, 이때 '붙여 준 자료에 없으면 없다고 답하라'는 한 줄을 함께 주면 빈칸을 패턴으로 채우는 일이 한층 줄어듭니다. 기준서 데이터를 실시간으로 조회하는 MCP(Model Context Protocol)를 연결하면, AI는 문단 번호를 임의로 지어내는 대신 실제 기준서 데이터베이스에서 문단 33과 34의 정확한 원문을 찾아내 출처와 함께 제시합니다. MCP의 뜻은 1.4장에서, 회계위키 MCP를 연결해 기준서를 직접 조회시키는 방법은 2부에서 다룹니다(질문에 맞는 문서를 먼저 찾아 넣어 주는 RAG는 부록 A).
정리
- 토큰은 AI가 읽고 쓰는 말의 조각이자 요금·한도의 단위이고, 읽을 때와 쓸 때만 들며 코드 실행에는 들지 않습니다. 한국어와 이미지·스캔 자료는 더 많이 씁니다.
- 구독은 5시간 세션 한도와 주간 한도로, API는 100만 토큰당 가격으로 매겨지며 상위 모델과 출력이 비쌉니다.
- 컨텍스트 윈도우는 4천에서 100만 토큰으로 넓어졌지만, 차면 품질이 떨어지고 토큰이 늘어나므로 새 작업은 새 채팅에서 합니다.
- 할루시네이션은 확률 원리의 부작용이라 0이 되지 않으므로, 출처를 받아 원문을 확인하고 MCP로 근거를 직접 조회하게 합니다.
지금까지 세 장에 걸쳐 AI를 실무에 쓰기 전에 알아야 할 개념을 살펴보았습니다. AI에게 일을 시키는 글이 프롬프트이고, 프롬프트를 작성하는 공식보다 중요한 것은 AI가 모르는 정보인 컨텍스트를 잘 전달하는 것입니다. 컨텍스트에는 컨텍스트 윈도우라는 용량의 한계가 있어 새 작업은 새 대화에서 시작하는 편이 좋고, AI가 쓰고 읽는 글의 형식은 마크다운이며, 이 모든 과정의 사용량은 토큰으로 계산됩니다. 다음 1.4장에서는 1부의 마지막 개념이자 이 시리즈의 핵심인 스킬과 MCP를 미리 살펴보겠습니다.
이 가이드 그대로 팀·조직 교육이 필요하신가요? 실무자 눈높이의 강의·워크숍으로 진행합니다.