AI 요금표에 나오는 '100만 토큰당 3달러', 대화가 길어지면 나오는 '컨텍스트 초과' 오류. 이 두 가지를 이해하려면 토큰(token)과 컨텍스트 윈도우(context window)라는 개념만 알면 됩니다.
토큰: AI가 글을 읽는 단위
사람은 글자나 단어 단위로 읽지만, LLM은 토큰이라는 조각 단위로 읽고 씁니다. 레고 블록에 비유하면, 자주 쓰이는 단어는 큰 블록 하나로, 드문 단어는 작은 블록 여러 개로 쪼개지는 식입니다. 영어에서 'apple'은 토큰 1개지만, 긴 전문용어는 2~3개로 나뉩니다.
한글은 영어보다 토큰 효율이 낮은 편입니다. 영어는 대략 단어 1개가 토큰 1~1.3개인 반면, 한글은 한 글자가 토큰 1~2개로 쪼개지는 경우가 많습니다. 즉 같은 내용이라도 한국어로 쓰면 영어보다 토큰을 더 많이 소비합니다. 대략적인 감각으로는 '한글 1글자 = 토큰 1~2개', 'A4 한 장 분량의 한국어 = 1,000~2,000토큰' 정도로 기억하시면 됩니다.
- '안녕하세요' — 대략 2~4토큰
- 카톡 메시지 한 줄 — 대략 10~30토큰
- A4 한 장 분량의 한국어 문서 — 대략 1,000~2,000토큰
- 300쪽짜리 책 한 권 — 대략 15만~25만 토큰
컨텍스트 윈도우: AI의 작업 책상
컨텍스트 윈도우는 모델이 한 번에 볼 수 있는 토큰의 최대량입니다. 책상에 비유하면, 책상 위에 올려둔 서류만 보면서 일할 수 있고 책상 크기를 넘는 서류는 바닥에 떨어져 보이지 않게 되는 것과 같습니다. 2026년 기준 주요 모델은 20만~100만 토큰 이상의 컨텍스트를 지원하지만, 무한하지는 않습니다.
중요한 사실 하나. 챗 서비스에서 대화를 이어갈 때, AI는 매번 지금까지의 대화 전체를 처음부터 다시 읽습니다. 사람처럼 '기억'이 쌓이는 게 아니라, 매 턴마다 대화록 전체를 컨텍스트 윈도우에 넣고 다음 답을 생성하는 것입니다. 그래서 대화가 한도를 넘으면 오래된 앞부분부터 잘려 나가고, AI가 초반에 말한 내용을 '잊은 것처럼' 행동하게 됩니다.
왜 대화가 길어지면 품질이 떨어질까요?
- 앞부분 유실: 컨텍스트 한도를 넘으면 초반 대화가 잘려 나가 지시사항을 잊습니다.
- 주의력 분산: 컨텍스트가 길수록 중간에 있는 정보를 놓치는 경향이 있습니다(중간 소실 현상).
- 비용 증가: API 사용 시 매 턴마다 전체 대화를 다시 읽으므로 토큰 비용이 눈덩이처럼 불어납니다.
주제가 바뀌면 새 대화를 시작하는 것이 가장 쉬운 최적화입니다. 긴 프로젝트라면 중간중간 ' 지금까지 결정된 내용을 요약해 줘'라고 요청한 뒤, 그 요약본으로 새 대화를 시작해 보세요. 품질과 속도가 눈에 띄게 좋아집니다.
컨텍스트 윈도우가 크다고 해서 문서를 무조건 통째로 붙여넣는 것이 좋은 전략은 아닙니다. 관련 있는 부분만 골라 넣을수록 답변의 정확도가 올라갑니다.