AI 챗 서비스를 월 3만 원에 구독할 때는 비용을 크게 신경 쓰지 않게 됩니다. 그런데 같은 모델을 API로 연결해 자동화 파이프라인을 돌리기 시작하면, 어느 날 갑자기 예상치 못한 요금이 청구되어 당황하는 경우가 생깁니다. API 비용은 사용량에 정직하게 비례하기 때문입니다. 이번 강에서는 토큰 감각부터 실전 절감 전략까지 정리합니다.
토큰 = 돈: 기본 감각 익히기
2강에서 배웠듯이 API는 토큰 단위로 과금됩니다. 2026년 기준 대형 모델의 입력 가격은 100만 토큰당 수 달러 수준이고, 소형 모델은 그보다 10~20배 저렴합니다. 그리고 출력 토큰은 보통 입력 토큰보다 3~5배 비쌉니다. 한 번 처리에 입력 1,000토큰·출력 500토큰짜리 작업이 하루 10만 건이라면, 모델 선택 하나로 월 비용이 수백만 원에서 수십만 원으로 달라질 수 있습니다.
| 모델 등급 | 예시 모델 | 특징 | 추천 용도 |
|---|---|---|---|
| 대형 (Flagship) | Claude Opus 4, GPT-4o | 최고 성능, 가장 비쌈 | 복잡한 분석, 중요 문서, 고가치 작업 |
| 중형 (Mid-tier) | Claude Sonnet 4, GPT-4o mini | 성능·비용 균형 | 일상 업무의 80% |
| 소형 (Light) | Claude Haiku 3.5 | 빠르고 저렴 | 분류, 라우팅, 단순 추출 |
전략 1: 모델 라우팅 — 작업에 맞는 등급 고르기
가장 확실한 절감법은 모든 요청을 대형 모델에 보내지 않는 것입니다. 고객 문의가 들어올 때 먼저 소형 모델로 주제를 분류하고, '환불 문의'면 규칙 기반으로 처리하고, '복잡한 분쟁'일 때만 대형 모델로 보내는 식입니다. 이 모델 라우팅(routing)만으로도 전체 API 비용의 70~80%를 절감한 사례가 많습니다.
전략 2: 프롬프트 캐싱 — 같은 내용을 다시 보내지 않기
자동화에서 시스템 프롬프트는 매 요청마다 동일하게 포함됩니다. 1,000토큰짜리 시스템 프롬프트를 하루 10만 번 보내면 입력 토큰만 1억 개입니다. 프롬프트 캐싱(prompt caching)은 변하지 않는 부분을 서버에서 재사용해 토큰 비용을 90%까지 줄여주는 기능입니다. Claude와 OpenAI 모두 지원하며, API 요청 시 cache_control 파라미터로 활성화합니다.
Claude API — 프롬프트 캐싱 활성화 예시
const response = await anthropic.messages.create({
model: "claude-opus-4-5",
max_tokens: 1024,
system: [
{
type: "text",
text: "당신은 고객 지원 전문가입니다. [긴 제품 매뉴얼 전체 내용...]",
cache_control: { type: "ephemeral" } // 이 블록을 캐시
}
],
messages: [{ role: "user", content: userQuestion }]
});
// 첫 번째 요청: 전체 토큰 과금
// 이후 5분 내 요청: 캐시된 부분은 약 90% 할인된 가격으로 과금
전략 3: 배치 처리 — 급하지 않은 작업은 몰아서
즉각 응답이 필요 없는 작업, 예를 들어 야간에 리뷰 1만 개를 분석하거나 보고서 500개를 요약하는 작업은 배치(batch) API를 사용할 수 있습니다. 일반 요청보다 응답이 느리지만(최대 24시간) 가격이 50% 할인됩니다. Anthropic과 OpenAI 모두 배치 API를 제공합니다.
실전 비용 절감 체크리스트
- 모델 티어: 작업을 단순·중간·복잡으로 분류하고 각각 소형·중형·대형 모델에 배정했는가?
- 프롬프트 길이: 시스템 프롬프트에 불필요한 내용이 없는가? 1,000토큰 줄이면 하루 10만 건 기준 월 수십만 원이 절약됩니다.
- 프롬프트 캐싱: 변하지 않는 긴 시스템 프롬프트나 참고 문서에 cache_control을 적용했는가?
- 출력 길이 제한: max_tokens를 필요 이상으로 크게 열어두지 않았는가? 불필요한 긴 출력은 비용과 지연을 함께 높입니다.
- 배치 vs 실시간: 즉각 응답이 필요하지 않은 대량 작업에 배치 API를 활용했는가?
- 모니터링: 월별 토큰 사용량을 대시보드에서 추적하고, 예산 초과 알림을 설정했는가?
비용 최적화의 황금 순서는 '측정 → 병목 파악 → 가장 영향 큰 것부터 개선'입니다. 추측으로 최적화하지 말고 API 대시보드에서 어떤 작업이 토큰을 가장 많이 소비하는지 먼저 확인하세요. 보통 전체 비용의 80%는 20%의 요청에서 발생합니다.
비용을 줄이려고 모든 작업을 소형 모델로만 돌리면 품질이 떨어져 오류 처리 비용이 오히려 늘어납니다. 최적화는 '최대한 싸게'가 아니라 '작업 가치에 맞는 비용'을 찾는 과정입니다. 고가치 작업에는 아낌없이 대형 모델을 쓰되, 반복·단순 작업의 비용을 줄이는 것이 균형 잡힌 전략입니다.