한 번에 하나의 질문을 보내고 실시간으로 답변을 기다리는 일반 API와 다릅니다. 여러 개의 요청을 모아서 파일로 제출하고, 최대 24시간 내에 일괄 처리된 결과를 받는 방식입니다.
| 모델 | 일반 요금 | 배치 요금 | 절감률 |
|---|---|---|---|
| GPT-4o | $2.50 | $1.25 반값 | 50% |
| GPT-4o mini | $0.15 | $0.075 반값 | 50% |
| text-embedding-3-large | $0.13 | $0.065 반값 | 50% |
| 모델 | 일반 요금 | 배치 요금 | 절감률 |
|---|---|---|---|
| Claude 3.5 Sonnet | $3.00 | $1.50 반값 | 50% |
| Claude 3.5 Haiku | $0.80 | $0.40 반값 | 50% |
실시간 응답이 필요 없는 "백오피스" 또는 "대량 데이터 처리" 업무에 완벽합니다.
시나리오: 이커머스 상품 설명 10,000건 생성
(건당 500토큰 입력, GPT-4o mini 기준)
단가가 저렴한 mini 모델이라도, 한 달에 수백만 건을 처리하는 기업이라면 수십~수백만 원을 아낄 수 있습니다. 고성능 GPT-4o 모델 대량 호출 시에는 절감액이 수백만 원 단위로 뜁니다.
아닙니다. 최대 한도(SLA)를 24시간으로 보장할 뿐, AI 회사의 서버 리소스가 남는 상황이라면 몇 분에서 몇 시간 내에 처리가 완료되는 경우도 흔합니다.
OpenAI의 경우 파일당 최대 50,000건의 요청, 최대 파일 크기 100MB의 제한이 있습니다. 더 많은 작업을 하려면 파일을 여러 개로 쪼개서 보내면 됩니다.