모델 출력 제한(Rate Limit / Call Limit)은 Power Platform(AI Builder 등)이나 AI 서비스에서 일정 시간 동안 요청할 수 있는 최대 횟수나 처리량을 제한하는 시스템 규칙입니다.
- '호출(Call)'이란 무엇인가요?
- 정의: Power Apps나 Power Automate가 AI Builder 엔진에 "이 이미지/문서에서 텍스트를 읽어줘"라고 요청을 전달하는 단발성 이벤트입니다.
- 기준: 사용자가 앱에 접속해 있거나 화면을 켜두는 것은 카운트되지 않으며, 실제로 이미지를 업로드/촬영하여 AI 분석을 실행시킨 횟수만 집계됩니다.
- '환경 당(Per Environment)'의 의미
- 조직 내 작업 공간 단위:
Power Platform에서 '환경(Environment)'이란 부서, 프로젝트, 또는 전체 조직 단위로 구분된 데이터베이스와 앱이 배치되는 독립된 공간을 의미합니다. - 통합 합산 방식:
한 환경 내에서 실행되는 모든 Power Apps 앱과 Power Automate 자동화 흐름(Flow)의 호출 횟수가 하나로 합산됩니다.
예시: A 앱에서 200회, B 앱에서 200회, C 흐름에서 80회를 60초 내에 호출했다면 해당 환경 전체의 한도(480회)에 도달한 것입니다. - 독립성:
다른 환경(예: 테스트 환경, 타 부서 환경)과는 수량이 따로 관리되므로, 특정 환경에서 제한이 초과하더라도 다른 환경의 호출에는 영향을 주지 않습니다.
- 조직 내 작업 공간 단위:
- 제한(Call Limit: n회 / n초)의 의미
- 동시 접속자(동접) 수와 다름: 사이트에 접속한 인원수와 무관하게, 동일 환경 내에서 n초 동안 요청된 총 텍스트 인식 횟수의 합계입니다.
- 특정 기능 전용 제한: 이 제한은 오직 '텍스트 인식' 기능에만 적용되며, 영수증 처리/송장 처리 등 다른 AI 모델과는 카운트가 섞이지 않고 독립적으로 관리됩니다.
- 왜 제한(Rate Limit)을 두나요?
- 시스템 과부하 방지: AI OCR 작업은 높은 컴퓨팅 자원을 소비하므로 서버 마비를 막고 속도를 유지합니다.
- 자원 독점 방지: 특정 사용자나 무한 루프 오류가 있는 자동화 프로그램이 조직 전체 자원을 독점하지 못하게 방지합니다.
- 보안 및 비용 보호: 디도스(DDoS) 형태의 기계적 대량 공격을 차단하고, 의도치 않은 대량 실행으로 인한 클라우드 비용 폭증을 막아줍니다.
- 제한 초과 시 동작 및 회복 방식 (슬라이딩 윈도우)
- 실시간 차감 및 회복 방식:
- 특정 60초 구간 동안 480회를 모두 소진하면, 가장 먼저 실행했던 과거의 호출이 60초를 지나 만료되는 시점부터 잔여 한도가 실시간으로 다시 생겨납니다.
- 한도가 완전히 찬 순간에는 새로운 요청을 보낼 수 없으며 대기하거나 에러가 발생합니다.
- 진행 중인 작업은 유지됨:
- 이미 호출에 성공하여 AI가 분석을 시작한 작업은 처리 시간이 60초를 넘어가더라도 도중에 중단되지 않고 정상 완료됩니다.
- 60초라는 기간은 오직 "새로운 요청을 받아줄 수 있는가?"를 판단하는 카운트 기준 시간일 뿐입니다."60초가 지나 완전히 통째로 리셋될 때까지 아예 아무것도 못 하는 방식"이라기보다는 "슬라이딩 윈도우(Rolling Window)" 방식으로 카운트가 회복됩니다.
회복되는 방식 (슬라이딩 윈도우)
- 정해진 n초 정각마다 0으로 초기화되는 방식이 아닙니다.
- 현재 시점 기준으로 '지난 n초 동안 요청된 건수'를 지속적으로 계산합니다.
예시로 이해하기 (텍스트 인식 AI 모델의 60초 480회를 예로)
- 13:00:00 ~ 13:00:10 사이에 요청 480건이 몰려서 한도가 모두 찼다고 가정해 보겠습니다.
- 13:00:30 시점: 지난 60초(12:59:30~13:00:30) 동안 이미 480건을 사용했으므로 여전히 요청 불가 상태입니다.
- 13:01:01 시점: 13:00:00에 실행했던 호출들이 60초가 지나 카운트에서 하나씩 빠져나가기 시작합니다. 그만큼 새로운 호출을 할 수 있는 여유 수량이 실시간으로 다시 생겨납니다.
요약
한도가 다 차면 가장 과거에 실행되었던 호출이 60초 뒤에 만료되어 한도가 도로 생겨날 때까지 기다려야 하는 것이 맞습니다. 따라서 대량 처리 작업 시에는 480회를 초과하지 않도록 요청 간격에 지연(Delay)을 두거나 분산 처리하도록 설계합니다.
- 실시간 차감 및 회복 방식:
'Power Platform > AI Builder' 카테고리의 다른 글
| 프롬프트 생성 in Power Apps vs Copliot Studio (0) | 2026.09.15 |
|---|---|
| 미리 빌드된 AI 모델 - [문서] 텍스트 인식 (0) | 2026.09.09 |
| 미리 빌드된 AI 모델 - [문서] 송장 처리 (0) | 2026.09.08 |
| AI모델 - AI 모델과 비즈니스 시나리오 (0) | 2026.09.08 |
| 프롬프트를 사용해 영수증 읽기 2 - Home 화면 (0) | 2026.09.07 |