k
korAI
AI 뉴스 전체
📰 AI 뉴스2026-09-054분

OpenAI, o3-mini API 한국 리전 지원 및 추론 비용 30% 인하

OpenAI가 o3-mini 모델의 아시아-태평양 리전 확장 일환으로 한국(서울) 엣지 라우팅을 공식 지원하며 평균 응답 지연을 기존 대비 약 40% 단축했다. 동시에 o3-mini의 입력·출력 토큰 단가를 각각 30% 인하해 추론 집약적 서비스를 운영하는 국내 개발자의 비용 부담이 크게 줄어들 전망이다.

openaiapipricing

변경된 가격 구조

이번 인하로 o3-mini의 입력 토큰 단가는 $1.10 / 1M 토큰, 출력 토큰 단가는 $4.40 / 1M 토큰으로 조정됐다(기존 대비 각 30% 감소). Tier 2 이상 계정에는 추가 볼륨 할인이 적용되며, 정확한 최신 단가는 OpenAI 공식 가격 페이지를 참조해야 한다.

한국 리전 라우팅의 실질적 효과

OpenAI는 서울 PoP(Point of Presence)를 통해 한국 및 동북아 트래픽을 로컬에서 처리한다고 밝혔다. 내부 벤치마크 기준 P50 지연은 210ms → 126ms, P99 지연은 890ms → 540ms로 개선됐다. 실시간 코드 자동완성이나 스트리밍 챗 UI처럼 지연에 민감한 서비스에서 체감 품질 향상이 기대된다. 리전 선택은 API 호출 시 x-openai-region: ap-northeast-2 헤더를 추가하거나 SDK의 region 파라미터로 설정 가능하다.

개발자 적용 가이드

  • SDK 버전 요구사항: openai Python 패키지 1.45.0 이상, Node.js 패키지 4.58.0 이상에서 리전 파라미터 지원
  • 스트리밍 호환성: stream=True 옵션과 리전 라우팅 동시 사용 가능, 청크 분할 방식 변경 없음
  • Fallback 정책: 서울 PoP 장애 시 자동으로 도쿄 PoP로 전환되며 애플리케이션 코드 수정 불필요
  • 모니터링: OpenAI 대시보드 > Usage 탭에서 리전별 요청 분포 및 지연 분포 그래프 신규 제공

국내 SaaS 스타트업과 AI 에이전트 서비스 개발사라면 이번 업데이트를 통해 인프라 비용과 사용자 경험을 동시에 개선할 수 있는 기회가 생겼다.

출처: OpenAI Developer Blog