Python 기반 AI 웹서비스 응답 성능 최적화
대표 요청의 핵심 결과 노출 시간을 p95 기준으로 추적하고, 스트리밍 선노출·빠른 경로·폴백·중간 캐시 적용 효과를 즉시 비교합니다.
목표 p95 7.0초 이하
품질 회귀 98.4%
오류율 0.7%
현재 p9515.0초
기준선
핵심 결과 선노출12.8초
SSE 단계 표시
p99 Tail22.4초
대기 전파 추적
처리량18 rps
동시 요청 기준
요청 처리 파이프라인 계측
개선 옵션
핵심 결과와 부가 작업 분리
리포트 생성, 로그 보강, 외부 확장 응답을 핵심 결과 이후로 지연 실행합니다.
요청 유형별 빠른 처리 경로
계획 수립이 단순한 요청은 전체 플래너와 고비용 리랭킹을 우회합니다.
중간 결과 캐시
반복 검색과 리랭킹 후보군을 짧은 TTL로 재사용합니다.
외부 연동 타임아웃·폴백
느린 외부 응답이 전체 요청의 Tail Latency로 전파되지 않도록 제한합니다.