← 로그

동연에스엔티 입사, 첫 과제는 사내 HR RAG 챗봇

제조AI연구소 AI 연구원으로 합류. OJT 첫 주에 정리한 운영 중인 RAG 시스템 구조와 개선 후보.

동연에스엔티RAGvLLM양자화Hybrid SearchOJT

2026년 8월 3일, 동연에스엔티 제조AI연구소에 AI 연구원으로 합류했다. 첫 과제는 이미 전사에서 운영 중인 사내 인사규정 RAG 챗봇의 품질 · 보안 고도화다. OJT 첫 주에 시스템을 파악하며 정리한 내용을 남긴다.

시스템 구조

온프레미스 GPU 서버에서 vLLM으로 LLM을 서빙하고, 별도 GPU에서 RAG(임베딩 · 리랭커)와 백엔드를 돌린다. nginx가 외부 단일 진입점이고 backend/vLLM은 내부에만 노출된다.

  • 규정 질문: 하이브리드 검색(Vector + BM25) → 리랭킹 → 근거 기반 SSE 스트리밍 답변
  • 계산 · 표 질문: 16종 코드 핸들러로 결정론 처리 후 설명만 생성
  • 개인 프로젝트: 문서 업로드 · 격리 인덱스 · 공유 권한
  • 운영: 재색인, 품질 채점, 관제 Text2SQL, 에스컬레이션, GPU/이메일 모니터링

“계산형 질문은 LLM이 계산하지 않는다”는 원칙이 인상적이었다. 근속기간이나 휴가일수는 규정에서 조건을 찾은 뒤 함수가 산출한다.

개선 후보 목록

첫 주에 잡은 검토 항목이다.

  1. 문서 파서: 현재 클라우드 파서 → 국내외 Document Parse / OCR 후보 비교
  2. 생성 모델: 현재 7.8B 양자화 모델 → 최신 경량 모델 후보 비교 (라이선스 포함)
  3. 검색 파라미터: 현재 Vector 20 + BM25 20 → Reranker 7. 조정안은 Vector 15~30 + BM25 15~30 → Reranker 5~12를 평가셋으로 스윕
  4. 모니터링: Prometheus + Grafana 도입
  5. 양자화: AWQ → GPTQ/FP8 비교

양자화 복습

모델 후보를 비교하려면 양자화 방식을 정확히 알아야 했다.

방식 핵심 장점 단점
FP8 8-bit 부동소수점. W · A · KV 캐시 모두 적용 최신 Tensor Core 직접 연산, 넓은 동적 범위 최신 하드웨어 필요, 4-bit 대비 감소량 적음
GPTQ 가중치 전용 4-bit. Hessian 기반 레이어별 오차 최적화 크기 1/4, 성능 저하 적음 캘리브레이션 데이터 필요, 긴 연산
AWQ 활성화값이 큰 중요 가중치를 보호하며 스케일링 GPTQ보다 빠름, vLLM에서 높은 성능, 과적합 우려 없음 가중치 위주 압축

학습 문서

취업규칙 · 인사규정 · 위임전결 · 여비규정 · 경조사 등 사내 규정 12종이 검색 대상이다. 규정마다 표와 조건부 계산이 많아서, 표 제목 · 행 · 열이 함께 검색되도록 청킹하는 것이 첫 번째 개선 포인트가 될 것 같다.

첫 주 소감: 잘 답하는 것보다 현업이 믿고 쓸 수 있는 기준이 먼저다. 평가셋부터 만들어야겠다.