동연에스엔티 입사, 첫 과제는 사내 HR RAG 챗봇
제조AI연구소 AI 연구원으로 합류. OJT 첫 주에 정리한 운영 중인 RAG 시스템 구조와 개선 후보.
2026년 8월 3일, 동연에스엔티 제조AI연구소에 AI 연구원으로 합류했다. 첫 과제는 이미 전사에서 운영 중인 사내 인사규정 RAG 챗봇의 품질 · 보안 고도화다. OJT 첫 주에 시스템을 파악하며 정리한 내용을 남긴다.
시스템 구조
온프레미스 GPU 서버에서 vLLM으로 LLM을 서빙하고, 별도 GPU에서 RAG(임베딩 · 리랭커)와 백엔드를 돌린다. nginx가 외부 단일 진입점이고 backend/vLLM은 내부에만 노출된다.
- 규정 질문: 하이브리드 검색(Vector + BM25) → 리랭킹 → 근거 기반 SSE 스트리밍 답변
- 계산 · 표 질문: 16종 코드 핸들러로 결정론 처리 후 설명만 생성
- 개인 프로젝트: 문서 업로드 · 격리 인덱스 · 공유 권한
- 운영: 재색인, 품질 채점, 관제 Text2SQL, 에스컬레이션, GPU/이메일 모니터링
“계산형 질문은 LLM이 계산하지 않는다”는 원칙이 인상적이었다. 근속기간이나 휴가일수는 규정에서 조건을 찾은 뒤 함수가 산출한다.
개선 후보 목록
첫 주에 잡은 검토 항목이다.
- 문서 파서: 현재 클라우드 파서 → 국내외 Document Parse / OCR 후보 비교
- 생성 모델: 현재 7.8B 양자화 모델 → 최신 경량 모델 후보 비교 (라이선스 포함)
- 검색 파라미터: 현재 Vector 20 + BM25 20 → Reranker 7. 조정안은 Vector 15~30 + BM25 15~30 → Reranker 5~12를 평가셋으로 스윕
- 모니터링: Prometheus + Grafana 도입
- 양자화: AWQ → GPTQ/FP8 비교
양자화 복습
모델 후보를 비교하려면 양자화 방식을 정확히 알아야 했다.
| 방식 | 핵심 | 장점 | 단점 |
|---|---|---|---|
| FP8 | 8-bit 부동소수점. W · A · KV 캐시 모두 적용 | 최신 Tensor Core 직접 연산, 넓은 동적 범위 | 최신 하드웨어 필요, 4-bit 대비 감소량 적음 |
| GPTQ | 가중치 전용 4-bit. Hessian 기반 레이어별 오차 최적화 | 크기 1/4, 성능 저하 적음 | 캘리브레이션 데이터 필요, 긴 연산 |
| AWQ | 활성화값이 큰 중요 가중치를 보호하며 스케일링 | GPTQ보다 빠름, vLLM에서 높은 성능, 과적합 우려 없음 | 가중치 위주 압축 |
학습 문서
취업규칙 · 인사규정 · 위임전결 · 여비규정 · 경조사 등 사내 규정 12종이 검색 대상이다. 규정마다 표와 조건부 계산이 많아서, 표 제목 · 행 · 열이 함께 검색되도록 청킹하는 것이 첫 번째 개선 포인트가 될 것 같다.
첫 주 소감: 잘 답하는 것보다 현업이 믿고 쓸 수 있는 기준이 먼저다. 평가셋부터 만들어야겠다.