테스트하면서 추가로 확인한 문제점
실제 업무지식을 등록하고 EXAONE으로 질문을 반복해보면서, 처음에는 예상하지 못했던 몇 가지 문제도 확인했습니다.
1. EXAONE이 필요한 내용보다 더 많은 내용을 답변한다
현재 가장 어려운 부분은 EXAONE이 업무지식에 있는 내용만 간결하게 답변하지 않고, 필요 이상의 내용 을 추가해서 답변하는 경우가 있다는 점입니다.
예를 들어 업무지식에는 특정 시스템의 확인 방법과 조치 방법만 등록되어 있는데, 모델이 일반적으로 알고 있는 내용까지 함께 설명하는 경우가 있었습니다.
제가 원하는 형태는 다음과 같습니다.
등록된 업무지식에서 확인되는 내용만 답변
→ 필요한 조치 방법을 간단하게 정리
→ 근거가 없는 내용은 추가하지 않음
→ 모르는 내용은 "확실하지 않음"으로 답변
하지만 실제 결과는 모델이 조금 더 친절하게 설명하려고 하면서 기존 업무지식보다 많은 내용을 만들어내는 경우가 있었습니다.
프롬프트에 다음과 같은 제한 조건도 추가해보고 있습니다.
- 제공된 업무지식만 사용해서 답변한다.
- 업무지식에 없는 일반적인 지식은 추가하지 않는다.
- 추측해서 답변하지 않는다.
- 근거가 부족하면 "확실하지 않음"이라고 답변한다.
- 질문에 필요한 내용만 간결하게 답변한다.
아직 어떤 방식으로 프롬프트를 구성해야 원하는 답변을 안정적으로 얻을 수 있는지는 계속 테스트가 필요한 상태입니다.
2. 답변 생성 시간이 3~5초 정도 걸린다
또 하나의 문제는 질문을 입력하고 실제 답변이 출력되기까지 약 3~5초 정도 걸린다는 점입니다.
PoC 단계에서 기능을 테스트할 때는 큰 문제가 아니지만, 실제 사용자가 업무 중에 자주 사용하는 시스템이라고 생각하면 3~5초도 길게 느껴질 수 있습니다.
현재 처리 과정에 는 다음과 같은 단계가 포함되어 있습니다.
사용자 질문
↓
업무지식 검색
↓
동의어 확인
↓
관련 문서 추출
↓
EXAONE에 질문 + 문서 전달
↓
답변 생성
↓
화면 출력
현재는 이 과정 중 정확히 어디에서 시간이 많이 소요되는지까지 구체적으로 측정하지 못했습니다.
앞으로는 각 단계별 처리 시간을 확인하면서 다음 부분을 검토해야 할 것 같습니다.
검색 처리 시간
EXAONE API 응답 시간
모델에 전달하는 문서의 양
필요 이상의 업무지식을 함께 전달하고 있는지
답변 길이를 줄였을 때 속도가 개선되는지
스트리밍 형태로 답변을 먼저 보여줄 수 있는지
지금 단계에서는 정확도를 높이는 것과 응답 시간을 줄이는 것을 같이 고민해야 하는 상황입니다.
3. Markdown과 동의어 DB가 제대로 관리되고 있는지 판단하기 어렵다
현재 업무지식은 Markdown을 중심으로 관리하고 있고, 업무에서 사용하는 표현 차이를 보완하기 위해 동의어 정보도 별도로 관리하고 있습니다.
하지만 데이터가 조금씩 늘어나면서 새로운 고민이 생겼습니다.
이 Markdown 문서는 아직 유효한 정보인가?
비슷한 업무지식이 중복으로 등록되어 있지는 않은가?
동의어가 너무 많이 등록되어 검색 범위를 오히려 넓히고 있지는 않은가?
잘못 등록된 동의어 때문에 관계없는 문서가 검색되지는 않는가?
오래된 업무지식을 어떻게 관리해야 하는가?
처음에는 Markdown 파일과 동의어 DB를 만들어두면 관리가 쉬울 것으로 생각했습니다.
하지만 실제로 중요한 것은 데이터를 저장하는 것보다 데이터의 품질을 계속 유지하는 것이라는 생각이 들었습니다.
앞으로는 단순히 업무지식을 추가하는 기능뿐만 아니라 다음과 같은 관리 기능도 필요할 것 같습니다.
업무지식 최종 수정일 관리
오래된 문서 확인
중복 문서 확인
동의어 사용 현황 확인
검색되지 않는 단어 확인
잘못된 검색 결과를 만드는 동의어 확인
업무지식 수정 및 삭제 이력 관리
이번 테스트를 통해 느낀 점은, 업무지식 LLM을 운영하려면 LLM 자체뿐 아니라 업무지식과 검색 데이터를 관리하는 체계도 같이 만들어야 한다는 것입니다.
아직 이 부분은 어떤 방식이 가장 효율적인지 명확한 답을 찾지 못했고, 실제 사용 데이터를 더 쌓아가면서 관리 방법을 정리해야 할 것 같습니다.