pgvector 하이브리드 검색과 RRF 로 만든 AI 캐릭터 장기 기억
LLM의 컨텍스트 윈도우를 넘어서는 장기 기억을 어떻게 만들었나. 사용자×캐릭터 단위로 5건마다 시도하는 AI 요약과 Gemini 768차원 임베딩, pgvector 코사인 유사도와 tsvector 키워드 검색을 대화 순번 감쇠로 재랭킹해 RRF로 병합하고, 중요도 예약 슬롯과 함께 최대 12개를 주입하는 설계를 정리했다.
Gemini 태그가 붙은 글 2편
LLM의 컨텍스트 윈도우를 넘어서는 장기 기억을 어떻게 만들었나. 사용자×캐릭터 단위로 5건마다 시도하는 AI 요약과 Gemini 768차원 임베딩, pgvector 코사인 유사도와 tsvector 키워드 검색을 대화 순번 감쇠로 재랭킹해 RRF로 병합하고, 중요도 예약 슬롯과 함께 최대 12개를 주입하는 설계를 정리했다.
AI 캐릭터의 한마디는 어떻게 만들어지는가. 컨텍스트 빌드, 응답 생성, 턴 마무리 3단계 파이프라인부터 생성과 병렬로 도는 입력 안전 심사, 스트리밍 JSON 추출, POST-based SSE, 용도별 모델 배정, 화면 도달량 기준 환불까지 1:1 캐릭터 챗 대화 엔진의 설계를 기록했다.