Query Rewriting vs Query Decomposition, 검색 질문은 어떻게 바꿔야 할까요?
Query Rewriting는 하나의 정보 요구를 검색 시스템이 이해하기 좋은 표현으로 다시 쓰는 방식이고, Query Decomposition는 여러 사실과 단계가 얽힌 질문을 답할 수 있는 하위 질문으로 나누는 방식입니다.
세 줄 요약
Query Rewriting는 원래 질문의 목적을 유지하며 검색어·엔티티·맥락을 더 분명하게 만들고, Query Decomposition는 여러 단계의 근거가 필요한 질문을 하위 질문으로 나눕니다.
짧고 모호한 질문에는 재작성이, 비교·계산·시간 순서처럼 근거가 서로 의존하는 질문에는 분해가 더 잘 맞을 수 있습니다.
원문 질문, 바뀐 질의, 회수 문서와 최종 답을 함께 저장하고 정답 근거 회수·의미 보존·지연·비용으로 두 방식을 비교해야 합니다.
두 방식은 무엇을 바꾸는 걸까요?
Query Rewriting는 사용자의 정보 요구를 하나로 유지합니다. 오탈자를 고치고 대명사를 실제 엔티티로 바꾸거나, 대화 맥락을 짧은 독립 질의로 압축할 수 있습니다. 검색기가 잘 아는 표현을 추가해 질의와 문서 사이의 단어 차이를 줄이는 것도 재작성에 포함됩니다.
Query Decomposition는 질문 안에 있는 여러 문제를 나눕니다. A와 B의 최근 가격과 환불 조건을 비교해 줘라면 각 제품의 최신 가격, 각 환불 조건과 적용 국가를 별도 하위 질문으로 만들 수 있습니다. 답을 합칠 때 어떤 근거가 어느 하위 질문에 쓰였는지 남겨야 합니다.
구분 | Query Rewriting | Query Decomposition |
|---|---|---|
목적 | 같은 정보 요구를 더 잘 검색 | 복합 요구를 답할 단위로 분리 |
출력 | 보통 한 개 또는 여러 대체 질의 | 순서·의존성이 있는 하위 질문 |
적합한 문제 | 모호한 표현·오탈자·대화 맥락 | 비교·다중 홉·계산·조건 결합 |
핵심 위험 | 원래 의미가 바뀜 | 빠진 단계·잘못된 순서·오류 전파 |
필요한 로그 | 원문·재작성문·선택 이유 | 하위 질문·의존 관계·합성 근거 |
복합성 비교 기준
사용자가 그거 환불돼?라고 물었고 대화에 제품명과 국가가 이미 있다면 독립 질의로 정리하는 것만으로 충분할 수 있습니다. 약어를 정식 명칭으로 풀거나 문서에서 쓰는 용어를 추가하는 것도 검색 결과를 개선할 수 있습니다. Ma 등의 Rewrite-Retrieve-Read 연구는 검색기와 읽기 모델 사이의 간극을 질의 재작성 관점에서 다룹니다.
재작성 모델이 그럴듯한 세부 조건을 만들어 내지 않도록 해야 합니다. 사용자가 국가나 날짜를 말하지 않았는데 임의로 넣으면 더 정확해 보이는 오답이 됩니다. 부족한 조건은 질문으로 되돌려 묻거나 여러 후보로 검색하되, 가정임을 답에 남깁니다.
먼저 네 가지를 확인합니다.
사람 이름·제품·조직을 대화 맥락에서 정확히 해소했는지 봅니다.
부정 표현, 날짜·국가·버전과 숫자가 원문에서 보존됐는지 확인합니다.
추가한 동의어가 실제 문서에서 같은 뜻으로 쓰이는지 검사합니다.
원문 검색보다 정답 근거가 상위 후보에 더 자주 들어오는지 비교합니다.
Query Decomposition는 언제 필요할까요?
한 번의 검색으로 답할 수 없는 다중 홉 질문이 대상입니다. Press 등의 Self-Ask 연구는 모델이 후속 질문을 명시적으로 만들고 검색 엔진을 연결하는 구성을 다뤘습니다. IRCoT 연구는 이전에 회수하고 추론한 내용에 따라 다음에 무엇을 검색할지가 달라지는 다단계 질문에서 검색과 추론을 번갈아 수행합니다.
모든 긴 문장을 분해할 필요는 없습니다. 사용자의 요구가 여러 개여도 각각 독립적이면 병렬 검색으로 충분합니다. 반면 첫 답에서 찾은 회사명이나 날짜가 다음 질문의 조건이 된다면 의존 관계와 실행 순서를 남겨야 합니다.
Query Rewriting와 Query Decomposition의 차이
첫 하위 질문의 잘못된 답을 다음 질의에 넣으면 오류가 연쇄적으로 커집니다. 질문을 너무 잘게 나누면 각 조각에서 원래 비교 기준과 대상 범위가 사라집니다. 답이 없는 하위 질문을 모델이 추정해 채운 뒤 최종 문장을 자연스럽게 합칠 위험도 있습니다.
실패 장면 | 원인 | 제어 방법 | 확인 로그 |
|---|---|---|---|
원문 조건 누락 | 분해 프롬프트가 범위 생략 | 공통 제약을 모든 하위 질문에 전달 | 조건 보존 검사 |
첫 오답이 뒤로 전파 | 순차 의존성 | 근거 확인 뒤 다음 단계 실행 | 단계별 문서·답 |
하위 질문 과다 | 중단 규칙 없음 | 최대 개수·시간·토큰 상한 | 실행 단계 수 |
서로 다른 버전 혼합 | 시간 필터 누락 | 적용일·버전 필드 고정 | 문서 메타데이터 |
합성 답과 근거 불일치 | 출처 연결 끊김 | 주장별 하위 답·인용 연결 | 최종 인용 맵 |
Least-to-Most 연구는 복잡한 문제를 더 단순한 하위 문제로 나눠 순서대로 푸는 전략을 제시하지만, 특정 데이터셋의 결과를 모든 검색 서비스 성능으로 일반화할 수는 없습니다. 실제 사내 문서와 고객 질문에서 기준선을 다시 만들어야 합니다.
두 방식을 함께 써도 될까요?
복합 질문을 먼저 분해하고 각 하위 질문을 검색용으로 재작성할 수 있습니다. 반대로 대화 맥락을 하나의 독립 질문으로 재작성한 뒤 복합성이 확인될 때만 분해할 수도 있습니다. 어느 순서든 모델 호출 수와 실패 지점이 늘어나므로 단순 질문은 빠른 경로로 우회합니다.
운영에서는 질문 분류 규칙을 먼저 둡니다. 엔티티 하나와 근거 하나면 재작성까지만, 두 개 이상의 독립 근거와 비교·계산이 필요하면 분해 후보로 보냅니다. 답을 찾을 수 없는 질문은 더 많은 검색보다 근거 없음으로 종료할 수 있어야 합니다.
Query Rewriting와 Query Decomposition의 차이
재작성은 원문의 의미 보존과 정답 문서 회수 개선을 봅니다. 분해는 필요한 하위 질문을 빠짐없이 만들었는지, 순서와 공통 조건이 맞는지, 최종 답이 각 근거와 일치하는지를 봅니다. 하나의 답변 점수로만 평가하면 검색이 좋아졌지만 합성이 틀린 경우를 놓칩니다.
단순 RAG, 재작성, 분해, 결합 네 조건을 같은 질문 집합에서 시험합니다. 정답 근거가 상위 후보에 든 비율, 근거 없는 주장, P95 지연, 토큰과 검색 호출 수를 함께 기록합니다. 복잡한 방식은 복합 질문 그룹에서만 이득이 확인될 때 적용합니다.
공개 웹사이트에는 무엇이 먼저 필요할까요?
SEO 기록에는 Query Rewriting와 Query Decomposition의 품질 평가가 노출·클릭에 미친 영향을 남깁니다. GEO 기록에는 질의 출력이 AI 답변의 언급·인용과 맞물린 장면을 별도로 남겨 두 결과를 억지로 합치지 않습니다.
질의를 잘 바꿔도 원본 페이지의 제품명·날짜·적용 범위와 예외가 흐리면 답은 나아지지 않습니다. 공개 HTML에 핵심 정보가 있고 대표 URL과 canonical이 분명하며, 관련 페이지가 내부 링크로 연결돼야 검색 단계가 안정됩니다.
이 운영 방식은 기존 웹사이트를 유지한 채 실제 고객 질문과 공개 페이지 사이의 간극을 찾습니다. 어떤 질문이 기존 대표 URL로 답할 수 있는지, 어디서 문서와 엔티티 관계가 끊기는지, AI 답변이 어느 공개 근거를 인용하는지 진단합니다. Query Rewriting·Decomposition 엔진 구축 자체를 선행 조건으로 두지 않습니다.
Query Rewriting와 Query Decomposition 병행 운영의 실제 판단
Query Rewriting와 Query Decomposition 중 하나를 먼저 고르기보다 정보 요구, 질의 출력, 복합성 항목의 기준값을 만듭니다. 이 값이 없으면 수정 전후를 비교할 수 없고 담당자가 바뀔 때 같은 진단을 반복합니다. 영향이 큰 URL과 질문을 소수 선정한 뒤 누가 어떤 값을 언제 고쳤는지 남깁니다.
Query Rewriting와 Query Decomposition의 조건 보존 항목도 전체 평균만 보지 않습니다. 새로 고친 페이지, 그대로 둔 페이지와 계절성 영향을 받는 페이지를 나눠야 차이가 드러납니다. 결과가 예상과 다르면 새 페이지를 늘리기 전에 원문 부족, 기술 차단, 외부 정보와 측정 공백을 확인합니다.
참고 자료
Ma et al.: Query Rewriting for Retrieval-Augmented Large Language Models
Press et al.: Measuring and Narrowing the Compositionality Gap in Language Models
Trivedi et al.: Interleaving Retrieval with Chain-of-Thought Reasoning
Zhou et al.: Least-to-Most Prompting Enables Complex Reasoning
검색·RAG 구조를 이어서 보면
Query Rewriting와 Query Decomposition 비교 이후의 Search OS 운영
Search OS 적용의 출발점은 사이트 교체가 아닙니다. Query Rewriting와 Query Decomposition 비교에서 확인할 품질 평가, 정보 요구 항목을 현재 웹사이트 위에서 측정하고 콘텐츠·기술·외부 정보 가운데 막힌 부분만 손봅니다.
내부 성과 집계 기준으로 Search OS 적용 고객사는 SEO와 AI 검색 노출이 평균 88% 이상 증가했습니다. 이후에는 Query Rewriting와 Query Decomposition 비교에 사용한 검색과 AI 답변을 같은 주기로 다시 읽습니다. 좋아진 상태를 기준선으로 삼고 이탈이 생긴 URL을 먼저 고쳐 최상의 노출 상태가 이어지도록 관리합니다.