결과
2026년 7월 26일 수행한 내부 평가에서, 테스트한 검색 구성에 관계 탐색을 포함했을 때 ALL@10이 25%에서 63%로 높아졌습니다.
| 검색 조건 | R@10 | ALL@10 |
|---|---|---|
| 관계 탐색 제외 | 58.9% | 25.0% |
| 관계 탐색 포함 | 83.0% | 63.0% |
ALL@10은 질문에 필요한 모든 근거 지문이 상위 10개 검색 결과에 포함된 질문의 비율입니다. 최종 답변의 정확도가 아니라 검색 단계를 측정한 지표입니다.
평가 조건
MuSiQue-Ans 개발 데이터에서 고정된 층화 시드로 뽑은 100문항을 사용했습니다. 구성은 2-hop 52문항, 3-hop 31문항, 4-hop 17문항입니다. 각 질문의 근거 지문과 방해 지문을 하나로 합쳐 고유 지문 1,730개로 된 pooled corpus를 만들었습니다.
이 자료는 실제 Consilience 앱의 처리 파이프라인을 거쳤습니다. 두 조건은 같은 질문·자료·검색 파이프라인을 사용했습니다. 한 조건에서는 관계 탐색의 기여를 제외했고, 다른 조건에서는 출시된 결합 구성을 유지했습니다.
R@10은 각 질문에 필요한 근거 가운데 상위 10개에서 찾은 비율의 평균입니다. ALL@10은 더 엄격합니다. 필요한 지문을 모두 찾은 질문만 성공으로 셉니다.
이 결과가 뒷받침하는 것
이 표본과 pooled corpus, 검색 구성 안에서는 관계 탐색이 여러 지문에 흩어진 필수 근거를 완전하게 찾는 데 도움을 줬습니다. 이 결과는 근거가 여러 자료에 나뉜 질문에서 연결 구조를 활용한 검색을 더 연구할 이유를 제공합니다.
그러나 관계 탐색이 모든 질문에서 가장 좋다는 뜻은 아닙니다. 같은 연구 과정에서도 단어 검색의 가중치는 자료에 따라 다른 결과를 보였습니다. 정확한 표현을 찾는 질문과 여러 자료를 함께 읽는 질문에는 서로 다른 검색 조합이 적합할 수 있습니다.
한계
- Consilience가 수행한 내부 평가이며 외부 감사를 받지 않았습니다.
- 검색 단계만 측정했습니다. 검색 결과를 읽어 최종 답변을 생성하는 모델의 정확도는 평가하지 않았습니다.
- 표본은 100문항과 pooled passage 1,730개입니다. 공개된 MuSiQue 연구는 더 큰 pool을 사용하는 경우가 많으므로, 조건을 맞추지 않은 채 절대 점수를 외부 시스템과 비교하면 안 됩니다.
- 하나의 Consilience 검색 구성 안에서 요소를 제거한 ablation이며 외부 제품과의 비교가 아닙니다.
- 모든 그래프·자료·모델·작업에 대한 보편적인 인과 관계를 증명하지 않습니다.
- 내부 기록에는 재현 절차가 남아 있지만 이 공개 글 자체는 독립 재현이나 외부 검증을 마친 벤치마크 보고서가 아닙니다.
해석
쓸 수 있는 결론은 좁고 분명합니다. 이 pooled corpus와 파이프라인에서 MuSiQue-Ans 100문항을 평가했을 때, 관계 탐색을 포함한 조건은 63%의 질문에서 필요한 모든 근거를 상위 10개 안에 찾았습니다. 관계 탐색의 기여를 제외한 조건은 25%였습니다.
다음 과제는 더 큰 동일 조건에서 다시 측정하고, 최종 답변 품질을 별도로 평가하며, 다중 근거 벤치마크와 실제 사용자 자료 모두에서 질문 유형에 따라 검색 조합을 바꾸는 방법을 검증하는 것입니다.