SIGIR(정보 검색 특별 관심 그룹)은 최첨단 연구를 공유하기 위해 전 세계의 연구원, 개발자, 업계 전문가 및 교육자들이 모이는 최고의 정보 검색 컨퍼런스입니다. Jina AI는 7월에 파두아에서 열린 올해 컨퍼런스에 참가하여 Robust IR 워크숍에서 늦은 청킹에 대한 연구를 발표했습니다.
올해 컨퍼런스에서는 특히 재정렬 방법, 희소 검색 모델, 정보 검색에서 대규모 언어 모델(LLM) 사용에 대한 훌륭한 연구가 있었습니다. 주요 발표로는 BM25 순위 알고리즘의 역사와 개발에 대한 Stephen Robertson과 과학 연구에서 AI의 미래에 대한 관점에 대한 Iryna Gurevych의 기조 연설이 있었습니다. 참석한 전문가와 열정적인 박사 과정 학생들은 많은 활발한 토론을 불러일으켰습니다. 컨퍼런스는 도시의 중심부에 위치한 파두아 컨벤션 센터에서 열렸습니다. 파두아는 역사와 문화가 풍부한 곳이며, 저희는 그곳에서 즐거운 시간을 보냈습니다.
tagRobust IR에서의 늦은 청킹
Robust IR 워크숍은 올해 처음으로 열린 SIGIR의 새로운 행사입니다. 이 워크숍은 정보 검색 시스템이 어렵고 예외적인 상황에서 얼마나 잘 작동하는지, 그리고 어떻게 견고성을 향상시킬 수 있는지에 초점을 맞췄습니다. 워크숍은 초청 강연과 채택된 논문의 구두 발표, 패널 토론으로 구성되었습니다.
저희는 워크숍의 포스터 세션에서 늦은 청킹에 대한 연구를 발표했습니다. 이미 사전 인쇄물을 읽은 사람들을 포함하여 많은 통찰력 있는 질문과 의견이 있었습니다.

Google 드라이브에서 포스터 다운로드
tag흥미로운 연구
저희는 SIGIR에서 발표된 많은 흥미로운 연구를 발견했지만, 아래 연구가 특히 눈에 띄었습니다.
tagCLIP-AdaM: 개방형 3D 객체 검색을 위한 다중 뷰 CLIP 적응
이 논문은 3D 이미지 검색, 특히 이전에 학습되지 않은 객체 범주에 대한 3D 객체를 검색하는 작업인 개방형 3D 객체 검색에 초점을 맞췄습니다. 그들의 접근 방식은 평면 이미지에 대해 훈련된 CLIP 모델을 사용하여 객체를 인식하기 위해 여러 각도에서 3D 모델의 렌더링된 뷰를 사용합니다. 이 논문의 흥미로운 발견 중 하나는 CLIP 모델이 객체의 여러 뷰에서 생성된 向量模型을 평균화할 때 잘 작동한다는 것입니다.

그 외에도 이 논문은 훈련 데이터 범주에 대한 과적합을 방지하고 새로운 범주에 대한 제로샷 성능을 향상시키면서 특정 작업에 맞게 모델을 조정하는 적응형 레이어뿐만 아니라 다양한 뷰에 가중치를 부여하는 방법을 학습하는 3D 객체 검색을 위한 새로운 훈련 방법을 제안합니다.
tag복합 검색 시스템 최적화
결과를 생성하기 위해 여러 순위 모델을 결합하는 기존 순위 시스템의 대부분은 순위 캐스케이드를 기반으로 합니다. 이는 하나의 순위 모델이 다른 순위 모델 다음에 실행되어 이전 순위 모델에서 가장 높은 점수를 얻은 결과만 유지한다는 의미입니다.
이 논문은 복합 검색 시스템이라는 다른 접근 방식을 제안합니다. 복합 검색 시스템은 순위 정확도와 계산 효율성을 최대화하기 위해 다양한 재정렬기를 결합하는 프레임워크입니다. 저자는 이를 캐스케이드 접근 방식의 일반화로 이해할 것을 제안합니다. 캐스케이드 접근 방식은 이전 순위 단계의 결과의 다른 하위 집합에 대해 여러 재정렬기를 실행합니다.
아래 그림은 다양한 재정렬기를 결합할 수 있는 방법을 보여주기 위해 논문에 제공되었습니다.

그들의 예에서 1단계 순위기는 초기 순위를 생성합니다. 그런 다음 2단계에서는 순위 접근 방식이 다른 두 개의 재정렬기를 사용합니다.
- 쿼리를 기반으로 첫 번째 순위기에서 문서에 대한 관련성 점수를 생성하는 포인트별 순위 모델.
- 두 개의 문서와 쿼리를 비교하고 둘 중 하나가 다른 하나보다 쿼리와 더 관련성이 높을 가능성을 추정하는 쌍별 순위 모델.
각 모델은 이전 랭킹 단계의 결과에 적용되는 선택 정책을 가지고 있습니다. 예를 들어 상위 n개만 선택하는 방식입니다. 또한 최종 결과를 생성하는 최종 순서 지정 함수도 있습니다. 선택 정책과 순서 지정 함수 모두 훈련을 통해 설정된 매개변수를 가지므로, 더 나은 결과를 도출하는 전체적인 최적화를 제공합니다.
tagRE-AdaptIR: 역설계된 적응을 통해 정보 검색 개선
임베딩 모델 가중치를 최적화하기 위해 선형 대수 기술을 사용하는 방법에 대한 많은 연구가 있었습니다. 예를 들어, 모델 수프 방법은 서로 다른 하이퍼파라미터로 동일한 기본 모델을 미세 조정하여 얻은 모델의 가중치를 평균화하여 모델 정확도와 견고성을 향상시킵니다.

이 논문에서 제시된 연구는 다음과 같은 관련 아이디어를 제공합니다. 미세 조정된 임베딩 모델의 가중치와 미세 조정되지 않은 기본 모델의 가중치 간의 차이 벡터를 사용하여 한 모델에서 다른 모델로 전이 학습을 할 수 있을까요? 특정 도메인 텍스트에 대한 다음 토큰 예측을 위해 기본 모델의 다른 복사본을 미세 조정하고, 훈련된 임베딩 모델에서 가중치 차이를 추가하면 대상 도메인에 대한 더 나은 임베딩 모델을 얻을 수 있을까요?

이는 새로운 도메인에 대한 모델을 훈련하는 데 중요한 이점을 제공합니다. 풍부한 일반 텍스트 데이터를 사용하여 다음 토큰 예측을 훈련하고, 그 결과로 개선된 임베딩을 누릴 수 있습니다.
tagLLM 기반 관련성 판단 방법 벤치마킹
이 논문은 LLM을 관련성 판단자로 사용하기 위한 프롬프트 전략을 평가합니다. 여기에는 이진(예/아니오) 판단, 등급 평가(예: 0-4 척도), 관련성에 대한 문서의 쌍별 비교, 문서에 특정 정보가 포함되어 있는지 여부를 결정하는 "너깃 기반" 방법 등이 포함됩니다.
저자들은 GPT-4o 및 Llama 3를 사용하여 테스트한 결과, LLM이 선택할 수 있는 항목이 적을수록 결과가 인간의 판단과 더 일치한다는 결론을 내렸습니다. 이진 판단 및 쌍별 비교가 가장 우수한 성능을 보이며, 매우 강력한 AI 모델의 경우 대규모 자동 사용에 충분합니다. 좋은 프롬프트 설계가 중요한 요소입니다.
너깃 기반 방법은 인간의 해석 가능성을 제공하지만 신뢰성이 떨어집니다.
tag랭커, 판사 및 도우미: 정보 검색 평가에서 LLM의 상호 작용 이해
이 논문은 LLM을 결과 순위 지정, 관련성 판단 및 결과 평가, 결과 요약 및 쿼리 확장과 같은 지원 기능의 세 가지 역할로 사용할 때 발생하는 문제를 탐구합니다.
아래 그림과 같이 정보 주기 전반에 걸쳐 LLM 사용의 결과를 고려합니다. 그림은 논문에서 가져온 것입니다.

이 논문은 자체적으로 LLM에 의존하는 정보 검색 시스템을 평가할 때 LLM 기반 판단을 사용하는 데 중요한 문제가 있다는 결론을 내립니다. 서로 다른 LLM 기반 구성 요소의 상호 작용은 확실히 편향되고 부정확한 결과를 초래할 수 있습니다.
tagIR 평가를 위한 LLM 기반 유용성 라벨링
이 논문은 검색 결과에서 관련성과 유용성을 구별합니다. 그들의 정의에서 관련성은 검색된 문서의 주제가 쿼리와 주제적으로 관련이 있는지 여부에 관한 것입니다. 유용성은 문서가 쿼리에 응답하는지 여부, 즉 사용자의 의도를 충족하는지 여부에 관한 것입니다.
이 논문의 초점은 LLM이 유용성을 인식하고 순위를 매길 수 있는지 여부와 LLM의 판단이 인간의 판단과 일치하는지 여부에 있습니다. 그들은 유용성에 대한 인간 판단과 LLM 사이에 상당한 일치가 있다는 결론을 내립니다. 그러나 사용 가능한 LLM은 관련성과 유용성이 일치하지 않는 경우, 즉 관련성은 있지만 유용하지 않은 문서로 어려움을 겪습니다. 저자들은 LLM에 텍스트 쿼리뿐만 아니라 더 많은 컨텍스트 정보를 제공하면 결과가 크게 향상된다는 것을 발견했습니다.
tagLLM 기반 관련성 평가는 여전히 인간 관련성 평가를 대체할 수 없습니다.
이 논문은 정보 검색에서 자동 관련성 평가를 위해 LLM을 사용하는 것에 대해 논의합니다. 이는 인간이 순위를 매긴 데이터가 결코 충분하지 않기 때문에 검색 모델을 훈련하는 것을 훨씬 쉽게 만들 것입니다. 최근 연구에서는 LLM이 인간 평가자를 완전히 대체할 수 있다고 주장하지만, 이 논문은 LLM이 인간 판단을 대체하는 것을 막는 주요 제한 사항을 식별합니다.
- 현재 연구의 불충분한 증거 및 제한된 일반화 가능성: 현재 연구는 특히 다양한 데이터 세트와 실제 시나리오에서 LLM이 인간 관련성 판단을 완전히 대체할 수 있다는 강력한 증거가 부족합니다. 긍정적인 결과가 존재하는 경우에도 그것이 광범위한 도메인에 실제로 적용되는지 여부는 논쟁의 여지가 있습니다.
- 조작에 대한 취약성: LLM을 기반으로 하는 것을 포함하여 자동화된 메트릭은 쉽게 조작될 수 있습니다. 실제로 성능을 향상시키지 않고도 점수를 향상시키는 것은 매우 쉽습니다.
- 자기 선호 편향: LLM은 자신의 훈련 데이터와 유사한 출력을 선호하는 경향이 있어 관련성 평가의 객관성을 손상시키는 편향을 도입합니다.
- 과적합 위험: LLM 기반 평가에 의존하면 검색 시스템이 특정 LLM의 특이성에 맞게 최적화되어 실제 사용에서 성능이 저하될 수 있습니다.
tag결론
대규모 언어 모델의 급속한 증가는 BM25와 같은 기존 방법을 대체하고 새로운 가능성을 열면서 정보 검색을 크게 변화시켰습니다. SIGIR에서 선보인 연구는 이러한 변화를 강조합니다.
그러나 언어 모델은 정보 검색을 해결된 문제로 만들지 않습니다. 이 회의에서는 IR 시스템을 사용자의 진화하는 요구 사항에 더 가깝게 맞추기 위한 광범위한 혁신적인 아이디어가 발표되었습니다. 우리는 Jina AI에서 박사 과정 학생 및 전문가와 연결하고, 아이디어를 교환하고, 검색의 미래에 대한 비전을 공유하는 것을 진심으로 즐겼습니다. 우리는 이 분야에서 가능한 것의 경계를 계속 넓혀가게 되어 기쁩니다.













