연구Vdr-vector-compression Pruning이 Base를 능가했던 이유

Pruning이 Base를 능가했던 이유

문서별 배경 비율만큼 삭제 (layout 예산, 선택 기준 비교)

데이터셋압축률기본 모델랜덤 Pruning바운딩 박스 Pruning기본 모델과 편차랜덤 Pruning과 편차
esg_reports_human_labeled_v236.9%69.8466.9464.12-5.72-2.82
esg_reports_v237.0%56.7657.0858.23+1.48+1.15
economics_reports_v248.0%56.8756.0255.22-1.65-0.81
biomedical_lectures_v256.2%60.9161.3560.68-0.23-0.67
전체42.5%59.6859.6859.25-0.43-0.43

Experiment setup

  • 랜덤 Pruning 과 바운딩 박스 Pruning 방법 모두 문서별 배경 비율 만큼 패치를 삭제
  • 바운딩 박스 Pruning: 바운딩 박스 외부 배경 모두 삭제
  • 랜덤 Pruning: 문서별 배경 비율 만큼 패치를 랜덤으로 삭제

Result

  • 랜덤 Pruning 과 바운딩 박스 Pruning 에서 50% 이상의 패치를 버렸음에도 Baseline과 성능 차이가 1pt 미만임
  • 일부 데이터셋에서는 Pruning이 Baseline 성능을 능가함

Analysis: 원인은 Pruning 예산 할당 방식과 데이터셋 편향에 있었음

  • Pruning 예산 할당 방식:

    • 랜덤 Pruning / 바운딩 박스 Pruning 모두 문서별 배경 비율 만큼 패치를 삭제
    • 문서별로 삭제되는 패치의 개수가 다름
    • 배경이 많을수록 더 많은 패치가 삭제됨
  • 데이터셋의 편향

    • ViDoRe V2 벤치마크의 경우 상위 오답 문서가 정답 문서보다 배경이 많은 경향성이 관찰됨
    • 따라서 상위 오답 문서에서 패치가 더 많이 버려지는 경향성이 있었고
    • 그 결과 오답 문서의 점수가 정답 문서의 점수보다 더 많이 깍임

참고. 모든 문서를 동일 비율로 삭제 (균일 예산, 선택 기준 비교)

모든 문서에서 동일한 개수의 패치를 제거하면 Base 보다 일관되게 성능이 떨어짐

데이터셋압축률기본 모델균일 랜덤 Pruning
esg_reports_human_labeled_v236.9%69.8462.11
esg_reports_v237.0%56.7653.06
economics_reports_v248.0%56.8753.12
biomedical_lectures_v256.2%60.9158.64
전체42.5%59.6856.58

배경 영역에 포함된 쿼리 유사도가 높은 패치를 버려서 성능이 떨어진다?

Qualitative Analysis: 유사도 맵으로 고유사도 배경 패치가 박스 밖에서 잘림을 시각화

  • 유사도 맵: 붉은 빗금 영역이 프루닝된 영역, 상당수의 쿼리 고유사도 패치들이 잘리는 것을 볼 수 있음
  • argmax 패치 시각화: 9개 중 6개가 노란색으로 프루닝 대상에 포함됨. 순위 1위에서 7위로 하락.

Case Study: 정답 문서가 argmax 패치를 잃어 ranking flip 발생

Bounding Box Pruning 전/후 argmax 토큰을 시각화 + Bounding Box Pruning 전/후 MaxSim 결과값 비교


데이터셋: esg_human. 쿼리: "How many shops does Starbucks have?

  • 정답 문서는 답이 적힌 "38,000 stores" 문구 쪽을 포함해 argmax 패치 5개 중 4개가 박스 밖이라 잘렸고, MaxSim이 15.38에서 13.62로 떨어져 순위가 2위에서 9위로 밀림.
  • 같은 쿼리의 오답 문서는 argmax 패치 8개 중 3개만 잘려 MaxSim이 15.06에서 14.38로 거의 안 떨어졌고, 3위에서 1위로 올라 정답을 추월함.

데이터셋: biomed. 쿼리: "What information can be obtained from X-ray diffraction analysis of biomaterials?"

  • 정답 문서는 argmax 패치 9개 중 8개가 잘려 MaxSim이 18.25에서 13.19로 크게 떨어졌고, 순위가 2위에서 53위로 밀림.
  • 같은 쿼리의 오답 문서는 argmax 패치 13개 중 5개만 잘려 MaxSim이 16.88에서 15.94로 거의 유지됐고, 6위에서 4위로 올라섬.

Quantitative Analysis: 정답 문서 argmax 패치의 40% 초반이 박스 밖 배경에 있음

정답 문서에서 각 쿼리 토큰의 MaxSim winner 패치가 박스 내부인지 배경인지 분류

데이터셋박스 내부배경배경 비율배경 면적 비율차이
esg_human1,4591,11043.2%36.9%+6.3
esg15,77311,48342.1%37.0%+5.1
econ64,01647,38542.5%48.0%-5.5
biomed38,30629,80843.8%56.2%-12.4
전체119,55489,78642.9%42.5%+0.4
  • 결과:

    • 정답 문서의 argmax 패치 중 40% 초반이 박스 밖 배경에 있음. 데이터셋마다 배경 면적이 크게 다른데도 이 비율은 거의 변하지 않아서, bbox 프루닝은 데이터셋과 무관하게 정답 문서 argmax의 40% 초반을 항상 파괴함
    • 면적 대비로 보면 배경이 적은 esg 계열은 argmax가 배경에 더 몰리고 배경이 많은 biomed는 덜 몰리는데, 벤치마크 전체로 합치면 이 편차가 상쇄되어 두 비율이 거의 같아짐
    • 정답 문서가 아닌 임의의 문서까지 포함하면 배경 비율이 데이터셋별 배경 면적 비율을 거의 그대로 따라감. argmax가 배경을 특별히 선호하지도 회피하지도 않고, 정답 문서에서만 40% 초반으로 수렴함
    • 배경 면적 비율은 맨 위 표의 압축률과 일치함
  • 참고:

    • 쿼리 토큰의 10% 남짓은 winner가 패치가 아니라 텍스트 토큰이라 위 비율 계산에서 제외함
    • 박스와 절반 이상 겹치는 패치만 내부로 치는 엄격한 기준에서는 배경 비율이 50% 안팎까지 올라감

Quantitative Analysis: argmax 패치 잘림과 nDCG 하락의 상관관계

  • 정답 문서가 argmax 패치를 잃어서 순위가 밀리는 사례가 벤치마크 전반에서 발생함을 보이기 위해

  • 프루닝 전후 쿼리별 ΔnDCG(하락 / 불변 / 상승) 그룹을 나누고 argmax 패치가 잘린 쿼리 토큰의 비율의 분포를 비교

  • 결과:

    • nDCG가 떨어진 쿼리는 argmax 패치가 잘린 비율이 0.43으로 불변 그룹 0.37보다 높았고, 오른 쿼리는 0.34로 오히려 낮았음. 방향성까지 확인됨.
    • 같은 삭제 비율의 랜덤 프루닝에서도 하락 그룹 패턴이 그대로 재현됨.

Ablation: 고유사도 패치 복원으로 성능 회복, 인과 입증

  • Bounding Box 프루닝을 하되 쿼리 유사 상위 k개 패치만 박스와 무관하게 보존하고 Bounding Box 프루닝보다 성능이 오르는지 확인

  • 목적:

    • 성능 하락의 원인이 "박스 밖 고유사도 패치 제거"임을 인과적으로 입증
    • 성능이 회복되면 → 고유사도 배경 패치 제거가 하락의 원인이라는 주장 완성
  • 실험 세팅:

    • Bounding Box 프루닝을 하되 쿼리 유사 상위 k개 패치만 박스와 무관하게 보존 (top-k 개는 박스 밖 기준으로 구함)
Built with LogoFlowershow