Pruning이 Base를 능가했던 이유
Pruning이 Base를 능가했던 이유
문서별 배경 비율만큼 삭제 (layout 예산, 선택 기준 비교)
| 데이터셋 | 압축률 | 기본 모델 | 랜덤 Pruning | 바운딩 박스 Pruning | 기본 모델과 편차 | 랜덤 Pruning과 편차 |
|---|---|---|---|---|---|---|
| esg_reports_human_labeled_v2 | 36.9% | 69.84 | 66.94 | 64.12 | -5.72 | -2.82 |
| esg_reports_v2 | 37.0% | 56.76 | 57.08 | 58.23 | +1.48 | +1.15 |
| economics_reports_v2 | 48.0% | 56.87 | 56.02 | 55.22 | -1.65 | -0.81 |
| biomedical_lectures_v2 | 56.2% | 60.91 | 61.35 | 60.68 | -0.23 | -0.67 |
| 전체 | 42.5% | 59.68 | 59.68 | 59.25 | -0.43 | -0.43 |
Experiment setup
- 랜덤 Pruning 과 바운딩 박스 Pruning 방법 모두 문서별 배경 비율 만큼 패치를 삭제
- 바운딩 박스 Pruning: 바운딩 박스 외부 배경 모두 삭제
- 랜덤 Pruning: 문서별 배경 비율 만큼 패치를 랜덤으로 삭제
Result
- 랜덤 Pruning 과 바운딩 박스 Pruning 에서 50% 이상의 패치를 버렸음에도 Baseline과 성능 차이가 1pt 미만임
- 일부 데이터셋에서는 Pruning이 Baseline 성능을 능가함
Analysis: 원인은 Pruning 예산 할당 방식과 데이터셋 편향에 있었음
-
Pruning 예산 할당 방식:
- 랜덤 Pruning / 바운딩 박스 Pruning 모두 문서별 배경 비율 만큼 패치를 삭제
- 문서별로 삭제되는 패치의 개수가 다름
- 배경이 많을수록 더 많은 패치가 삭제됨
-
데이터셋의 편향
- ViDoRe V2 벤치마크의 경우 상위 오답 문서가 정답 문서보다 배경이 많은 경향성이 관찰됨
- 따라서 상위 오답 문서에서 패치가 더 많이 버려지는 경향성이 있었고
- 그 결과 오답 문서의 점수가 정답 문서의 점수보다 더 많이 깍임
참고. 모든 문서를 동일 비율로 삭제 (균일 예산, 선택 기준 비교)
모든 문서에서 동일한 개수의 패치를 제거하면 Base 보다 일관되게 성능이 떨어짐
| 데이터셋 | 압축률 | 기본 모델 | 균일 랜덤 Pruning |
|---|---|---|---|
| esg_reports_human_labeled_v2 | 36.9% | 69.84 | 62.11 |
| esg_reports_v2 | 37.0% | 56.76 | 53.06 |
| economics_reports_v2 | 48.0% | 56.87 | 53.12 |
| biomedical_lectures_v2 | 56.2% | 60.91 | 58.64 |
| 전체 | 42.5% | 59.68 | 56.58 |
배경 영역에 포함된 쿼리 유사도가 높은 패치를 버려서 성능이 떨어진다?
Qualitative Analysis: 유사도 맵으로 고유사도 배경 패치가 박스 밖에서 잘림을 시각화

- 유사도 맵: 붉은 빗금 영역이 프루닝된 영역, 상당수의 쿼리 고유사도 패치들이 잘리는 것을 볼 수 있음

- argmax 패치 시각화: 9개 중 6개가 노란색으로 프루닝 대상에 포함됨. 순위 1위에서 7위로 하락.
Case Study: 정답 문서가 argmax 패치를 잃어 ranking flip 발생
Bounding Box Pruning 전/후 argmax 토큰을 시각화 + Bounding Box Pruning 전/후 MaxSim 결과값 비교
데이터셋: esg_human. 쿼리: "How many shops does Starbucks have?

- 정답 문서는 답이 적힌 "38,000 stores" 문구 쪽을 포함해 argmax 패치 5개 중 4개가 박스 밖이라 잘렸고, MaxSim이 15.38에서 13.62로 떨어져 순위가 2위에서 9위로 밀림.

- 같은 쿼리의 오답 문서는 argmax 패치 8개 중 3개만 잘려 MaxSim이 15.06에서 14.38로 거의 안 떨어졌고, 3위에서 1위로 올라 정답을 추월함.
데이터셋: biomed. 쿼리: "What information can be obtained from X-ray diffraction analysis of biomaterials?"

- 정답 문서는 argmax 패치 9개 중 8개가 잘려 MaxSim이 18.25에서 13.19로 크게 떨어졌고, 순위가 2위에서 53위로 밀림.

- 같은 쿼리의 오답 문서는 argmax 패치 13개 중 5개만 잘려 MaxSim이 16.88에서 15.94로 거의 유지됐고, 6위에서 4위로 올라섬.
Quantitative Analysis: 정답 문서 argmax 패치의 40% 초반이 박스 밖 배경에 있음
정답 문서에서 각 쿼리 토큰의 MaxSim winner 패치가 박스 내부인지 배경인지 분류
| 데이터셋 | 박스 내부 | 배경 | 배경 비율 | 배경 면적 비율 | 차이 |
|---|---|---|---|---|---|
| esg_human | 1,459 | 1,110 | 43.2% | 36.9% | +6.3 |
| esg | 15,773 | 11,483 | 42.1% | 37.0% | +5.1 |
| econ | 64,016 | 47,385 | 42.5% | 48.0% | -5.5 |
| biomed | 38,306 | 29,808 | 43.8% | 56.2% | -12.4 |
| 전체 | 119,554 | 89,786 | 42.9% | 42.5% | +0.4 |
-
결과:
- 정답 문서의 argmax 패치 중 40% 초반이 박스 밖 배경에 있음. 데이터셋마다 배경 면적이 크게 다른데도 이 비율은 거의 변하지 않아서, bbox 프루닝은 데이터셋과 무관하게 정답 문서 argmax의 40% 초반을 항상 파괴함
- 면적 대비로 보면 배경이 적은 esg 계열은 argmax가 배경에 더 몰리고 배경이 많은 biomed는 덜 몰리는데, 벤치마크 전체로 합치면 이 편차가 상쇄되어 두 비율이 거의 같아짐
- 정답 문서가 아닌 임의의 문서까지 포함하면 배경 비율이 데이터셋별 배경 면적 비율을 거의 그대로 따라감. argmax가 배경을 특별히 선호하지도 회피하지도 않고, 정답 문서에서만 40% 초반으로 수렴함
- 배경 면적 비율은 맨 위 표의 압축률과 일치함
-
참고:
- 쿼리 토큰의 10% 남짓은 winner가 패치가 아니라 텍스트 토큰이라 위 비율 계산에서 제외함
- 박스와 절반 이상 겹치는 패치만 내부로 치는 엄격한 기준에서는 배경 비율이 50% 안팎까지 올라감
Quantitative Analysis: argmax 패치 잘림과 nDCG 하락의 상관관계




-
정답 문서가 argmax 패치를 잃어서 순위가 밀리는 사례가 벤치마크 전반에서 발생함을 보이기 위해
-
프루닝 전후 쿼리별 ΔnDCG(하락 / 불변 / 상승) 그룹을 나누고 argmax 패치가 잘린 쿼리 토큰의 비율의 분포를 비교
-
결과:
- nDCG가 떨어진 쿼리는 argmax 패치가 잘린 비율이 0.43으로 불변 그룹 0.37보다 높았고, 오른 쿼리는 0.34로 오히려 낮았음. 방향성까지 확인됨.
- 같은 삭제 비율의 랜덤 프루닝에서도 하락 그룹 패턴이 그대로 재현됨.
Ablation: 고유사도 패치 복원으로 성능 회복, 인과 입증
-
Bounding Box 프루닝을 하되 쿼리 유사 상위 k개 패치만 박스와 무관하게 보존하고 Bounding Box 프루닝보다 성능이 오르는지 확인
-
목적:
- 성능 하락의 원인이 "박스 밖 고유사도 패치 제거"임을 인과적으로 입증
- 성능이 회복되면 → 고유사도 배경 패치 제거가 하락의 원인이라는 주장 완성
-
실험 세팅:
- Bounding Box 프루닝을 하되 쿼리 유사 상위 k개 패치만 박스와 무관하게 보존 (top-k 개는 박스 밖 기준으로 구함)
