# Data Selection / Data Generation 전수 조사

- 전체 채택 논문: **61,922편**
- 규칙에 포함된 범주별 레코드: **3,390건** (한 논문이 두 범주에 포함될 수 있음)
- 범위: ICLR·ICML·NeurIPS 공식 프로그램의 2016~2026년 채택 논문
- 2026년: ICLR·ICML만 포함. NeurIPS 2026 채택 결과는 집계 시점에 공개되지 않음
- 판정 단위: 제목과 공식 초록 전체. 규칙과 제외 조건은 `scripts/build_trend_census.py`에 고정
- 논문별 판정 근거: `trend-census-2016-2026.csv`의 `rule`, `matched_on`, `evidence`, `url` 열

| 연도 | Data Selection | Data Generation |
| --- | ---: | ---: |
| 2016 | 19 | 11 |
| 2017 | 30 | 18 |
| 2018 | 39 | 33 |
| 2019 | 70 | 52 |
| 2020 | 73 | 91 |
| 2021 | 88 | 157 |
| 2022 | 122 | 178 |
| 2023 | 156 | 240 |
| 2024 | 221 | 293 |
| 2025 | 316 | 529 |
| 2026* | 298 | 356 |

## 해석 기준

- Data Selection은 학습에 쓸 표본을 고르거나 줄이는 연구를 뜻한다. Data selection·curation·filtering·pruning, coreset, active learning, curriculum, data valuation, example selection을 포함한다.
- Data Generation은 학습·평가 데이터를 새로 만드는 연구를 뜻한다. Synthetic data, data generation·synthesis·augmentation, instruction·task·experience·environment generation, pseudo-labeling을 포함한다.
- Feature selection, model·weight·token pruning, 추론 시점의 sampling·selection은 제외한다.
- 단순 키워드 빈도가 아니라 각 개념의 변형 표현을 규칙으로 정의해 모든 제목과 초록을 스캔했다. CSV는 포함된 모든 논문과 해당 문맥을 공개하므로 판정을 다시 검토할 수 있다.
- ICLR 2016·2017 공식 아카이브는 초록을 일괄 제공하지 않아 해당 두 해의 ICLR 논문은 제목만 검사했다. 다른 연도·학회는 공식 초록까지 검사했다.

## 공식 원천

- ICLR: `https://iclr.cc/virtual/{year}/papers.html` 및 공식 프로그램 JSON
- ICML: `https://icml.cc/virtual/{year}/papers.html`, ICML 2016은 PMLR 48
- NeurIPS: `https://neurips.cc/virtual/{year}/papers.html` 및 공식 프로그램 JSON
