# AI Summit Seoul & Expo 2026

AI Summit Seoul & Expo 2026의 **Self-Evolving Data** 세션 개요를 바탕으로 30분 분량의 HTML 발표 자료를 제작하는 저장소입니다.

## 실행

별도 빌드 없이 `index.html`을 브라우저로 열면 실행됩니다. 로컬 서버를 쓰려면 다음 명령을 실행한 뒤 <http://localhost:8000>에 접속합니다.

```bash
python3 -m http.server 8000
```

- `←` / `→`, `Page Up` / `Page Down`, `Space`: 슬라이드 이동
- `N`: 현재 슬라이드의 발표자 노트 열기
- `F`: 전체 화면 전환
- 터치 화면: 좌우 스와이프

전체 발표문과 시간 배분은 [SCRIPT.md](SCRIPT.md)에 있습니다.

### 파일 구성

- `index.html`: 27장 발표 자료와 (본편 25장 + 부록·감사) 장표별 발표자 노트 (목차 장표, 좋은 데이터/근거 분리, Agentic AI 3장 · Physical AI 3장 분리 포함)
- `styles.css`, `tokens.css`: 반응형 화면과 디자인 토큰
- `fonts/`: 삼성 원(Samsung One) 웹폰트 — 본문·제목 서체 (라틴 400/700, 한국어 400/700)
- `assets/`: 발표 이미지와 논문 원본 그림 23종 (Kaplan, InstructGPT, DeepSeek-R1, Toolformer, TheAgentCompany, Open X-Embodiment, π0/π0.5, RT-1/RT-2, DreamGen, Epoch AI 등) + NVIDIA 자료
- `app.js`: 키보드·터치 탐색, 노트와 전체 화면 제어
- `SCRIPT.md`: 30분 발표 스크립트와 리허설 메모
- `scripts/build_trend_census.py`: 2016~2026년 3대 학회 채택 논문 전수 조사 스크립트
- `data/`: 전수 조사 요약, 방법 문서, 포함 논문별 판정 근거 CSV

## 프로젝트 목표

- 발표 시간: 30분
- 발표 형식: 웹 브라우저에서 실행하는 HTML 프레젠테이션
- 발표 주제: Self-Evolving Data
- 주요 청중: AI Summit Seoul & Expo 2026 참가자
- 결과물: 발표 슬라이드, 발표자 노트 및 실행에 필요한 웹 리소스

## 발표 스토리라인

1. **지금까지의 AI 경쟁**  
   더 큰 모델과 더 많은 사람이 만든 데이터가 AI의 성능 향상을 이끌었다.

2. **새로운 병목의 등장**  
   고품질 데이터를 사람이 생산하는 속도가 AI의 학습 수요를 따라가지 못하기 시작했다.

3. **Meta와 Alexandr Wang 사례: 엔지니어가 제품 대신 학습 문제를 만든다**  
   Scale AI 창업자 Alexandr Wang이 Meta의 AI 조직을 이끄는 가운데, Meta는 약 6,500명의 엔지니어와 프로덕트 매니저로 Applied AI 조직을 구성했다. WIRED 보도에 따르면 이들은 최신 AI 모델의 훈련과 평가에 사용할 퍼즐 및 복잡한 코딩 문제를 만드는 업무를 맡았다. 최고 수준의 엔지니어를 제품 개발이 아닌 학습 데이터 제작에 투입했다는 사실은, 최첨단 AI 경쟁에서 데이터가 얼마나 중요한 병목이 되었는지를 보여준다.

   > WIRED 원문은 Applied AI 조직이 Alexandr Wang이 이끄는 Meta Superintelligence Labs를 지원한다고 보도했지만, Wang이 해당 업무를 직접 지시했다고 밝히지는 않았다.

4. **연구도 Data Selection과 Data Generation으로 옮겨 가고 있다**
   ICLR·ICML·NeurIPS의 2016~2026년 채택 논문 61,922편을 제목과 초록 기준으로 전수 조사했다. 포함 논문과 판정 근거를 별도 CSV로 공개해 수치를 다시 검토할 수 있게 했다.

5. **좋은 데이터는 무엇인가?**  
   좋은 데이터는 **모델의 학습 효율을 높이는 데이터**다. 같은 학습 예산에서 목표 성능을 더 크게 높이는 데이터를 선별하고, Meta FAIR의 Autodata처럼 학습 기여도가 높은 데이터를 자동으로 만드는 흐름을 보여준다.

6. **Self-Evolving Loop — 데이터 공장이 스스로 좋아진다**  
   AI가 문제와 풀이를 생성하고, 평가자가 좋은 시도를 선별하며, 그 데이터로 다시 학습한다. 더 강해진 모델이 다음 세대의 더 어려운 데이터를 만드는 `생성 → 평가 → 선별 → 재학습` 루프를 설명한다.

7. **Agentic AI — 데이터에서 환경으로**  
   Agent를 학습시키려면 좋은 문장만으로는 부족하다. 과제, 도구, 초기 상태, 실행 환경, 보상과 검증기를 함께 만들어야 한다. 실제 환경의 행동 기록을 고르는 단계에서 시작해, 환경을 자동 구축하고, 마침내 world model 안에서 대규모 RL 연습을 하는 단계로 발전한다.

8. **Physical AI — 데이터에서 경험으로**  
   로봇에게 필요한 데이터는 텍스트가 아니라 물리적으로 가능한 행동과 그 결과다. 적은 인간 시범을 시뮬레이션·디지털 트윈·영상 world model로 증폭해 로봇이 겪을 경험 자체를 생성하는 흐름을 보여준다.

9. **하나의 공통 구조**  
   추론 모델은 문제를, Agent는 상호작용 환경을, 로봇은 물리 세계를 생성한다. 형태는 달라도 모두 `현재 능력 측정 → 다음 경험 생성 → 결과 검증 → 재학습`이라는 같은 루프다.

10. **핵심 경쟁력의 변화**  
   경쟁력은 가장 많은 데이터를 가진 조직에서, **자기 모델의 약점을 찾아 다음에 필요한 데이터와 환경을 계속 만들어 내는 조직**으로 이동한다.

11. **마무리 메시지**  
   가장 강한 AI는 가장 많은 데이터를 가진 AI가 아니라, **자신에게 다음으로 필요한 데이터와 경험을 스스로 만들어 내는 AI**다.

## 연구 동향 통계

ICLR·ICML·NeurIPS 공식 프로그램의 2016~2026년 채택 논문 **61,922편 전체**를 수집해 제목과 공식 초록을 같은 개념 규칙으로 검사했다. 2026년은 채택 결과가 공개된 ICLR과 ICML만 포함한다.

| 채택 연도 | Data Selection | Data Generation |
| --- | ---: | ---: |
| 2016 | 19 | 11 |
| 2017 | 30 | 18 |
| 2018 | 39 | 33 |
| 2019 | 70 | 52 |
| 2020 | 73 | 91 |
| 2021 | 88 | 157 |
| 2022 | 122 | 178 |
| 2023 | 156 | 240 |
| 2024 | 221 | 293 |
| 2025 | 316 | 529 |
| 2026* | 298 | 356 |

- Data Selection: data selection·curation·filtering·pruning, coreset, active learning, curriculum, data valuation, example selection
- Data Generation: synthetic data, data generation·synthesis·augmentation, instruction·task·experience·environment generation, pseudo-labeling
- 제외: feature selection, model·weight·token pruning, 추론 시점의 sampling·selection
- 공식 프로그램에서 oral과 poster로 중복된 논문은 정규화한 제목 기준으로 한 번만 계산했다.
- ICLR 2016·2017 공식 아카이브는 초록을 일괄 제공하지 않아 해당 두 해의 ICLR 논문만 제목을 검사했다. 나머지는 제목과 초록을 모두 검사했다.
- 전체 방법과 연도·학회별 수집 범위: [`data/TREND-CENSUS-2016-2026.md`](data/TREND-CENSUS-2016-2026.md)
- 포함 논문 3,390건의 규칙·일치 문맥·공식 URL: [`data/trend-census-2016-2026.csv`](data/trend-census-2016-2026.csv)
- 재현 스크립트: [`scripts/build_trend_census.py`](scripts/build_trend_census.py)

```bash
python3 -m pip install -r scripts/requirements.txt
python3 scripts/build_trend_census.py
```

## 연구 장표 구성

*(아래는 기획 단계의 구성안 기록이다. 현행 장표 구성은 index.html과 SCRIPT.md를 따른다.)*

일반인 대상 발표이므로 논문 한 편의 알고리즘을 깊게 설명하지 않는다. **장표 한 장에 하나의 주장**을 두고, 서로 다른 연구 4개를 그 주장을 보여주는 증거로 짧게 연결한다.

| 장표 | 한 문장 스토리 | 연결할 연구 4개 |
| --- | --- | --- |
| 1. 좋은 데이터 | 좋은 데이터는 같은 예산에서 **모델의 학습 효율을 높이는 데이터**다. | Data Diet · LESS · LIMO · AIR · Meta Autodata |
| 2. Self-Evolving Loop | 문제를 만들고, 풀고, 평가하는 주체가 연결되면 데이터 공장이 스스로 발전한다. | DeepSeek-R1 · DAPO · Data Agent · Absolute Zero |
| 3. Agentic AI | Agent 시대의 데이터는 문서가 아니라 **과제·환경·행동 궤적·검증 결과**다. | SWE-smith · ByteDance Agent-World · DreamGym · Qwen-AgentWorld |
| 4. Physical AI | Physical AI 시대의 데이터는 현실을 기록한 영상이 아니라 **새로운 경험을 생성하는 세계**다. | MimicGen · RoboGen · NVIDIA Cosmos·GR00T · Qwen-RobotWorld |

### 장표 1. 좋은 데이터란 무엇인가?

핵심 문장: **좋은 데이터란 모델 학습 효율을 높이는 데이터이다.**

```text
중복되거나 이미 학습한 데이터 → 추가 학습 기여가 작다
목표 성능에 기여하는 데이터   → 같은 예산에서 성능을 더 높인다
오류·기준이 불명확한 데이터   → 학습 신호를 흐린다
```

좋은 데이터의 조건은 다음 다섯 가지로 요약한다.

- **정확성·검증 가능성:** 정답 또는 성공 여부를 확인할 수 있는가?
- **목표 관련성:** 우리가 향상하려는 능력을 실제로 요구하는가?
- **학습 기여도:** 같은 학습 예산에서 목표 성능을 얼마나 높이는가?
- **다양성:** 같은 유형과 표현만 반복하지 않고 실패의 사각지대를 넓게 덮는가?
- **학습 효과:** 이 데이터로 학습한 뒤 실제 성능이 좋아지는가?

연구 흐름은 **데이터 안에서 좋은 것을 찾는 단계**에서 **필요한 좋은 데이터를 자동으로 만드는 단계**로 이동한다.

1. [Dataset Cartography](https://aclanthology.org/2020.emnlp-main.746/), EMNLP 2020 — 학습 과정에서 각 샘플을 관찰해 쉬운 데이터, 애매하지만 유용한 데이터, 오류 가능성이 큰 데이터를 구분했다.
2. [LESS](https://proceedings.mlr.press/v235/xia24c.html), ICML 2024 — 목표 능력과 학습 영향이 맞는 데이터를 골랐고, 논문에서는 선택한 5%가 전체 데이터 학습보다 나은 경우를 보고했다.
3. [DART-Math](https://proceedings.neurips.cc/paper_files/paper/2024/hash/0ef1afa0daa888d695dcd5e9513bafa3-Abstract-Conference.html), NeurIPS 2024 — 쉬운 문제에 합성 데이터가 몰리는 현상을 피하고, 어려운 문제에 더 많은 생성 시도를 배정했다.
4. [Autodata](https://arxiv.org/abs/2606.25996), Meta FAIR 기술 보고서, 2026 — Agent가 데이터 과학자처럼 데이터를 만들고 분석하며 생성 레시피까지 반복 개선한다.

#### Meta Autodata 사례

Autodata의 Agentic Self-Instruct는 `Challenger → Weak Solver → Strong Solver → Judge`를 한 팀으로 묶는다. Weak Solver도 맞히면 너무 쉽고, Strong Solver도 풀지 못하면 너무 어렵다. Judge가 두 Solver의 차이를 보고 Challenger에게 피드백을 주며, 학습에 적합한 난이도가 될 때까지 문제와 평가 기준을 다시 만든다.

```text
원천 문서
   ↓
Challenger가 문제·정답·평가 기준 생성
   ↓
Weak Solver와 Strong Solver가 각각 풀이
   ↓
Judge가 정확성·난이도·두 Solver의 격차 평가
   ↓
너무 쉽거나 어려우면 생성 레시피 수정 ──┐
   ↑                                      │
   └──────────────────────────────────────┘
   ↓
학습에 사용할 데이터 확정 → Data Scientist Agent 자체도 meta-optimization
```

발표에서는 **전체 데이터를 반복해서 학습하는 대신 목표 성능에 더 크게 기여하는 데이터를 선별하고 생성한다**는 점을 중심으로 소개한다.

장표 마무리 문장: **“예전에는 데이터 더미에서 보석을 골랐다면, 이제는 모델의 현재 수준에 맞는 보석을 주문 제작한다.”**

### 장표 2. Self-Evolving Loop — 데이터 공장이 스스로 좋아진다

핵심 문장: **AI는 이제 정답만 생성하는 것이 아니라 다음 문제, 평가 기준, 학습 순서까지 생성하기 시작했다.**

```text
문제 생성 → 여러 풀이 생성 → 자동 평가·선별 → 재학습
    ↑                                      ↓
    └──── 더 강한 모델이 더 좋은 문제를 생성 ────┘
```

1. [Qwen2.5-Math](https://arxiv.org/abs/2409.12122), 2024 기술 보고서 — 수학 모델, 합성 SFT 데이터와 Reward Model을 반복 갱신했다.
2. [Self-Rewarding Language Models](https://icml.cc/virtual/2024/poster/35202), ICML 2024 — 모델이 답을 만들 뿐 아니라 스스로 답을 평가하는 반복 학습을 보여줬다.
3. [DeepSeek-R1](https://www.nature.com/articles/s41586-025-09422-z), Nature 2025 — 검증 가능한 결과 보상과 RL만으로도 self-reflection과 verification 행동이 나타날 수 있음을 대규모로 보여줬다.
4. [Absolute Zero](https://papers.nips.cc/paper_files/paper/2025/hash/9837dc00ff67d176373268ed48042d49-Abstract-Conference.html), NeurIPS 2025 — 외부 문제 데이터 없이 Proposer와 Solver가 문제와 curriculum을 함께 발전시킨다.

이 장에서는 개별 학습 알고리즘보다 역할의 변화를 강조한다.

- 과거: 사람이 문제를 만들고, 사람이 채점하고, AI가 답을 학습했다.
- 현재: AI가 문제와 여러 답을 만들고, 검증기나 AI Judge가 고른다.
- 다음: 현재 모델의 약점을 본 AI가 다음 학습 과정을 직접 설계한다.

장표 마무리 문장: **“데이터셋이 완성품이 아니라, 모델과 함께 계속 업데이트되는 소프트웨어가 된다.”**

### 장표 3. Agentic AI — 학습 데이터가 만들어지는 환경

핵심 문장: **Agent가 배워야 할 것은 문장의 정답이 아니라, 환경 안에서 어떤 행동을 했을 때 무엇이 일어나는가이다.**

Agentic AI에서 데이터의 단위는 한 줄의 질문·답변에서 하나의 **경험 묶음**으로 커진다.

```text
문서·코드·실패 기록
        ↓
과제 + 초기 상태 + 도구 + 실행 환경 + 채점 기준 구축
        ↓
Agent가 여러 번 행동 → 실행 기록 생성 → 성공·실패 보상
        ↓
RL로 Agent 개선 → 실패 지점에서 다음 과제와 환경 생성
        ↓
World Model이 환경 반응까지 예측 → 훨씬 많은 가상 연습
```

1. [SWE-smith](https://papers.nips.cc/paper_files/paper/2025/hash/8b86cf5ace600c48fd188efbb8dedec8-Abstract-Datasets_and_Benchmarks_Track.html), NeurIPS 2025 Datasets & Benchmarks Spotlight — 미국 대학 연구진이 128개 GitHub 저장소를 실행 가능한 환경으로 바꾸고 5만 개의 소프트웨어 엔지니어링 과제를 합성했다.
2. [Agent World Model](https://www.microsoft.com/en-us/research/publication/agent-world-model-infinity-synthetic-environments-for-agentic-reinforcement-learning/), Microsoft Research, ICML 2026 — 코드와 데이터베이스로 동작하는 1,000개의 합성 환경을 만들고 그 안에서 tool-use Agent를 RL로 학습했다.
3. [Genie 2](https://deepmind.google/blog/genie-2-a-large-scale-foundation-world-model/), Google DeepMind, 2024 — 한 장의 이미지에서 행동 가능한 3D 세계를 생성한다. 업무용 Agent 연구와는 결이 다르지만, Agent가 생성된 환경 안에서 경험을 수집하는 방향을 보여준다.
4. [Qwen-AgentWorld](https://arxiv.org/abs/2606.24597), Qwen Team 기술 보고서, 2026년 6월 — 1,000만 건 이상의 실제 환경 interaction trajectory로 터미널·검색·MCP·SWE·웹·OS·Android 등 7개 환경의 다음 상태를 예측하는 language world model을 만들고 Agent RL의 simulator로 사용했다.

이 네 연구는 다음과 같은 변화를 한 장에서 보여준다.

| 단계 | 데이터의 의미 | 대표 사례 |
| --- | --- | --- |
| 1 | 실제 코드에서 과제와 검증 가능한 실행 환경을 자동 구축한다. | SWE-smith |
| 2 | 원하는 유형의 실행 환경 자체를 합성하고 RL을 수행한다. | Microsoft Agent World Model |
| 3 | Agent가 행동할 수 있는 3D 학습 세계를 생성한다. | Google DeepMind Genie 2 |
| 4 | 환경 반응을 예측하는 모델 안에서 대규모 가상 RL을 한다. | Qwen-AgentWorld |

장표 마무리 문장: **“Agent 시대에는 데이터셋을 사는 것이 아니라, Agent가 매일 연습할 RL Gym(체육관)을 만든다.”**

### 장표 4. Physical AI — 현실을 기록하는 대신 경험을 생성한다

핵심 문장: **로봇의 데이터 병목은 인터넷에 없는 행동과 실패를 현실에서 반복해야 한다는 데 있고, 해법은 현실을 복제한 뒤 경험을 생성하는 것이다.**

```text
소수의 인간 시범·실제 영상
           ↓
디지털 트윈·시뮬레이션에서 물체·배경·과제·난이도 변형
           ↓
합성 motion trajectory + 미래 video + 성공·실패 결과 생성
           ↓
Robot Policy 학습 → 실제 로봇 실행 → 실패와 새 장면을 다음 생성에 반영
```

1. [MimicGen](https://proceedings.mlr.press/v229/mandlekar23a.html), CoRL 2023 — 인간 시범 200개를 다양한 장면과 로봇에 맞게 변형해 5만 개 이상의 로봇 시범을 생성했다.
2. [RoboGen](https://proceedings.mlr.press/v235/wang24cc.html), ICML 2024 — 로봇이 배울 과제, 장면, 하위 과제와 학습 supervision까지 자동 생성하는 `propose → generate → learn` 구조를 제안했다.
3. [NVIDIA Cosmos](https://arxiv.org/abs/2501.03575)·[GR00T N1](https://research.nvidia.com/publication/2025-03_nvidia-isaac-gr00t-n1-open-foundation-model-humanoid-robots), 2025 — World Foundation Model, 디지털 트윈과 합성 trajectory를 결합한 산업 규모의 Physical AI data factory다. NVIDIA는 [GR00T 합성 데이터 파이프라인](https://developer.nvidia.com/blog/building-a-synthetic-motion-generation-pipeline-for-humanoid-robot-learning/)에서 11시간 동안 78만 개 trajectory를 생성하고 실제 데이터와 함께 학습했을 때 40% 성능 향상을 보고했다. 최신 후속 연구는 [Cosmos 3](https://arxiv.org/abs/2606.02800)이다.
4. [Qwen-RobotWorld](https://arxiv.org/abs/2606.17030), Qwen Team 기술 보고서, 2026년 6월 — 자연어 행동 조건으로 로봇 조작·자율주행·실내 이동의 물리적 미래 영상을 생성해 policy 학습, 평가와 planning에 쓰는 video world model이다.

Physical AI 장에서는 과장을 피하기 위해 현재 위치도 함께 말한다. 합성 세계와 실제 세계 사이에는 여전히 차이가 있고, 실제 로봇의 실패가 자동으로 다음 세계의 생성과 난이도 조절까지 이어지는 완전한 self-evolving loop는 아직 진행 중이다. 다만 **현실의 경험을 복사하는 단계에서, 필요한 경험을 생성하는 단계로 이동했다**는 방향은 분명하다.

장표 마무리 문장: **“로봇의 다음 데이터셋은 파일이 아니라, 수없이 다시 실행할 수 있는 세계다.”**

### 네 장을 잇는 발표 문장

1. “논문 수가 늘었다는 것보다 중요한 질문은 하나입니다. 그래서 좋은 데이터가 뭘까요?”
2. “좋은 데이터를 고르는 데서 한 걸음 더 나아가, 이제는 필요한 난이도의 데이터를 직접 만듭니다.”
3. “그런데 Agent가 등장하면 문제만 만들어서는 부족합니다. 문제를 풀 환경까지 만들어야 합니다.”
4. “그리고 그 환경이 브라우저를 넘어 현실이 되는 순간, Self-Evolving Data는 Physical AI의 경험 생성 문제가 됩니다.”
5. “결국 추론 AI, Agent AI, Physical AI의 차이는 생성하는 데이터의 형태일 뿐, 자기 약점을 다음 학습 경험으로 바꾸는 루프는 같습니다.”

### 30분 배분

시간 배분은 [SCRIPT.md](SCRIPT.md)의 시간표를 따른다 (본편 25장 합계 30:00, 부록·감사는 시간 외).

### 마지막 장표 — 마무리 메시지

화면에는 다음 한 문장만 크게 남긴다.

> **가장 강한 AI는 가장 많은 데이터를 가진 AI가 아니라, 자신에게 다음으로 필요한 데이터와 경험을 스스로 만들어 내는 AI다.**

발표 마무리는 다음 세 단계로 정리한다.

1. **데이터의 역할이 달라졌다.** 데이터는 한 번 만들어 소비하는 원료가 아니라, 모델의 약점을 발견하고 다음 학습을 설계하는 시스템이 되고 있다.
2. **AI가 만드는 대상이 확장되고 있다.** 추론 모델은 문제를 만들고, Agent는 연습할 환경을 만들며, Physical AI는 경험할 세계를 만든다.
3. **경쟁력의 기준도 달라진다.** 앞으로 중요한 것은 데이터 보유량이 아니라 `생성 → 평가 → 선별 → 학습` 루프를 얼마나 빠르고 신뢰성 있게 돌릴 수 있는가이다.

#### 약 40초 클로징 멘트

> 지금까지 데이터는 사람이 만들어 AI에 공급하는 원료였습니다. 하지만 이제 AI는 자신의 약점을 찾고, 다음에 풀 문제를 만들고, Agent가 연습할 환경과 로봇이 경험할 세계까지 생성하기 시작했습니다. 결국 Self-Evolving Data의 핵심은 데이터가 많다는 것이 아닙니다. 더 나은 데이터를 계속 만들어 내는 루프를 갖는 것입니다. 앞으로 가장 강한 AI는 가장 많은 데이터를 가진 AI가 아니라, 자신에게 다음으로 필요한 경험을 스스로 만들어 내는 AI가 될 것입니다.

## 행사 개요

- 장소: 서울 코엑스 Hall B 및 그랜드볼룸
- 컨퍼런스: 2026년 8월 19일(수)~20일(목)
- 엑스포: 2026년 8월 19일(수)~21일(금)
- 주최·주관: 코엑스, DMK Global, 한국무역협회

## 김민수 발표

- 일자: 2026년 8월 20일(목), Day 2
- 트랙: Track D — Data Infrastructure
- 발표 주제: **Self-Evolving Data: How AI Learns to Create Its Own Data**
- 한국어 제목: **자기 진화형 데이터: AI는 어떻게 스스로 데이터를 생성하고 학습하는가**
- 발표자: 김민수 책임, 삼성전자
- 발표 시각: 공식 프로그램에 아직 공개되지 않음

### 세션 개요

AI 개발의 중심이 단순히 더 큰 모델을 만드는 것에서, AI가 지속적으로 더 좋은 학습 데이터를 생성하고 발전시키는 방향으로 이동하는 현상을 다룬다. 사람이 직접 만드는 고품질 데이터의 공급이 AI 발전 속도를 따라가기 어려워지면서, AI가 데이터를 생성하고 평가한 뒤 다시 학습에 사용하는 **Self-Evolving Loop**가 새로운 학습 방식으로 부상하고 있다.

세션에서는 이 자기 진화형 데이터 방식이 실제 모델 성능에 미치는 영향과 향후 Agent AI 및 Physical AI에서 갖는 의미를 최신 연구 사례를 바탕으로 살펴본다.

주요 내용은 다음과 같다.

- 모델 크기보다 데이터 생성 역량이 AI 경쟁력을 좌우하게 된 배경
- 사람이 만든 데이터에서 AI가 생성·개선하는 데이터로의 전환
- Self-Evolving Data가 추론 모델과 AI Agent를 향상시키는 원리
- 데이터의 양보다 좋은 데이터를 선별하고 발전시키는 과정의 중요성
- 최신 연구를 통해 살펴보는 향후 AI 개발 방식의 변화

### 발표자 소개

김민수 책임은 Samsung Research AI Center에서 최신 학술 연구를 실제 제품 기술로 연결하는 업무를 수행했으며, 스마트폰·스마트TV·가전제품의 AI 서비스 상품화 경험을 보유하고 있다. 현재 삼성전자 DA(생활가전)사업부에서 냉장고용 On-Device AI 식품 인식 서비스를 개발하고 있다.

> 프로그램 세부 내용과 연사 구성은 업데이트 중이며 변경될 수 있습니다.

## 공식 링크

- [AI Summit Seoul 2026 프로그램](https://www.aisummitseoul.com/agenda)
- [김민수 세션 및 발표자 소개](https://www.aisummit.co.kr/ms-kim-samsung)
- [AI Summit Seoul & Expo 공식 홈페이지](https://www.aisummit.co.kr/)
- [코엑스 행사 안내](https://www.coex.co.kr/exhibitions/ai%EC%84%9C%EB%B0%8B%EC%84%9C%EC%9A%B8%EC%95%A4%EC%97%91%EC%8A%A4%ED%8F%AC/)

## 참고 자료

- [WIRED: Meta의 Applied AI 조직과 AI 학습용 퍼즐 제작 보도](https://www.wired.com/story/mark-zuckerberg-meta-employee-meeting-interrupt-ai/)
- [AP: Meta의 Scale AI 투자 및 Alexandr Wang 영입](https://apnews.com/article/4b55aabf7ea018e38ffdccb66e37cf26)

마지막 확인: 2026년 7월 16일

<!-- repo-design:start -->
## 설계 구조

이 저장소는 **정적 웹 애플리케이션** 형태로 구성한다.

### 설계 원칙

- HTML 구조, 스타일, 상호작용 로직, 정적 자산을 분리해 브라우저 실행 흐름을 단순하게 유지한다.
- 빌드 서버 없이도 재현 가능한 정적 배포 단위를 우선한다.

### 실행·데이터 흐름

1. 브라우저가 `index.html`을 문서 진입점으로 로드한다.
2. `styles.css`에서 표현을 담당하고 `app.js`에서 상호작용을 연결한다.
3. `data/`의 카탈로그와 콘텐츠를 화면 로직이 읽어 사용자별 상태를 구성한다.

### 모듈 책임

| 경로 | 책임 |
|---|---|
| `scripts/` | 설치·실행·배포·분석 자동화 |
| `data/` | 입력 데이터와 생성 중간물 |
| `assets/` | 이미지·음원·폰트 등 정적 자산 |
| `fonts/` | fonts 기능과 관련 구현·자산의 모듈 경계 |
| `.hallmark/` | .hallmark 기능과 관련 구현·자산의 모듈 경계 |
| `index.html` | 브라우저 문서 진입점 |

### 파일 구조

```text
ai-summit-2026/
├── .hallmark/
│   ├── log.json
│   └── preflight.json
├── assets/
│   ├── papers/
│   ├── gtc2026-jensen-huang.jpg
│   └── linkedin-qr.svg
├── data/
│   ├── trend-census-2016-2026.csv
│   ├── TREND-CENSUS-2016-2026.md
│   └── trend-census-summary.json
├── fonts/
│   ├── SamsungOne-400.woff2
│   ├── SamsungOne-700.woff2
│   ├── SamsungOneKorean-400.woff2
│   └── SamsungOneKorean-700.woff2
├── scripts/
│   ├── build_trend_census.py
│   └── requirements.txt
├── app.js
├── index.html
├── README.md
├── SCRIPT.md
├── styles.css
└── tokens.css
```
<!-- repo-design:end -->
