2026. 08. 20 · COEX SEOUL
SELF-EVOLVING
DATA
스스로 학습하는 AI, 진화하는 데이터
v2026.08.12.1
TODAY'S MESSAGE
오늘 전하고 싶은 이야기.Today's Message
- 00LLM은 어떻게 발전해 왔는가
- 01규모의 공식과 한계
- 02좋은 데이터란? — 양보다 질
- 03Self-Evolving Loop — 생성·검증·선별·학습
- 04Agentic AI — Agent의 발전과 Environment(환경)
- 05Physical AI — 로봇의 발전과 Experience(경험)
- 06하나의 공통 구조
도메인이 바뀌어도 법칙은 하나다.
생성 → 검증 → 선별 → 학습 AI가 스스로 학습할 생태계를 만드는 기술이 핵심이 된다.00LLM은 어떻게 발전해 왔는가
MODEL TRACK 1 · LLM
LLM은 크기에서 추론으로 발전했다.LLMs Advanced from Scale to Reasoning
더 큰 모델 → 지시를 따르는 모델 → 오래 생각하는 모델. 단계마다 필요한 데이터가 바뀌었다.
GPT-3 2020 · Figure 1.2
InstructGPT 2022 · Figure 2
DeepSeek-R1 2025 · Figure 2
모델이 도약할 때마다 먼저 바뀐 것은 학습 데이터의 종류였다.
- Scaling Laws for Neural Language Models (Kaplan et al., OpenAI 2020) — arXiv:2001.08361
- Training Language Models to Follow Instructions with Human Feedback (Ouyang et al., NeurIPS 2022) — arXiv:2203.02155
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL (DeepSeek-AI, Nature 2025) — arXiv:2501.12948
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale (Yu et al., NeurIPS 2025) — arXiv:2503.14476
- Kimi K3: Open Frontier Intelligence (Kimi Team, 2026) — arXiv:2607.24653
- Language Models are Few-Shot Learners (Brown et al., NeurIPS 2020) — arXiv:2005.14165
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (Wei et al., NeurIPS 2022) — arXiv:2201.11903
- Kimi k1.5: Scaling Reinforcement Learning with LLMs (Kimi Team, 2025) — arXiv:2501.12599
01규모의 공식과 한계
THE OLD RACE
크게. 더 크게.Bigger. And Bigger.
모델의 크기와 사람이 만든 데이터의 양이 성능을 밀어 올렸다.
규모의 효과는 과제 간 간섭 감소로 설명된다 — 뒤집으면, 능력을 결정하는 것은 그 능력을 요구하는 데이터의 빈도다.
그리고 키우는 쪽의 청구서도 커지고 있다 — HBM 메모리, 전력, 데이터센터 인프라가 전 세계적으로 부족하다.
- Scaling Laws for Neural Language Models (Kaplan et al., OpenAI 2020) — arXiv:2001.08361
- Training Compute-Optimal Large Language Models (Hoffmann et al., DeepMind 2022) — arXiv:2203.15556
- Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention (Huang et al., Stanford·Harvard·MIT·Anthropic 2026) — arXiv:2605.29548
- Compute Trends Across Three Eras of Machine Learning (Sevilla et al., IJCNN 2022) — arXiv:2202.05924
- Emergent Abilities of Large Language Models (Wei et al., TMLR 2022) — arXiv:2206.07682
- The Quantization Model of Neural Scaling (Michaud et al., NeurIPS 2023) — arXiv:2303.13506
01규모의 공식과 한계
THE NEW BOTTLENECK
이제 병목은 모델이 아니라 데이터다.The Bottleneck Is No Longer the Model — It's Data
- 01
비용 — 전문가 시급 $80~500+ · frontier lab당 사람 데이터 지출 연 10억 달러.
- 02
오염 — 크라우드워커의 33~46%가 작문 과제를 LLM으로 처리.
- 03
공급 — 사람이 만든 공개 텍스트는 2028~2032년 소진 전망(Epoch AI).
- 04
반복 — 재사용 효과는 4 epoch까지 · 그 이상은 수확 급감.
- 05
분포 — frontier급 난제는 인터넷에 애초에 없다(tail problem).
사람 텍스트가 바닥나는 시점파란 실선(모델이 요구하는 데이터 양)이 청록 띠(사람이 만든 텍스트 재고)를 2028년 전후에 따라잡는다. 5배 과학습 기준이면 더 이르다.
- AI Trainer Hourly Rates (2026) — Mercor (mercor.com)
- Crowd Workers Widely Use LLMs (Veselovsky et al., 2023) — arXiv:2306.07899
- Will We Run Out of Data? (Villalobos et al., Epoch AI, ICML 2024) — arXiv:2211.04325
- Scaling Data-Constrained Language Models (Muennighoff et al., NeurIPS 2023) — arXiv:2305.16264
- Large Language Models Struggle to Learn Long-Tail Knowledge (Kandpal et al., ICML 2023) — arXiv:2211.08411
- To Repeat or Not To Repeat: Insights from Scaling LLM under Token-Crisis (Xue et al., NeurIPS 2023) — arXiv:2305.13230
- AI Models Collapse When Trained on Recursively Generated Data (Shumailov et al., Nature 2024) — arXiv:2305.17493
모델만 키워서는 해결할 수 없다. 이제는 스스로 개선되는 데이터가 필요하다.
01규모의 공식과 한계
DATA IS THE NEW MOAT
데이터 구축에 막대한 자금이 투입된다.Massive Capital Is Flowing into Data Creation
전문가가 만드는 학습 데이터 시장이 frontier lab 경쟁의 핵심 인프라가 됐다.
보도에 따르면 M***는 엔지니어·PM 약 6,500명 규모의 Applied AI 조직에 frontier model의 훈련·평가에 쓸 퍼즐과 복잡한 코딩 문제 제작을 맡겼다 (원문 ↗). 금액은 각 보도 기준이며, 창업자가 퍼즐 업무를 직접 지시했다는 보도는 아니다.
01규모의 공식과 한계
ICLR · ICML · NEURIPS · 2016 → 2026 · 61,922 PAPERS
연구의 관심도 데이터로 옮겨 갔다.Research Attention Has Shifted to Data
3대 ML 학회 채택 논문 전체의 제목과 초록을 같은 기준으로 분류한 연도별 논문 수
전수 조사 공식 프로그램 61,922편을 제목·초록 기준으로 검사했다. 표본 선택·정제·능동학습·커리큘럼과 합성 데이터·증강·과제·경험 생성을 포함하고, feature selection·model pruning·추론 시점 sampling은 제외했다.
검증 자료 방법과 범위 ↗ · 포함 논문 3,390건과 판정 근거 CSV ↗ · 재현 스크립트 ↗
*2026년은 ICLR·ICML만 포함했다. NeurIPS 2026 채택 결과는 아직 공개되지 않았다.
02좋은 데이터란? — 양보다 질
GOOD DATA ≠ MORE DATA
좋은 데이터는 어떤 데이터인가.What Counts as Good Data?
데이터를 고르는 기준도 연구가 됐다 — 학습 전에 한 번 재던 방식에서, 학습 중에 다시 재는 방식으로.
① 전통적 방식 · 학습 전에 데이터를 잰다
- 분포·다양성 임베딩 커버리지, 클러스터 균형, 의미 중복 제거SemDeDup
- 불확실성 entropy · margin · least confidenceActive Learning
- 난이도 forgetting events, EL2N·GraNd 점수Data Diet
- 표면 품질 perplexity 필터, 규칙 정제, LLM 심사 점수AlpaGasus
한계 — 학습이 시작되기 전 한 번 매긴 점수를 끝까지 재사용한다. 모델이 이미 배운 것을 반영하지 못한다.
② 동적 방식 · 학습 도중에 다시 잰다
- gradient 유사도 목표 과제의 기울기와 정렬된 표본만 선택LESS
- 영향함수(Influence Function) 이 표본을 빼면 목표 손실이 얼마나 변하는가Influence
- dual · bilevel 바깥 루프에서 도메인·표본 가중치를 최적화DoReMi
- 학습 중 손실 줄일 수 있는 손실만 골라 토큰 단위까지 선별RHO-LOSS · Rho-1
전환점 — 데이터의 가치는 고정값이 아니라 모델과 학습 시점의 함수다.

분포·난이도·품질처럼 데이터 자체의 점수를 학습 전에 한 번 매겨 데이터셋을 고정한다. 싸고 확장 가능하지만, 모델이 성장해도 같은 데이터를 고른다.
지금 모델에게 무엇이 필요한지를 학습 도중 다시 계산한다. 같은 데이터라도 시점에 따라 가치가 달라진다 — 선별이 학습 루프 안으로 들어온다.
전제 · Data-Centric AI — 모델을 그대로 두고 데이터만 정리해도 성능은 오른다. Andrew Ng는 강판 결함 검출에서 모델 튜닝으로는 76.2%가 그대로였지만, 라벨 기준을 통일하고 데이터를 정리하자 93.1%로 올랐다고 보고했다.
- Prioritized Training on Points that are Learnable, Worth Learning, and Not Yet Learnt (Mindermann et al., ICML 2022) — arXiv:2206.07137
- Deep Learning on a Data Diet: Finding Important Examples Early in Training (Paul et al., NeurIPS 2021) — arXiv:2107.07075
- LESS: Selecting Influential Data for Targeted Instruction Tuning (Xia et al., ICML 2024) — arXiv:2402.04333
- BWS: Best Window Selection Based on Sample Scores for Data Pruning across Broad Ranges (Choi et al., ICML 2024) — arXiv:2406.03057
- SemDeDup: Data-efficient learning at web-scale through semantic deduplication (Abbas et al., 2023) — arXiv:2303.09540
- DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining (Xie et al., NeurIPS 2023) — arXiv:2305.10429
- Rho-1: Not All Tokens Are What You Need (Lin et al., NeurIPS 2024) — arXiv:2404.07965
02좋은 데이터란? — 양보다 질
DEFINITION → EVIDENCE → SYSTEM
좋은 데이터란 모델 학습 효율을 높이는 데이터다.Good Data Raises Training Efficiency
전체를 반복해서 학습하는 대신, 목표 성능에 더 크게 기여하는 데이터를 선별하고 생성한다.
목표 능력 기준으로 고른 5% 데이터 학습이 전체 데이터 학습을 능가했다.
고품질 추론 예제 800개 SFT만으로 AIME24 63.3%, MATH500 95.6%를 기록했다.
데이터 과학자를 시스템으로Challenger가 문제를 내고, 두 Solver의 성패 차이로 난이도를 재고, Judge가 생성 레시피를 고친다.
좋은 데이터는 어려운 데이터가 아니라 지금 이 모델이 아직 못 배운 데이터다.
- LESS: Selecting Influential Data for Targeted Instruction Tuning (Xia et al., ICML 2024) — arXiv:2402.04333
- LIMO: Less is More for Reasoning (Ye et al., COLM 2025) — arXiv:2502.03387
- Autodata: An Agentic Data Scientist to Create High Quality Synthetic Data (Kulikov et al., Meta FAIR 2026) — arXiv:2606.25996
- LIMA: Less Is More for Alignment (Zhou et al., NeurIPS 2023) — arXiv:2305.11206
- s1: Simple test-time scaling (Muennighoff et al., 2025) — arXiv:2501.19393
- Self-Instruct: Aligning Language Models with Self-Generated Instructions (Wang et al., ACL 2023) — arXiv:2212.10560
03SELF-EVOLVING LOOP — 생성·검증·선별·학습
THE LOOP CLOSES
데이터도 Closed-Loop가 중요하다.Data Needs a Closed Loop, Too
생성 → 검증 → 선별 → 학습이 닫힌 고리(폐루프)로 이어질 때, 데이터는 스스로 진화한다. 이 네 단계가 오늘 발표 전체를 관통하는 법칙이다.
감독이 사라지는 순서지도학습 → 검증 가능한 보상 RL → 스스로 문제를 내고 푸는 self-play. 갈수록 사람이 주는 데이터가 없어진다.
DATA
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (DeepSeek-AI, Nature 2025) — arXiv:2501.12948
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale (Yu et al., NeurIPS 2025) — arXiv:2503.14476
- Data Agent: Learning to Select Data via End-to-End Dynamic Optimization (Yang et al., ICML 2026) — arXiv:2603.07433
- Absolute Zero: Reinforced Self-play Reasoning with Zero Data (Zhao et al., NeurIPS 2025) — arXiv:2505.03335
- Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models (Zhao et al., 2026) — arXiv:2601.18734
- STaR: Bootstrapping Reasoning With Reasoning (Zelikman et al., NeurIPS 2022) — arXiv:2203.14465
- Self-Rewarding Language Models (Yuan et al., ICML 2024) — arXiv:2401.10020
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training (Lambert et al., 2024) — arXiv:2411.15124
04AGENTIC AI — 데이터에서 Environment(환경)로
MODEL TRACK 2 · AGENTIC AI
Agent는 대화에서 자율 행동으로 발전했다.Agents Advanced from Chat to Autonomous Action
묻고 답하는 모델 → 도구를 쓰는 모델 → 스스로 일하는 모델.
InstructGPT 2022 · Figure 1
Toolformer 2023 · Figure 2
TheAgentCompany 2024 · Figure 1
행동이 길어질수록 필요한 것은 정답 문장이 아니라 시행착오 데이터다.
- Toolformer: Language Models Can Teach Themselves to Use Tools (Schick et al., NeurIPS 2023) — arXiv:2302.04761
- TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks (Xu et al., 2024) — arXiv:2412.14161
- Kimi K2: Open Agentic Intelligence (Kimi Team, 2025) — arXiv:2507.20534
- Scaling Agent Learning via Experience Synthesis (Chen et al., ICLR 2026) — arXiv:2511.03773
- ReAct: Synergizing Reasoning and Acting in Language Models (Yao et al., ICLR 2023) — arXiv:2210.03629
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments (Xie et al., NeurIPS 2024) — arXiv:2404.07972
- UI-TARS: Pioneering Automated GUI Interaction with Native Agents (Qin et al., 2025) — arXiv:2501.12326
04AGENTIC AI — 데이터에서 Environment(환경)로
AGENTIC AI · WHY ENVIRONMENTS
법칙은 같다. 검증하는 주체가 환경으로 바뀐다.Same Law — the Environment Now Does the Verifying
Closed-Loop(폐루프)가 무엇을 반복하는가라면, Environment는 그 반복이 어디서 일어나는가이다. Agent에게는 이 장소가 없으면 법칙 자체가 작동하지 않는다.
텍스트 도메인에서는
검증이 함수 한 줄이었다정답이 정해져 있으니 채점기가 맞았는지 알려 준다. 법칙을 작동시키는 데 필요한 것은 데이터셋과 채점 규칙뿐이었다.
Agent 도메인에서는
실행해 봐야 알 수 있다정답이 하나가 아니고, 결과는 상태와 도구에 따라 달라진다. 채점기 자리에 실행 가능한 세계가 들어와야 법칙이 작동하기 시작한다. 그래서 그 세계를 모델로 생성하거나(Qwen-AgentWorld) 제품으로 사들이는(N*** NeMo Gym) 경쟁이 시작됐다.

Agent 시대에는 데이터셋을 사는 것이 아니라 연습할 RL Gym(체육관)을 만든다.
04AGENTIC AI — 데이터에서 Environment(환경)로
AGENTIC AI · PIPELINE
Agent는 환경에서 시행착오 데이터를 만든다.Agents Create Trial-and-Error Data in Environments
실행 가능한 과제와 채점 기준을 만들고, 반복 실행에서 얻은 성공과 실패를 학습에 사용한다.
같은 저장소 수에서 사람이 만든 SWE-bench보다 과제 수가 한 자릿수 이상 커진다.
arXiv:2504.21798 ↗수집
채점 기준
반복 실행
학습
예측
CASES · 환경 구축 사례
- SWE-smith: Scaling Data for Software Engineering Agents (Yang et al., NeurIPS 2025) — arXiv:2504.21798
- Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence (Dong et al., 2026) — arXiv:2604.18292
- Scaling Agent Learning via Experience Synthesis (Chen et al., ICLR 2026) — arXiv:2511.03773
- Qwen-AgentWorld: Language World Models for General Agents (Zuo et al., Qwen Team 2026) — arXiv:2606.24597
- Learn-by-interact: A Data-Centric Framework for Self-Adaptive Agents in Realistic Environments (Su et al., 2025) — arXiv:2501.10893
- OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis (Sun et al., ACL 2025) — arXiv:2412.19723
- WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning (Qi et al., ICLR 2025) — arXiv:2411.02337
04AGENTIC AI — 데이터에서 Environment(환경)로
AGENTIC AI · QUALITY OVER QUANTITY
Agent 데이터도 양보다 질이다.For Agent Data, Quality Beats Quantity, Too
질 좋은 데이터는 환경에서 나온다 — 실행이 검증한 성공과, 회복을 가르치는 실패다.
잘 통제된 환경에서 성공한 trajectory만 걸러(rejection sampling) 학습했다. 시나리오대로 흘러갈 때는 잘하지만, 쉬운 과제에 편향되고 막히면 회복하지 못한다.
모호한 지시와 도구 실패가 섞인, 실제를 닮은 환경에서 실패 기록까지 함께 학습한다. 막히면 방향을 바꾸고 도구를 다시 고르는 회복(recovery)을 여기서 배운다.
실패는 버리는 데이터가 아니라 회복(recovery)을 가르치는 데이터다.
- Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents (Song et al., ACL 2024) — arXiv:2403.02502
- Exploring Expert Failures Improves LLM Agent Tuning (Lan et al., 2025) — arXiv:2504.13145
- Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments (Chen et al., 2026) — arXiv:2605.27209
- Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents (Wang et al., 2024) — arXiv:2402.11651
- LIMI: Less is More for Agency (Xiao et al., 2025) — arXiv:2509.17567
- AgentRefine: Enhancing Agent Generalization through Refinement Tuning (Fu et al., ICLR 2025) — arXiv:2501.01702
04AGENTIC AI — 데이터에서 Environment(환경)로
AGENTIC AI · CASE
RL Gym(체육관)이 인프라가 된다.RL Gyms Become Infrastructure
Agent의 연습 환경이 제품과 표준, 유통 플랫폼으로 확장되며 새로운 산업이 됐다.
표준 인터페이스 step() · reset() · state · reward — 성공·실패 rollout이 학습 데이터가 된다
Agent가 과제와 상호작용하고 행동의 결과를 보상으로 돌려받으며 반복 연습하는 강화학습 훈련 환경이다. 환경을 표준 인터페이스로 만들어 어떤 학습 알고리즘과도 연결할 수 있게 한 O*** Gym에서 유래한 개념으로, Agent 시대에는 이 연습 환경 자체가 데이터 인프라가 된다.
젠슨 황은 GTC 2026 키노트에서 Agentic AI를 다음 단계로 지목했다. NeMo Gym은 수학·코딩·도구 사용 환경 카탈로그(RL Hub)와 10개 이상의 RL 환경, 90만+ 과제 데이터를 NeMo RL 분산 학습과 결합한다.
제각각이던 실행 환경을 Gymnasium 스타일 API(step·reset·state)로 표준화한 오픈 스펙이자 허브. N***·MS***·PR*** 등이 기술 위원회로 참여한다.
커뮤니티가 RL 환경을 만들어 공유하는 허브. verifiers 스펙 기반 오픈소스 환경 2,500개 이상이 등록돼, 연습 환경 자체가 유통되는 생태계가 됐다.
05PHYSICAL AI — 데이터에서 Experience(경험)로
MODEL TRACK 3 · PHYSICAL AI
로봇은 전용 제어에서 파운데이션 모델로 발전했다.Robots Advanced from Bespoke Control to Foundation Models
한 로봇 한 작업 → Teleoperation 시범 모방 → 보고 이해하고 행동하는 VLA.
RT-1 2022 · Figure 1
RT-2 2023 · Figure 1
π0 2024 · Architecture
모델 구조는 준비됐다 — 병목은 전문가 Teleoperation 시범, 몸으로 겪은 경험 데이터다.
- RT-1: Robotics Transformer for Real-World Control at Scale (Brohan et al., 2022) — arXiv:2212.06817
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (Zitkovich et al., CoRL 2023) — proceedings.mlr.press
- π0: A Vision-Language-Action Flow Model for General Robot Control (Physical Intelligence, 2024) — arXiv:2410.24164
- Learning to Move Before Learning to Do: Task-Agnostic Pretraining for VLAs (2026) — arXiv:2607.02466
- OpenVLA: An Open-Source Vision-Language-Action Model (Kim et al., CoRL 2024) — arXiv:2406.09246
- Octo: An Open-Source Generalist Robot Policy (Octo Model Team, RSS 2024) — arXiv:2405.12213
- Gemini Robotics: Bringing AI into the Physical World (Google DeepMind, 2025) — arXiv:2503.20020
05PHYSICAL AI — 데이터에서 Experience(경험)로
PHYSICAL AI · WHY EXPERIENCE
로봇 데이터의 단위는 한 장면이 아니라 한 번의 시도다.The Unit of Robot Data Is an Attempt, Not a Frame
한 번의 시도를 이루는 초기 상태 → 행동 → 물리 세계의 반응 → 성공 여부를 이어 붙인 한 줄(trajectory). 사진 한 장, 라벨 한 줄과 달리 내가 한 행동과 그 결과가 함께 들어 있어야 정책을 학습할 수 있다.
Silver & Sutton (2025) — 스스로 만든 경험에서 배우는 경험의 시대(Era of Experience) ↗
실제 영상
장면 변형
생성
현실 실행
실제 시범은 모으기 어렵다22개 기종을 다 합쳐도 100만 에피소드. 기종·장면·스킬 분포는 소수에 쏠린 긴 꼬리다.
부족한 시범은 만들어 불린다적은 Teleoperation 시범으로 world model을 학습해, 합성 영상과 pseudo action으로 경험을 생성한다.
05PHYSICAL AI — 데이터에서 Experience(경험)로
PHYSICAL AI · RESEARCH
Teleoperation 시범 200개가 Experience(경험) 5만 개가 된다.200 Demonstrations Become 50,000 Experiences
적은 수의 Teleoperation 시범을 시뮬레이션과 World Model로 크게 불리는 연구가 이어지고 있다.
시범을 쪼개서 재조합한다Teleoperation 시범을 부분 과제로 나누고, 새 물체 배치에 맞게 변형해 합성 시범을 만든다.
과제부터 만들어 낸다언어로 준 과제를 하위 동작으로 나눠, 시뮬레이션에서 수행 장면과 supervision까지 자동 생성한다.
- MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations (Mandlekar et al., CoRL 2023) — arXiv:2310.17596
- RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation (Wang et al., ICML 2024) — arXiv:2311.01455
- Cosmos World Foundation Model Platform for Physical AI (NVIDIA, 2025) — arXiv:2501.03575
- Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation (Zhang et al., Qwen Team 2026) — arXiv:2606.17030
- RLVR-World: Training World Models with Reinforcement Learning (Wu et al., NeurIPS 2025) — arXiv:2505.13934
- World Model for Robot Learning: A Comprehensive Survey (Hou et al., 2026) — arXiv:2605.00080
- DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning (Jiang et al., ICRA 2025) — arXiv:2410.24185
- GenSim: Generating Robotic Simulation Tasks via Large Language Models (Wang et al., ICLR 2024) — arXiv:2310.01361
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (NVIDIA, 2025) — arXiv:2503.14734
05PHYSICAL AI — 데이터에서 Experience(경험)로
PHYSICAL AI · QUALITY OVER QUANTITY
로봇에서도 답은 양보다 질이다.For Robots Too, Quality Beats Quantity
한 번의 시도에 실제 하드웨어와 사람의 시간이 든다. 그래서 어떤 경험을 남길지가 곧 비용이다.
여섯 개 오프라인 학습 알고리즘을 질이 다른 데이터셋으로 비교한 결과, 성능은 Teleoperation 시범의 질과 조작자 편차에 크게 좌우됐다.
로봇 사전학습 데이터의 도메인 비율을 DRO로 조정해 최악 성능을 끌어올린다. 무엇을 학습할지 자체를 묻기 시작한 연구다.
영향함수(Influence Function)로 Teleoperation 시범 하나하나가 정책의 기대 성능에 주는 기여를 추정한다. 큐레이션한 33% 미만 데이터로 RoboMimic 최고 수준 policy를 학습했다.

π0.5는 Teleoperation 시범을 모은 가정을 3곳에서 104곳으로 늘릴수록 처음 보는 집에서의 일반화가 좋아졌다. 같은 집에서 시범을 더 쌓는 것보다 새로운 환경을 하나 더 겪는 것이 정책을 바꿨다. 텍스트에서 본 영향함수(Influence Function)·gradient 기반 선택이 로봇에서는 하드웨어 시간을 아끼는 문제로 그대로 돌아온다.
- What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (Mandlekar et al., CoRL 2021) — arXiv:2108.03298
- Re-Mix: Optimizing Data Mixtures for Large Scale Imitation Learning (Hejna et al., CoRL 2024) — arXiv:2408.14037
- CUPID: Curating Data your Robot Loves with Influence Functions (2025) — arXiv:2506.19121
- π0.5: A Vision-Language-Action Model with Open-World Generalization (Physical Intelligence, 2025) — arXiv:2504.16054
- Data Quality in Imitation Learning (Belkhale et al., NeurIPS 2023) — arXiv:2306.02437
- Data Scaling Laws in Imitation Learning for Robotic Manipulation (Lin et al., 2024) — arXiv:2410.18647
- Is Diversity All You Need for Scalable Robotic Manipulation? (Shi et al., 2025) — arXiv:2507.06219
05PHYSICAL AI — 데이터에서 Experience(경험)로
PHYSICAL AI · INDUSTRY
기업들은 이미 Experience(경험)를 생산하고 있다.Industry Is Already Manufacturing Experience
여러 로봇 기종의 데이터·웹 데이터·언어 지시까지 섞어 학습한 VLA. 학습에 없던 집에서 정리와 청소를 해냈고, Teleoperation 시범 가정을 3곳에서 104곳으로 늘릴수록 일반화가 좋아졌다.
System 1·System 2 이중 구조의 VLA 하나로 손가락까지 포함한 휴머노이드 상체 전체를 실시간 제어한다. 두 로봇이 처음 보는 물건을 함께 정리하는 것까지 과제별 fine-tuning 없이 해낸다.
행동 전에 자연어로 중간 추론을 하는 VLA와 embodied reasoning 모델의 2단 구성. motion transfer로 다른 로봇의 경험 데이터에서도 배운다.
처음 보는 집에서 바로 일한다Teleoperation 시범 가정을 3곳에서 104곳으로 늘릴수록 새 집 일반화가 좋아졌다.
합성 세계와 실제 세계의 간극을 메우고, 현실의 실패를 자동으로 되먹이는 완전한 Closed-Loop(폐루프)는 아직 숙제로 남아 있다.
- π0.5: A Vision-Language-Action Model with Open-World Generalization (Physical Intelligence, 2025) — arXiv:2504.16054
- Helix: A Vision-Language-Action Model for Generalist Humanoid Control — Figure (figure.ai)
- Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer (Google DeepMind, 2025) — arXiv:2510.03342
- π*0.6: a VLA That Learns From Experience (Physical Intelligence, 2025) — arXiv:2511.14759
- AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents (Ahn et al., 2024) — arXiv:2401.12963
- RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation (Bousmalis et al., TMLR 2023) — arXiv:2306.11706
06하나의 공통 구조
ONE LOOP, THREE FORMS
형태는 달라도 구조는 같다.Different Forms, Same Structure
WHAT TO OWN
이제 경쟁력은 다음 데이터를 만드는 Loop에서 나온다.Competitive Edge Now Comes from the Loop That Makes the Next Data
성공을 검증하고, 다음에 학습할 데이터를 스스로 만들어 넣는다.
- 01VERIFIER
무엇이 성공인지 자동으로 판별한다.
- 02SELECTOR
지금 모델에 필요한 경험을 고른다.
- 03ENVIRONMENT
안전하고 반복 가능한 연습장을 만든다.
- 04FEEDBACK LOOP
실패를 다음 데이터 생성에 다시 연결한다.
가장 많은 데이터를 가진 조직
다음 데이터를 가장 잘 만드는 조직
THE LAST DATASET
AGI란
스스로 학습하는 능력을
갖춘 AI다.
무엇이 부족한지 알고, 배울 데이터와 경험을 스스로 만들어 내는 능력이 그 출발점이다.
Physical AI는 아직 갈 길이 멀다 — 로봇 환경 시뮬레이션 데이터를 확보해 더 강인한 모델을 만들어야 한다.
APPENDIX
논문과 원문.Papers & Sources
오늘 발표에서 다룬 연구의 원문 목록입니다. 질의응답 때 참고해 주십시오.
GOOD DATA
Data Diet ↗Paul et al., NeurIPS 2021 · arXiv:2107.07075 LESS ↗Xia et al., ICML 2024 · arXiv:2402.04333 LIMO ↗Ye et al., COLM 2025 · arXiv:2502.03387 AIR ↗Liu et al., 2025 · arXiv:2512.13279 Meta Autodata ↗Kulikov et al., Meta FAIR 2026 · arXiv:2606.25996SELF-EVOLVING
DAPO ↗Yu et al., NeurIPS 2025 · arXiv:2503.14476 Data Agent ↗Yang et al., ICML 2026 · arXiv:2603.07433 DeepSeek-R1 ↗DeepSeek-AI, Nature 2025 · arXiv:2501.12948 Kimi K3 ↗Kimi Team, 2026 · arXiv:2607.24653 Absolute Zero ↗Zhao et al., NeurIPS 2025 · arXiv:2505.03335 Self-Distilled Reasoner ↗Zhao et al., 2026 · arXiv:2601.18734 Era of Experience ↗Silver & Sutton, DeepMind 2025 · MIT Press 발췌AGENTIC AI
SWE-smith ↗Yang et al., NeurIPS 2025 · arXiv:2504.21798 Agent World Model ↗Wang et al., ICML 2026 · arXiv:2602.10090 Qwen-AgentWorld ↗Zuo et al., Qwen Team 2026 · arXiv:2606.24597 Agent-World ↗Dong et al., 2026 · arXiv:2604.18292 CUA-Gym ↗Wang et al., 2026 · arXiv:2605.25624 WebWorld ↗Xiao et al., 2026 · arXiv:2602.14721 DreamGym ↗Chen et al., ICLR 2026 · arXiv:2511.03773 NVIDIA NeMo Gym ↗NVIDIA · Hugging Face Blog “Nemotron 3 Nano”, 2025-12PHYSICAL AI
MimicGen ↗Mandlekar et al., CoRL 2023 · arXiv:2310.17596 RoboGen ↗Wang et al., ICML 2024 · arXiv:2311.01455 NVIDIA Cosmos ↗NVIDIA, 2025 · arXiv:2501.03575 DreamGen ↗NVIDIA, 2025 · arXiv:2505.12705 Qwen-RobotWorld ↗Zhang et al., Qwen Team 2026 · arXiv:2606.17030 RLVR-World ↗Wu et al., NeurIPS 2025 · arXiv:2505.13934 Robot World Model Survey ↗Hou et al., 2026 · arXiv:2605.00080THANK YOU
경청해 주셔서 감사합니다.Thank You for Listening
MIN SOO KIM · SAMSUNG ELECTRONICS
EMAIL · 33modeling@gmail.com