JEPA에서 VLA·WAM까지: 주요 논문과 연구 흐름 정리
이 글은 JEPA의 출발점부터 이미지·비디오 모델, 로봇 제어, VLA(Vision-Language-Action), WAM(World Action Model)으로 이어지는 주요 논문을 정리해보려고 합니다.
JEPA(Joint-Embedding Predictive Architecture)는 입력을 픽셀 단위로 복원하는 대신, 관측 가능한 문맥으로부터 보이지 않거나 미래에 나타날 대상의 표현(embedding)을 예측하는 학습 구조다.
아이디어는 어떻게 보면 좀 단순하다고 볼 수 있을 것 같은데
- 픽셀의 모든 세부 사항을 생성하지 않는다.
- 예측에 필요한 의미와 구조를 latent space에서 학습한다.
- 이미지에서 시작해 비디오, world model, 로봇 행동 예측으로 확장할 수 있다.
전체 연구 흐름은 대략 다음과 같다.
I-JEPA
└─ V-JEPA
└─ V-JEPA 2 / V-JEPA 2-AC
├─ VLA-JEPA
├─ JEPA-VLA
├─ JEPA-WAM
└─ LeWorldModel
1. JEPA의 출발점과 핵심 논문
1.1 A Path Towards Autonomous Machine Intelligence
- 연도: 2022
- 저자: Yann LeCun
- 링크: 논문 보기
JEPA, Hierarchical JEPA, world model, intrinsic motivation을 하나의 자율 지능 시스템 안에서 어떻게 결합할 수 있는지 제안한 비전 논문이다.
일반적인 기술 논문처럼 특정 모델의 성능을 검증하기보다는, 다음과 같은 질문을 가진 연구이다.
- 대부분의 지식을 관찰만으로 학습할 수 있는가?
- 픽셀을 모두 생성하지 않고도 세계의 변화를 예측할 수 있는가?
- 여러 시간 규모에서 추론하고 계획하는 계층적 world model을 만들 수 있는가?
JEPA 계열의 개별 논문을 읽기 전에 전체 철학을 이해하고 싶다면 가장 먼저 읽을 만하다고 한다.
1.2 Joint Embedding Predictive Architectures Focus on Slow Features
- 연도: 2022
- 링크: arXiv
초기 JEPA형 world model이 어떤 정보를 학습하는지 분석한 논문이다. 픽셀 재구성 기반 모델과 비교했을 때 JEPA가 시간에 따라 안정적으로 유지되는 slow feature에 집중한다는 점과, 배경 노이즈의 성질에 따라 실패할 수 있다는 한계를 함께 보여준다.
JEPA의 장점만 소개하는 논문이 아니라 어떤 조건에서 잘못된 표현을 학습할 수 있는지도 다룬다는 점에서 중요하다.
1.3 I-JEPA: Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture
- 연도: 2023
- 발표: CVPR 2023
- 링크: arXiv
현대 JEPA 구조의 기준점이 된 이미지 모델이다.
이미지의 일부 블록만 context encoder에 제공하고, predictor가 가려진 target 영역의 embedding을 예측한다. 픽셀을 복원하지 않기 때문에 색상이나 질감 같은 저수준 세부 정보보다 물체와 장면의 의미 구조를 학습하도록 유도한다.
주요 구성은 다음과 같다.
- Context encoder: 관측 가능한 이미지 영역을 인코딩
- Target encoder: 전체 이미지에서 target embedding을 생성
- Predictor: context representation으로 target embedding을 예측
- EMA target encoder: target network를 context encoder의 이동 평균으로 갱신
1.4 MC-JEPA
- 논문명 : MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features
- 연도: 2023
- 링크: arXiv
이미지와 비디오에서 물체의 내용?과 motion을 함께 학습하려는 JEPA 확장이다. self-supervised representation learning과 optical flow estimation을 하나의 공유 encoder에서 결합한다.
I-JEPA가 주로 정적 이미지의 의미 구조를 다룬다면, MC-JEPA는 motion feature를 본격적으로 포함하려는 초기 시도라고 볼 수 있다.
1.5 V-JEPA
- 논문명 : Revisiting Feature Prediction for Learning Visual Representations from Video
- 연도: 2024
- 링크: arXiv
I-JEPA의 아이디어를 비디오로 확장한 핵심 논문이다. 비디오의 가려진 시공간 영역을 픽셀로 생성하지 않고 latent representation으로 예측한다.
V-JEPA는 다음과 같은 추가 supervision 없이 feature prediction만으로 학습된다.
- 텍스트
- negative sample
- 픽셀 재구성
- 사전학습된 이미지 encoder
V-JEPA 이후 JEPA는 단순한 visual representation learner를 넘어, 미래 상태를 예측하는 world model의 기반으로 연결되기 시작한다.
1.6 Image World Models
- 논문명 : Learning and Leveraging World Models in Visual Representation Learning
- 연도: 2024
- 링크: arXiv
JEPA의 예측 대상을 masked patch에 한정하지 않고, 이미지에 가해진 전역적인 photometric transformation의 결과까지 확장한 연구다.
이 논문은 JEPA를 단순한 masked representation learning이 아니라, 변환에 따른 세계 상태의 변화를 latent space에서 예측하는 구조로 해석한다.
1.7 V-JEPA 2
- 논문명 : V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- 연도: 2025
- 링크: arXiv
현재 JEPA와 로봇 planning을 연결하는 가장 중요한 논문 중 하나다.
학습은 두 단계
- 대규모 일반 비디오와 이미지로 action-free V-JEPA 2를 사전학습한다.
- DROID 로봇 데이터로 action-conditioned predictor인 V-JEPA 2-AC를 추가 학습한다.
V-JEPA 2-AC는 현재 상태의 embedding과 후보 action을 입력받아 미래 상태의 embedding을 예측한다. 로봇은 여러 action sequence의 결과를 latent space에서 미리 평가하고, goal image와 가장 가까워지는 행동을 선택한다.
특히 새로운 환경과 새로운 물체에 대해 별도의 reward 학습이나 task-specific fine-tuning 없이 goal-image 기반 planning을 수행했다는 점이 중요하다.
1.8 LeJEPA와 SIGReg
- 정식 제목: LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
- 연도: 2025
- 링크: arXiv
JEPA의 representation collapse 문제를 이론적으로 다루고, SIGReg(Sketched Isotropic Gaussian Regularization)를 제안한 논문이다.
SIGReg는 embedding의 분포를 표준 등방 Gaussian에 가깝게 만든다. 이를 통해 모든 입력이 같은 embedding으로 모이거나, representation이 저차원 부분공간으로 수축하는 현상을 방지한다.
기존 JEPA가 EMA target encoder, stop-gradient 등 여러 안정화 장치에 의존했다면, LeJEPA는 prediction loss와 SIGReg를 결합해 더 단순하고 이론적으로 설명 가능한 학습 목적을 구성한다.
2. JEPA 기반 action-conditioned world model
2.1 V-JEPA 2-AC
V-JEPA 2-AC의 핵심은 미래의 픽셀을 생성하는 대신, action을 수행했을 때 도달할 미래 상태의 embedding을 예측하는 것이다.
현재 관측
→ 현재 latent state
→ 후보 action과 결합
→ 미래 latent state 예측
→ goal latent와 거리 계산
→ 가장 좋은 action 실행
이 접근은 고해상도 미래 비디오를 생성하는 모델보다 계획 과정의 계산량을 줄일 수 있다. 반면 latent distance가 실제 task progress와 일치해야 한다는 새로운 문제가 생긴다.
2.2 LeWorldModel
- 논문명 : LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels
- 연도: 2026
- 링크: arXiv
LeWorldModel(LeWM)은 raw pixel부터 encoder와 action-conditioned dynamics를 end-to-end로 학습한다.
V-JEPA 2-AC가 강력한 사전학습 비디오 인코더를 사용한다면, LeWorldModel은 다음 두 항으로 구성된 목적함수를 사용해 작은 모델을 처음부터 안정적으로 학습한다.
- next-embedding prediction loss
- SIGReg 기반의 붕괴 방지 정규화 항(anti-collapse regularization term)
구조가 단순하고 planning 속도가 빠르며, 2D-3D control task에서 latent planning이 가능하다는 것이 핵심이다.
2.3 What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?
- 연도: 2025
- 링크: arXiv
- 코드 : https://github.com/facebookresearch/jepa-wms
JEPA 기반 planning model을 JEPA-WM이라는 범주로 정리하고, 다음 요소가 성능에 미치는 영향을 분석한다.
- Encoder architecture
- Prediction target과 loss
- Spatial feature 사용 여부
- Planning objective
- Action sequence optimization 방식
V-JEPA 2-AC와 DINO-WM을 주요 baseline으로 비교하므로, JEPA world model을 직접 구현하려는 경우 특히 유용하다.
2.4 Learning Latent Action World Models In The Wild
- 연도: 2026
- 링크: arXiv
Action label이 없는 일반 비디오에서 latent action을 학습하려는 연구다.
사람과 사물의 움직임이 다양하고 embodiment가 통일되지 않은 인터넷 비디오에서는 명시적인 robot action을 얻을 수 없다. 이 논문은 비디오 상태 변화에서 continuous latent action을 추론하고, 이후 실제 제어 명령을 latent action으로 연결하는 controller를 학습한다.
제목에 JEPA가 직접 들어가지는 않지만, V-JEPA에서 action-free video → latent action → planning으로 이어지는 흐름을 이해하는 데 중요한 논문이다.
3. VLA에 JEPA를 적용한 논문
VLA(Vision-Language-Action)는 일반적으로 이미지와 언어 명령을 입력받아 로봇 action을 직접 출력한다.
이미지 + 언어 명령 → VLA policy → robot action
JEPA를 결합하면 현재 상황에서 어떤 행동을 출력할지만 학습하는 대신, 그 행동이 어떤 미래 상태를 만들지도 latent space에서 예측할 수 있다.
3.1 VLA-JEPA
- 논문명 : VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
- 연도: 2026년 2월
- 링크: arXiv
- 코드: GitHub
VLA-JEPA는 JEPA 방식의 latent world model을 VLA의 사전학습 과정에 추가한 연구이다.
leakage-free state prediction
- Target encoder는 미래 프레임으로 target latent를 만듬
- Student/VLM 경로는 현재 observation만 볼 수 있음
- Predictor는 현재 latent와 latent action으로 미래 latent를 예측
- 미래 프레임은 student 입력이 아니라 supervision target으로만 사용
이를 통해 camera motion, 배경 변화, 조명과 같이 action과 무관한 픽셀 변화보다 실제 task state transition에 가까운 표현을 학습하려 한다.
LIBERO, LIBERO-Plus, SimplerEnv 및 실제 로봇 조작 task에서 평가되었다.
3.2 JEPA-VLA
- 논문명 : JEPA-VLA: Video Predictive Embedding is Needed for VLA Models
- 연도: 2026년 2월
- 링크: arXiv
이름은 VLA-JEPA와 비슷하지만 접근 방식은 다르다.
JEPA-VLA는 V-JEPA 2에서 얻은 predictive video embedding을 기존 VLA의 visual representation에 adaptive fusion한다.
| 구분 | VLA-JEPA | JEPA-VLA |
|---|---|---|
| 목적 | JEPA latent world model로 VLA 사전학습 | V-JEPA 2 feature를 기존 VLA에 결합 |
| 미래 예측 | 학습 objective에 직접 포함 | Predictive embedding에 이미 포함된 동역학 지식 활용 |
| 주요 관심 | Latent action과 future-state prediction | VLA visual representation과 policy prior 개선 |
| 평가 | LIBERO, LIBERO-Plus, SimplerEnv, real robot | LIBERO, LIBERO-Plus, RoboTwin 2.0, real robot |
VLA-JEPA는 JEPA를 ‘학습 목적’으로 사용하고, JEPA-VLA는 V-JEPA 2를 ‘특징 추출기’로 사용하는 차이가 있다고 볼 수 있을 것 같음
4. WAM에 JEPA를 적용한 논문
WAM(World Action Model)은 현재 관측과 언어 명령을 조건으로 미래 world state와 action을 함께 모델링한다.
기존 WAM의 상당수는 미래 비디오를 픽셀 또는 video latent로 생성한다. 반면 JEPA-WAM은 비디오 전체를 생성하는 대신, action과 task progress에 필요한 미래 representation을 예측하려 한다.
4.1 JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
- 공개일: 2026년 8월 10일
- 링크: arXiv
Pretrained V-JEPA 공간에서 동작하는 latent WAM이다.
주요 특징은 다음과 같다.
- 현재와 미래의 spatially structured latent target을 예측한다.
- Latent transition prediction과 continuous action generation이 predictor를 공유한다.
- World-model supervision이 action prediction backbone에 직접 영향을 준다.
- 기존 pretrained VLA의 perception과 action 경로를 유지하면서 결합할 수 있다.
미래 비디오 생성 없이도 미래 상태 예측이 action representation을 직접 개선하도록 설계한 것이 핵심이다.
4.2 JEPA-WAM: Stage-Level Joint-Embedding Prediction for World-Action Models in Robot Manipulation
- 공개일: 2026년 8월 11일
- 링크: arXiv
앞의 JEPA-WAM과 제목과 공개 시기가 매우 비슷하지만 별개의 논문이다.
이 논문은 Motus 기반 WAM에 Stage-JEPA를 추가한다. Frozen V-JEPA 2 encoder로 현재 상태를 표현하고, 단순히 몇 프레임 뒤의 상태가 아니라 다음 과업 단계의 latent target을 예측한다.
예를 들어 컵을 트레이에 옮기는 작업은 다음과 같이 나눌 수 있다.
컵에 접근
→ 컵 잡기
→ 컵 들어 올리기
→ 트레이로 이동
→ 컵 내려놓기
Short-term physical future와 stage-level semantic future를 분리해, 장기 작업의 진행 방향을 더 명시적으로 표현한다.
4.3 이름이 같은 두 JEPA-WAM 비교
| 구분 | Latent WAM 논문 | Stage-JEPA 논문 |
|---|---|---|
| arXiv | 2608.09381 | 2608.10780 |
| 공개일 | 2026-08-10 | 2026-08-11 |
| 핵심 | Shared predictor로 latent transition과 action 생성 결합 | 다음 task stage의 latent target 예측 |
| 기반 | Pretrained V-JEPA space 및 VLA 적용 | Motus 기반 WAM + frozen V-JEPA 2 |
| 예측 시간 규모 | 주로 current-future transition | Stage-level semantic future |
5. 그 밖의 로봇 JEPA 응용
Demo-JEPA
- 논문명: Demo-JEPA: Joint-Embedding Predictive Architecture for One-shot Cross-Embodiment Imitation
- 연도: 2026
- 링크: arXiv
사람이나 다른 형태의 로봇이 수행한 demonstration을 동일한 action space로 직접 변환하지 않는다. 대신 demonstration을 미래 latent trajectory라는 목표로 해석하고, target robot은 자신의 dynamics와 action space를 이용해 해당 subgoal을 달성한다.
PSG-JEPA
- 논문명: Is Forward Prediction Enough? Physical State Grounding for JEPA World Models
- 연도: 2026
- 링크: arXiv
단순한 future latent prediction만으로는 robot-centric physical state가 충분히 식별되지 않을 수 있다는 문제를 제기한다.
JEPA latent를 다음 정보에 추가로 grounding한다.
- 개별 latent와 robot proprioceptive state
- 두 latent 사이의 변화와 multi-horizon joint-angle 변화
AquaJEPA
- 논문명 : AquaJEPA: Action-Conditioned Multimodal Predictive Representations for Underwater Robot Dynamics
- 연도: 2026
- 링크: arXiv
RGB camera, forward-looking sonar, proprioception, thruster command를 결합한 수중 로봇용 action-conditioned JEPA다. 센서 신뢰도가 급격하게 달라지는 수중 환경에서 multimodal predictive representation과 receding-horizon planning을 연결한다.
6. 다른 모달리티의 JEPA
| 분야 | 논문 | 요약 |
|---|---|---|
| Audio | A-JEPA | Spectrogram의 masked representation 예측 |
| Audio | Audio-JEPA | AudioSet 기반의 범용 audio representation 학습 |
| Point cloud | Point-JEPA | Point-cloud patch의 latent representation 예측 |
| 3D | 3D-JEPA | 3D target block representation 예측 |
| Skeleton | S-JEPA | Skeleton sequence에서 가려진 joint representation 예측 |
7. 추천 읽기 순서
- A Path Towards Autonomous Machine Intelligence
- I-JEPA
- V-JEPA
- V-JEPA 2 / V-JEPA 2-AC
- LeJEPA
- VLA-JEPA
- JEPA-VLA
- JEPA-WAM: Latent WAM
- JEPA-WAM: Stage-JEPA
- LeWorldModel
읽을 시간이 부족하다면 I-JEPA → V-JEPA → V-JEPA 2 → VLA-JEPA → JEPA-WAM 다섯 편만 먼저 읽기
8. 정리
JEPA의 연구 방향은 다음 세 단계로 진화하고 있다.
첫 번째: Representation learning
I-JEPA와 V-JEPA는 픽셀 복원 없이 이미지와 비디오의 의미 구조를 학습하는 데 집중
두 번째: Predictive world model
V-JEPA 2-AC와 LeWorldModel은 현재 상태와 action으로 미래 latent state를 예측하고, 그 결과를 planning에 사용
세 번째: VLA와 WAM
VLA-JEPA, JEPA-VLA, JEPA-WAM은 predictive representation을 언어 조건부 robot policy 및 action generation과 결합
이 과정에서 연구의 주요 질문도 달라지고 있음
- 어떤 latent information을 예측해야 실제 제어에 도움이 되는가?
- 미래 비디오 전체를 생성해야 하는가, 아니면 latent transition만으로 충분한가?
- 단기적인 물리 변화와 장기적인 task stage를 어떻게 함께 모델링할 것인가?
- Latent distance가 실제 task progress와 일치하도록 어떻게 학습할 것인가?
- Prediction loss만으로 representation collapse와 물리적 grounding 문제를 해결할 수 있는가?
JEPA와 WAM의 결합은 아직 빠르게 변하는 분야다. 특히 2026년에 공개된 VLA-JEPA, JEPA-VLA, JEPA-WAM 계열에 대해 성능 수치만 비교하기보다 JEPA가 visual encoder, latent world model, action predictor, stage planner 중 어디에 사용되는지를 중심으로 자세하게 읽어보려함