26.08.19 15:33최종 업데이트 26.08.19 15:33
  • 본문듣기
HiDream-O1-World 모델로 인테리어 제품 광고를 만들었다.
HiDream-O1-World 모델로 인테리어 제품 광고를 만들었다. 자료사진

2026년 8월 중국 AI 업계는 두 개의 뛰어난 월드모델을 거의 동시에 내놓았습니다. 하나는 영상 생성의 최전선에서 출발해 '탐험 가능한 세계'를 만들어내는 HiDream-O1-World이고, 다른 하나는 로봇 훈련의 현장을 디지털로 복제해 '물리를 학습하는 평행세계'를 구현하는 CurrentWorld-0입니다. 이 두 모델의 등장은 단순히 '더 나은 영상을 생성한다'는 수준을 넘어, AI기술이 콘텐츠 생성에서 월드 시뮬레이션으로 진화하는 전환점을 보여줍니다.

과거 사용자가 프롬프트를 입력하고 결과물을 '소비'하던 단방향 패러다임은 이제 사용자가 세계 안으로 들어가 개입하고, 수정하고, 탐험하는 쌍방향 패러다임으로 바뀌고 있습니다. 이 변화는 영화와 게임, 제조와 로봇이 모두 하나의 연속된 세계 안에서 재정의되는 출발점입니다. 2026년 8월은 바로 이 '월드모델 원년'의 서막입니다.

아키텍처의 분기 — '통합 표상'과 '평행세계 학습'

HiDream-O1-World는 하이드림에서 개발한 옴니모달 월드모델입니다. 핵심은 자체 개발한 UiT(Unified Transformer) 아키텍처입니다. 기존 멀티모달 시스템이 텍스트·영상·음성을 각각의 인코더로 처리한 뒤 번역 계층을 통해 연결하는 '조립식' 접근이었다면, UiT는 이미지 픽셀, 텍스트 토큰, 영상 복셀, 오디오, 동작 명령, 공간 좌표 등 모든 신호를 하나의 공유 토큰 공간으로 통합합니다. 이는 '사과가 떨어지는 영상을 생성한다'와 '중력이 사과를 끌어당긴다'는 두 가지 인지가 별도의 과정이 아니라 하나의 표상 공간에서 동시에 이루어진다는 의미입니다.


여기에 3D Memory와 TTT(Test-Time Training)를 결합해, 사용자가 장면을 벗어났다가 돌아와도 공간적 위치와 물체 관계가 유지되는 '세계의 기억'을 구현했습니다. ECCV 2026에 게재된 DreamWorld 연구의 Geometry-then-Appearance 두 단계 프레임워크는 기하학적 구조 생성과 외관 합성을 분리해 시공간적 일관성을 극대화하는 기술적 배경입니다.

반면, 커런트 로보틱스에서 발표한 CurrentWorld-0는 전혀 다른 경로로 물리적 현실을 담아냅니다. 이 모델의 경쟁력은 '평행세계'를 만들어 순환 학습을 가능하게 하는 프로세스에 있습니다. 첫째, 진짜 로봇이 실제 환경에서 맥주를 따르고, 양말을 개고, 문을 여는 등 물리적 상호작용 데이터를 생성합니다. 둘째, 이 실제 데이터를 바탕으로 CurrentWorld-0는 주입된 물리 공식 없이 현실 물리 법칙을 귀납적으로 학습하고, 1000개의 병렬 '평행세계'를 구축합니다.

셋째, 각 평행세계에서 수천 개의 가상 로봇 에이전트가 동시에 서로 다른 시나리오를 경험하며 시행착오를 반복합니다. 넷째, Human-in-the-World-Model 프레임워크를 통해 인간이 가상 세계에 직접 개입해 로봇의 실패를 교정하고, 이 교정 행위는 새로운 훈련 데이터로 축적됩니다. 마지막으로 사전 학습된 모델은 실제 로봇 하드웨어에 이식되어 현실 세계에서 구동됩니다. 이 '데이터-모델-평가-배포' 폐쇄 루프가 바로 90% 훈련 비용 절감의 근원입니다.

Cross-Embodiment은 휴머노이드 로봇 뿐 아니라 바퀴형 이동 로봇과 로봇팔이 같은 물리 법칙 아래 훈련됨을 의미하고, Cross-View는 1인칭 로봇 시점과 3인칭 관찰자 시점이 동일한 사건을 각각의 시각에서 보며 일관된 물리를 학습함을 뜻합니다.

벤치마크가 증명하는 객관적 격차와 질적 도약

CurrentWorld-0 모델은 실제 로봇 학습데이터에서 시공간 법칙을 학습하여 평행세계를 만들고 다시 훈련한다.
CurrentWorld-0 모델은 실제 로봇 학습데이터에서 시공간 법칙을 학습하여 평행세계를 만들고 다시 훈련한다.자료사진

두 모델의 기술적 차이는 벤치마크와 학술적 성과에서도 드러납니다. HiDream-O1-World는 WBench(메이퇀 LongCat과 푸단대학이 공동 개발하여 중국 내에서 권위를 지니는 월드모델 평가 기준)에서 Navi 부문 종합 1위를 기록했습니다. 물리적 타당성 (Physical) 73.3점, 시공간적 일관성 (Consistency) 88.0점으로 텐센트 혼원 1.5, 알리바바 Happy Oyster 등을 제쳤습니다.

Physical 지표는 충돌과 표면 접촉 후의 결과가 기본 물리 논리에 부합하는지를 측정하고, Consistency 지표는 지속적 생성 속에서 장면 기억과 공간 구조가 안정적으로 유지되는지를 평가합니다. 이는 단순한 시각적 품질을 넘어 '세계가 기억되고 물리가 유지된다'는 월드모델의 본질적 기준에서 정점에 섰음을 의미합니다.

CurrentWorld-0는 ICML 2026 Spotlight로 선정된 dWorldEval을 통해 글로벌 업계에서 데이터 기반 물리 시뮬레이션의 정확도를 검증 받았습니다. 특히 1000개의 병렬 '평행 세계'에서 동시에 훈련을 수행하며 물리적 손실 없이 시행착오를 반복할 수 있다는 점은, 로봇 학습 비용을 90% 절감한다는 산업적 수치로 환원됩니다.

dWorldEval은 단순히 영상의 자연스러움을 평가하는 것이 아니라, 가상 세계에서의 물리적 인과관계가 현실과 얼마나 정확히 대응하는지를 측정하는 기준입니다. 이 두 모델은 각각 '시각적 세계의 일관성'과 '물리적 상호작용의 정직성'이라는 두 축에서 중국 월드모델의 기술적 완성도를 객관적으로 입증하고 있습니다.

피지컬 AI의 'GPT 모먼트' — 월드모델의 할루시네이션 차단과 2027년 분수령

업계 전문가들은 2027년 초를 피지컬 AI의 결정적 분수령으로 전망하고 있습니다. 왕샤오강 등을 비롯한 연구자들은 월드모델이 로봇, 자율주행, 제조 현장에서 '상상하고 시뮬레이션하며 행동하는' 능력을 갖추는 순간, 피지컬 AI 시장이 본격적인 폭발 성장을 시작할 것으로 예측합니다. Future Markets의 보고서에 따르면 피지컬 AI 시장은 2030년 4,300억 달러, 2040년에는 1.6조 달러에 이를 것으로 전망됩니다.

이 과정에서 주목할 점은 '월드모델의 할루시네이션' 개념입니다. 언어 모델이 존재하지 않는 사실을 '사실인 것처럼' 생성하는 것이 할루시네이션이라면, 기존 영상 생성 모델이 로봇의 실수를 '보기 좋게' 수정하는 것은 물리적 할루시네이션입니다. 로봇이 컵을 떨어뜨리면 공중에서 붙잡거나, 넘어질 때 땅에 닿지 않게 처리하는 것은 마치 LLM이 그럴듯하지만 거짓된 답변을 내놓는 것과 같은 구조입니다.

이러한 물리적 할루시네이션은 가상 세계에서 학습된 로봇이 현실에 배포될 때 치명적인 오류를 낳습니다. CurrentWorld-0의 '자동 교정 배제' 원칙은 바로 이 물리적 할루시네이션을 차단하는 장치입니다. 모델이 '친절하게' 거짓말을 하지 않도록 강제함으로써, 가상 세계에서의 실패가 현실 세계에서의 실패와 정확히 대응되게 만드는 것입니다. 이 정직성이 없으면 로봇은 훈련 현장에서 배운 것과 전혀 다른 물리를 마주하게 되고, 현실 배포 시 치명적인 오류로 이어집니다.

경계의 소멸 — 언어, 시뮬레이션, 현실의 융합

두 모델은 인간이 세계에 개입하는 방식에서도 흥미로운 차이를 보여줍니다. HiDream-O1-World는 사용자를 '여행자'이자 '감독'으로 만듭니다. 1인칭과 3인칭 시점을 자유롭게 전환하며 꿈꾸던 여행을 가상의 공간에서 즐기고 날씨를 '비바람'에서 '가랑비'로 바꾸는 등의 개입이 가능합니다. 이는 영화와 게임의 경계를 허무는 경험입니다.

CurrentWorld-0는 인간을 '코치'이자 '교사'로 배치합니다. Human-in-the-World-Model 프레임워크를 통해, 로봇이 평행 세계에서 실패할 때 인간이 직접 개입해 동작을 교정하고, 이 교정 행위가 새로운 훈련 데이터로 축적되는 폐쇄 루프를 완성합니다. 이는 시공간을 사전에 시뮬레이션하는 것이 단순한 '가상 현실'을 넘어, 실제 산업의 훈련 비용을 90% 절감하고 물리적 손실을 제로에 가깝게 만드는 생산 도구로 기능함을 의미합니다.

이제 공장의 생산 라인은 물리적 시제품 없이 가상 평행세계에서 수천 번의 최적화를 거쳐 설계되고, 자율주행 차량은 실제 도로 위험 없이 극한 시나리오를 무한히 경험한 뒤 배포됩니다. 영화와 게임 산업 역시 촬영 후 고정되는 세계가 아니라, 관객이 들어가 바꾸고 탐험하는 살아있는 세계로 진화할 것입니다.

언어 모델이 텍스트의 통계를 학습하여 언어를 생성했다면, 월드모델은 물리의 인과를 학습하여 현장을 생성합니다. 이제 언어, 시뮬레이션, 현실의 경계가 소멸하면서 인간은 더 이상 콘텐츠를 '소비'하는 관찰자가 아니라 세계를 '구성'하는 공동 창작자가 되고 있습니다.

미국과 중국의 기술 노선과 생태계

미국은 리페이페이 교수가 공동창립자이자 CEO로 이끄는 World Labs의 Marble, DeepMind의 Genie 3, 그리고 얀 르쿤의 AMI Labs가 추진하는 AGI 물리 추론 엔진 방식으로 세계 모델을 확장하고 있습니다.

이와 병행하여 엔비디아는 Cosmos 3 오픈 월드모델과 Omniverse, Isaac Sim, GR00T 등을 통해 피지컬 AI의 시뮬레이션 인프라와 GPU 생태계를 제공하며, World Labs를 포함한 월드모델 개발자들이 가상 세계에서 학습한 결과를 현실 로봇에 배포하는 데 필요한 산업 표준 플랫폼을 구축하고 있습니다.

반면 중국은 데이터의 규모와 산업 시나리오의 통합이라는 강점을 바탕으로, 영상 생성 모델과 로봇 훈련 시뮬레이터를 결합하는 '시나리오 통합 전략'에 집중하고 있습니다. 양국 간 기술 격차는 WBench나 dWorldEval 같은 지표에서 2~3% 수준으로 접혀 있어, 이제는 '누가 먼저'가 아니라 '어떤 생태계를 구축하느냐'의 경쟁으로 전환되고 있습니다.

월드 모델 원년, 미래가 현실이 되는 순간

2026년은 월드모델이 '보여주는 기술'에서 '만지고 바꾸는 기술'로 진화한 원년입니다. HiDream-O1-World와 CurrentWorld-0는 각각 시각적 세계의 일관성과 물리적 세계의 정직성이라는 두 기둥을 세웠으며, 이 두 기둥이 만나는 지점에서 진정한 피지컬 AI가 탄생할 것입니다. 이제 세계를 생성하는 것과 세계를 시뮬레이션하는 것의 경계가 사라지면서, 인간이 상상하는 모든 것이 곧바로 실험되고 검증되고 구현되는 시대가 열리고 있습니다.

LLM이 언어와 코딩의 장벽을 허물었다면, 이제 월드모델이 가상과 현실의 장벽을 허물고 있습니다. 이제 인간, 에이전트, 로봇은 이 현실보다 현실적인 가상세계에서 만나 과거와 현재 미래를 넘나드는 세상이 곧 도래할 것입니다.

[참고자료]

1) HiDream-O1-World
기업명: 하이드림 HiDream.ai / 智象未来

공식 웹사이트: https://hidream.ai/
GitHub (HiDream-O1-Image): https://github.com/HiDream-ai/HiDream-O1-Image
Hugging Face 모델: https://huggingface.co/HiDream-ai/HiDream-O1-Image
기술 보고서 (arXiv): https://arxiv.org/html/2605.11061v1
DreamWorld 연구 (ECCV 2026): https://yanghb22-fdu.github.io/DreamWorld

2) CurrentWorld-0
기업명: 커런트 로보틱스 Current Robotics
홈페이지: https://current-robotics.com/
창립자: 주이천(祝毅晨, Zhu Yichen) — 전 메이더그룹(美的) 피지컬AI 총괄. 중국 월드모델 리더 중 한 명
이전 모델: Curr-0 (휴머노이드 로봇 전신 작동 모델)
핵심 논문 인용: Physical Intelligence의 π0 논문에 인용
학회 검증: ICML 2026 Spotlight — dWorldEval
덧붙이는 글 임선영씨는 중국 칭화대 전산언어학 석사를 마친 중국경제전문가이며 <중국경제 미래지도>, <중국AI 미래지도>의 저자입니다. 이 글은 본인의 페이스북에도 올렸습니다.
이 기사가 마음에 드시나요? 좋은기사 원고료로 응원하세요
원고료로 응원하기

독자의견