로봇 AI가 데이터센터를 벗어났다: NVIDIA Cosmos 3 Edge는 무엇이 다른가
4B 월드 모델, 공개 가중치, Jetson Thor 실행, 15Hz 정책 제어. Cosmos 3 Edge의 의미는 크지만, 각 주장은 아키텍처·벤치마크 조건·라이선스·안전성으로 분리해 확인해야 합니다.

원문 링크: WordPress 원문
AI NOTES · KO KOREAN EDITION
KO · 한국어 / EN · English BILINGUAL PAIR · DRAFT
로봇이 컵을 집는 장면을 떠올려봅시다. 카메라가 컵을 찾는 것만으로는 부족합니다. 로봇은 손이 어느 방향으로 움직이는지, 접촉하면 컵이 어떻게 변할지, 다음 행동이 목표에 가까워지는지도 판단해야 합니다. 이때 필요한 것은 단순한 물체 인식보다 ** 현재 상태·가능한 미래·행동 결과를 연결하는 모델 ** 입니다.
NVIDIA가 2026년 7월 20일 공개한 Cosmos 3 Edge 는 이 연결을 4B 파라미터 모델 안에서 처리하려는 시도입니다. NVIDIA는 이를 로봇과 비전 AI가 장면을 이해하고, 미래를 예측하고, 행동을 생성하는 온디바이스 월드 모델로 소개합니다. Hugging Face에는 기본 체크포인트와 DROID 로봇 정책용 체크포인트가 실제로 공개됐습니다.
하지만 “4B”, “엣지”, “15Hz”, “오픈”이라는 네 단어를 그대로 이어 붙이면 오해가 생깁니다. NVIDIA가 공개한 세부 표를 보면 15Hz 조건을 만족한 것은 특정 T5000 설정 하나였고, 모델 메타데이터의 라이선스는 other 입니다. 물리 법칙을 명시적으로 계산하는 시뮬레이터도 아니며, 안전 인증된 제어기 역시 아닙니다.
결론부터 말하면: Cosmos 3 Edge의 중요한 변화는 거대한 월드 모델의 모든 기능을 작은 보드에 억지로 넣었다는 데 있지 않습니다. 추론·생성·행동을 하나의 표현으로 묶고, 필요한 모드를 엣지 하드웨어에서 선택적으로 실행할 수 있게 했다는 점 입니다. 다만 15Hz와 벤치마크 우위는 NVIDIA가 공개한 특정 구성의 측정값이며, 실제 로봇 안전성과 일반화 성능은 별도 검증이 필요합니다.
무엇이 공개됐나: 기본 모델과 로봇 정책은 같은 파일이 아니다
Cosmos 3 Edge는 하나의 이름 아래 세 가지 구성 요소를 구분해야 합니다.
Cosmos3-Edge
** 역할 ** 장면 이해, 텍스트 추론, 이미지·비디오·행동 생성의 기반 모델
** 독자가 확인해야 할 경계 ** 모든 입출력 조합이 같은 품질이나 속도를 보장하는 것은 아님
Cosmos3-Edge-Policy-DROID
** 역할 ** DROID 로봇 데이터에 맞춰 후처리한 행동 정책 체크포인트
** 독자가 확인해야 할 경계 ** DROID 조작 작업의 출발점이지 모든 로봇에 즉시 적용되는 범용 제어기는 아님
cosmos-framework
** 역할 ** 추론·후처리·정책 서버를 구성하는 프레임워크
** 독자가 확인해야 할 경계 ** 프레임워크 설치와 실제 하드웨어 통합·안전 검증은 별도 작업
Hugging Face API에서 기본 모델 저장소는 공개 상태이며 게이트가 걸려 있지 않습니다. 모델 카드, 설정 파일, 체크포인트, 예시 입력과 결과가 채워져 있습니다. 따라서 “발표만 하고 파일은 없는 모델”은 아닙니다.
반대로 ** 기본 체크포인트를 내려받았다고 로봇 정책이 완성되는 것도 아닙니다. ** 행동 생성은 로봇의 관절, 그리퍼, 카메라, 제어 주기에 맞는 표현과 후처리가 필요합니다. NVIDIA가 별도의 Policy-DROID 체크포인트와 정책 서버 예시를 제공하는 이유입니다.
VLM·월드 모델·행동 정책은 무엇이 다른가
일반적인 비전언어모델(VLM)은 이미지나 비디오를 보고 “무엇이 보이는가”, “어떤 일이 일어나는가”를 언어로 설명하는 데 강합니다. 그러나 로봇은 설명에서 끝나지 않습니다. 행동이 장면을 어떻게 바꿀지 예상하고, 그 결과를 다시 다음 행동으로 연결해야 합니다.
비전 추론
** 핵심 질문 ** 지금 무엇이 보이는가?
** 대표 출력 ** 텍스트, 위치, 관계
**Cosmos 3 Edge에서의 위치 ** autoregressive reasoner
월드 생성
** 핵심 질문 ** 다음 장면은 어떻게 변할까?
** 대표 출력 ** 이미지·비디오·미래 상태
**Cosmos 3 Edge에서의 위치 ** diffusion generator
행동 정책
** 핵심 질문 ** 목표를 위해 무엇을 움직일까?
** 대표 출력 ** 행동 청크·궤적
**Cosmos 3 Edge에서의 위치 ** action-conditioned generator / Policy-DROID
안전 시스템
** 핵심 질문 ** 그 행동을 실제로 허용해도 되는가?
** 대표 출력 ** 제한·중지·검증 결과
**Cosmos 3 Edge에서의 위치 ** 모델 밖의 외부 제어기와 시스템 검증 필요
마지막 행이 중요합니다. 월드 모델이 행동을 생성할 수 있다는 사실과, 그 행동이 안전하다는 사실은 다릅니다. 실제 장비에서는 충돌 제한, 속도·힘 제한, 비상 정지, 작업 공간 경계, 센서 이중화 같은 외부 안전 계층이 필요합니다.
비전-언어 모델, 월드 모델, 행동 정책, 안전 계층은 서로 다른 역할을 하며 하나의 모델 이름으로 합쳐 말하면 안 된다.
두 개의 트랜스포머가 하나의 표현을 공유한다
Cosmos 3 모델 카드가 설명하는 핵심은 Mixture-of-Transformers(MoT) 구조입니다.
-
자기회귀 트랜스포머: 텍스트처럼 이산적인 토큰을 다음 토큰 방식으로 생성합니다.
-
확산 트랜스포머: 이미지, 비디오, 오디오, 행동처럼 연속적인 출력을 반복적인 노이즈 제거로 생성합니다.
-
공유 표현: 현재 장면, 가능한 미래, 행동 조건을 같은 멀티모달 표현 안에서 연결합니다.
쉽게 말하면 한쪽은 “지금 상황을 언어로 해석하는 뇌”, 다른 한쪽은 “앞으로 보일 장면과 움직임을 그려보는 뇌”에 가깝습니다. 둘을 완전히 분리된 도구로 호출하는 대신, 같은 기반 표현을 공유하게 했습니다.
이 구조의 실용적 장점은 ** 모드 전환 ** 입니다. 같은 기반 모델이 비전 추론, 이미지·비디오 생성, 전방 동역학, 역동역학, 행동 생성의 출발점이 될 수 있습니다. 다만 Edge 체크포인트의 실제 I/O 표에는 텍스트·이미지·비디오·행동만 있고 오디오는 없습니다. Cosmos 3 제품군 전체 설명의 오디오 문구를 Edge 기능으로 옮기면 안 됩니다. 그렇다고 하나의 체크포인트가 모든 전문 모델을 자동으로 대체한다는 뜻도 아닙니다. 작업별 후처리, 입력 표현, 평가 하니스가 여전히 필요합니다.
‘엣지에서 실행’은 모든 기능이 실시간이라는 뜻이 아니다
Cosmos 3 Edge는 16B Nano와 64B Super 모델에 비하면 작은 4B 모델이지만, 하드웨어 요구가 가벼운 모바일 앱 수준은 아닙니다. 기본 모델 카드가 명시한 공식 테스트 범위는 다음과 같습니다.
-
운영체제: Linux만 테스트
-
정밀도: BF16만 테스트
-
GPU 세대: NVIDIA Ampere, Hopper, Blackwell
-
실행 환경: PyTorch, vLLM-Omni 등 작업별 스택
-
대상 장치: 데이터센터 GPU, RTX PRO, DGX, Jetson Thor 계열
“엣지”라는 표현은 ** 클라우드 API를 반드시 거치지 않고 현장 장치에서 실행할 수 있는 배치 위치 ** 를 뜻합니다. 모든 생성 작업이 인간이 느끼기에 즉시 끝난다는 뜻은 아닙니다.
NVIDIA의 기본 모델 카드에서 189프레임 이미지-투-비디오 생성은 Jetson AGX Thor T5000에서 vLLM-Omni 기준 137.50초, T3000에서 194.76초로 보고됐습니다. 반면 로봇 정책은 한 번에 긴 영상을 완성하는 대신 짧은 행동 청크를 만들고, 그 청크가 소진되기 전에 다음 청크를 준비하면 됩니다. 그래서 “비디오 생성 시간”과 “로봇 제어 주기 충족”은 서로 다른 지표입니다.
15Hz의 정확한 뜻: 초당 15번 모델을 호출했다는 말이 아니다
NVIDIA의 Policy-DROID 카드에서 가장 주목받은 문구는 **15Hz 실시간 제어 ** 입니다. 이 숫자를 이해하려면 행동 청크를 봐야 합니다.
테스트에서는 한 번의 요청이 [32, 8] 형태의 행동 청크를 만듭니다. 즉 미래 32개 시점에 대해 각각 8개 행동 값을 생성합니다. 15Hz로 32개 행동을 실행하면 청크 하나가 약 ** 2.133초 ** 를 커버합니다. 모델이 다음 청크를 2.133초 안에 준비하면 실시간 예산을 맞춘 것으로 계산합니다.
NVIDIA가 공개한 PyTorch 루프백 측정은 다음과 같습니다.
Jetson AGX Thor T5000
** 메모리·조건 ** 128GB, MAXN, 1575MHz
** 중앙값 E2E** 1.528초
15Hz RTF 1.40
**15Hz 예산 충족 ** 예
Jetson AGX Thor T4000
** 메모리·조건 ** 64GB급, MAXN, 1530MHz
** 중앙값 E2E** 2.208초
15Hz RTF 0.97
**15Hz 예산 충족 ** 아니오
Jetson Thor T3000
** 메모리·조건 ** 32GB, 1100MHz, 에뮬레이션
** 중앙값 E2E** 2.632초
15Hz RTF 0.81
**15Hz 예산 충족 ** 아니오
Jetson Thor T2000
** 메모리·조건 ** 16GB, 765MHz, THOR_NANO
** 중앙값 E2E** 5.195초
15Hz RTF 0.41
**15Hz 예산 충족 ** 아니오
NVIDIA Policy-DROID 모델 카드의 [32, 8] 청크 조건. T5000만 중앙값 15Hz 예산을 충족했으며, 이는 실제 로봇 검증이 아닌 단일 구성 루프백 측정이다. T3000은 에뮬레이션 값이다.
여기서 네 가지 제한을 반드시 붙여야 합니다.
-
15Hz를 충족한 것은 T5000 한 구성입니다. “Jetson Thor라면 15Hz”라고 일반화할 수 없습니다. 다만 T4000은 중앙값 기준 예산을 약 3.5%, 가장 빠른 요청 기준 약 0.7% 초과한 근소한 미달이었습니다.
-
별도의 15Hz 실제 로봇 주행을 여러 번 수행한 표가 아닙니다. 동일 지연값을 5Hz와 15Hz 청크 예산에 대입한 루프백 측정입니다.
-
입력은 640×540 관측을 544×736 버킷으로 변환했고, 4단계 UniPC, guidance 3.0, conditioning_fps=15 를 사용했습니다.
-
T3000은 메모리·SM·클럭·CPU를 제한한 에뮬레이션 결과입니다. NVIDIA는 이 에뮬레이션이 DRAM 대역폭까지는 제한하지 않았기 때문에 실제 생산형 T3000이 더 느릴 수 있다고 적었습니다.
별도의 vLLM-Omni 표는 320×192 관측, 30단계 노이즈 제거, 5Hz 예산을 사용합니다. 이 조건에서는 T5000·T4000·에뮬레이션 T3000이 5Hz 청크 예산을 맞췄고 T2000은 맞추지 못했습니다. NVIDIA도 두 표는 입력 처리, 단계 수, 런타임, 측정 프로토콜이 달라 직접 비교하면 안 된다고 명시합니다.
따라서 가장 정확한 한 문장은 이렇습니다.
NVIDIA의 특정 PyTorch Policy-DROID 루프백 설정에서 T5000이 32개 행동 청크의 15Hz 실행 예산을 충족했다.
“Cosmos 3 Edge가 모든 로봇에서 초당 15번 완전한 추론을 끝낸다”는 문장은 이 표가 뒷받침하지 않습니다.
벤치마크 1위는 어디까지 믿어야 하나
NVIDIA는 Cosmos 3 Edge가 같은 파라미터급에서 **VANTAGE-Bench 1위 ** 라고 마케팅 자료에서 발표했습니다. 모델 카드와 기술 보고서에는 비전 추론, 이미지-투-비디오, 로봇 정책 평가가 함께 제시됩니다.
이 결과는 모델의 가능성을 보여주는 유용한 출발점입니다. 하지만 이번 조사에서 동일 체크포인트와 동일 하드웨어로 재현한 독립 벤치마크는 찾지 못했습니다. 2차 보도도 대부분 NVIDIA 자료를 요약했고, MarkTechPost 역시 이 결과를 “internally claimed”라고 구분했습니다.
그래서 기사에서 허용할 수 있는 표현은 다음과 같습니다.
-
가능: “NVIDIA는 같은 크기급 VANTAGE-Bench에서 1위를 기록했다고 보고했다.”
-
가능: “공식 모델 카드에는 입력·런타임·지연 조건이 공개돼 있다.”
-
보류: “독립 평가에서도 1위가 재현됐다.”
-
금지: “현재 가장 뛰어난 엣지 로봇 모델로 검증됐다.”
벤치마크를 실제 도입 판단으로 바꾸려면 독자 자신의 카메라, 조명, 작업 공간, 로봇 형태, 실패 비용에서 다시 시험해야 합니다.
‘오픈’이지만 Apache 오픈소스라고 부르면 안 된다
Hugging Face 메타데이터는 Cosmos3-Edge의 라이선스를 license: other, 이름을 openmdw1.1-license 로 기록합니다. 실제 모델 카드와 GitHub 저장소의 LICENSE는 OpenMDW-1.1 을 가리킵니다.
OpenMDW-1.1의 핵심은 다음과 같습니다.
-
모델 재료를 사용·수정·배포할 수 있는 광범위한 권한을 부여합니다.
-
모델 카드는 상업적·비상업적 사용이 가능하다고 설명합니다.
-
모델 재료를 배포할 때 라이선스 사본과 적용되는 저작권·출처 고지를 유지해야 합니다.
-
모델 재료의 특허·저작권 침해를 주장하는 소송에 자발적으로 참여하면 권한이 종료될 수 있는 조항이 있습니다.
-
생성된 출력의 사용·수정·공유에는 이 라이선스가 별도 제한을 두지 않습니다.
-
그러나 제3자 권리, 입력 데이터의 허가, 개인정보와 지식재산권 확인 책임은 사용자에게 남습니다.
따라서 가장 안전한 표현은 ** “OpenMDW-1.1로 공개된 오픈웨이트 모델” ** 입니다. Apache-2.0 오픈소스 나 제약 없는 퍼블릭 도메인 으로 부르면 안 됩니다. 제품에 넣기 전에는 법무 검토와 배포 고지 설계를 별도로 해야 합니다.
공개 가중치와 오픈소스는 같은 말이 아니다. Cosmos 3 Edge 가중치는 OpenMDW 1.1 조건을 읽고 배포 통지·제3자 권리·특허 조항을 확인해야 한다.
직접 시험한다면 무엇부터 해야 하나
Cosmos 3 Edge를 실제 장비에 연결하기 전에는 네 단계를 분리하는 편이 안전합니다.
1. 추론 모드부터 확인한다
장면 설명이 목적이라면 reasoner부터 시작하고, 미래 프레임 생성이 필요할 때 generator를 붙입니다. 행동 정책이 필요할 때만 Policy-DROID와 정책 서버를 도입합니다. 한 번에 모든 모드를 올리면 메모리와 오류 원인을 분리하기 어렵습니다.
2. 시뮬레이션에서 행동 청크를 기록한다
공식 예시는 RoboLab의 BananaInBowlTask 를 사용합니다. 성공률만 보지 말고 충돌, 궤적 진동, 그리퍼 타이밍, 실패 후 복구를 함께 저장해야 합니다. 평균 성공률이 높아도 드문 위험 행동이 있으면 실제 장비 연결 기준을 통과한 것이 아닙니다.
3. 지연시간을 세 층으로 측정한다
-
모델 서버의 순수 추론 시간
-
네트워크·직렬화가 포함된 클라이언트 E2E 시간
-
센서 입력부터 액추에이터 명령까지의 전체 제어 루프 시간
공식 표의 E2E는 클라이언트 HTTP 오버헤드를 포함하지만, 독자 로봇의 센서 드라이버와 모터 제어 지연까지 자동으로 포함하는 것은 아닙니다.
4. 안전 계층을 모델 밖에 둔다
속도·힘·관절 한계, 작업 공간, 충돌 회피, 비상 정지는 생성 모델의 자연어 지시만으로 보장하면 안 됩니다. 모델 출력은 후보 행동이고, 실제 실행 권한은 결정론적 제어기와 안전 시스템이 가져야 합니다.
지금 시험할 팀과 기다릴 팀
지금 제한된 파일럿을 해볼 만한 경우
-
Linux와 BF16 환경에서 Ampere·Hopper·Blackwell GPU를 운용하는 연구팀
-
시뮬레이터와 실제 로봇 사이에 검증 단계를 이미 갖춘 조직
-
DROID 계열 조작 작업을 자신의 데이터로 후처리하려는 팀
-
지연시간과 실패 궤적을 직접 기록할 수 있는 엔지니어링 환경
-
OpenMDW-1.1 고지와 권리 검토를 처리할 수 있는 제품 조직
기다리거나 작은 범위만 시험해야 하는 경우
-
16GB T2000에서 15Hz 정책 제어를 바로 기대하는 경우
-
T3000 생산 하드웨어의 실제 성능이 필요한 경우 — NVIDIA는 T3000·T2000 출시를 2027년 1분기로 안내했습니다.
-
Windows나 FP4·FP8·FP16이 공식 지원된다고 가정하는 경우
-
실제 사람 옆에서 움직이는 로봇에 바로 연결하려는 경우
-
독립 재현된 벤치마크와 장기 안전 데이터가 필수인 규제·고위험 환경
실제 도입은 시뮬레이션, 하드웨어 실측, 안전 제약, 제한된 실환경 배포의 순서로 진행해야 한다.
최종 판단: 데이터센터를 벗어난 것은 모델의 위치이지 검증 책임이 아니다
Cosmos 3 Edge의 가장 흥미로운 변화는 “작은 모델이 큰 모델을 이겼다”는 단순한 서열이 아닙니다. 비전 추론, 미래 장면 생성, 행동 청크를 하나의 기반 표현으로 연결하고, 그 일부를 현장 GPU에서 실행할 수 있게 한 점입니다.
하지만 공식 자료를 세밀하게 읽으면 광고 문구보다 더 유용한 결론이 나옵니다. ** 15Hz는 T5000의 특정 Policy-DROID 루프백 구성에서 충족한 청크 예산이고, T4000·T3000·T2000으로 자동 확장되지 않습니다. ** VANTAGE-Bench 1위는 NVIDIA가 보고한 결과이며 독립 재현을 기다려야 합니다. OpenMDW-1.1은 광범위한 사용 권한을 주지만, Apache 오픈소스와 같은 말은 아닙니다. 무엇보다 모델 카드 스스로 이 시스템을 물리적으로 정확한 시뮬레이터나 안전 인증된 의사결정기로 취급하지 말라고 경고합니다.
따라서 도입 순서는 분명합니다. ** 파일과 라이선스를 확인하고, 시뮬레이션에서 행동을 기록하고, 자신의 하드웨어로 지연을 재고, 외부 안전 계층을 통과한 뒤 실제 장비에 연결하는 것. ** Cosmos 3 Edge는 그 실험을 시작할 수 있는 공개된 기반 모델이지, 검증 단계를 생략하게 해주는 완성형 로봇 두뇌가 아닙니다.
공식 자료와 보조 자료
-
NVIDIA Cosmos 3 Edge 발표
-
Hugging Face: Introducing Cosmos 3 Edge
-
Cosmos3-Edge 모델 카드
-
Cosmos3-Edge-Policy-DROID 모델 카드
-
Cosmos 3 기술 보고서
-
Cosmos GitHub 저장소
-
Cosmos Framework GitHub 저장소
-
OpenMDW-1.1 라이선스 원문
-
NVIDIA Jetson Thor 발표
-
MarkTechPost 보조 보도
-
GIGAZINE 보조 보도
- 모델 파일, 하드웨어 표, 라이선스와 출시 일정은 2026년 7월 24일 확인 기준입니다. 벤치마크는 NVIDIA가 공개한 측정이며, 독립 재현 결과가 아닙니다. 실제 도입 전 최신 모델 카드와 라이선스를 다시 확인하세요. *
다음 액션
실전 운영/리서치 사례를 주간으로 받아보려면 블로그를 북마크하고, 필요한 주제는 문의로 남겨주세요.

