- 시스템 아키텍처 전체 개요 및 주요 블록 분해
본 특허가 제시하는 시스템은 물리적 세계와 디지털 지능 사이의 간극을 메우는 정교한 데이터 처리 파이프라인으로 구성됩니다. 전체 아키텍처는 크게 4개의 핵심 모듈로 분해할 수 있습니다: (A) 다중 시점 시계열 이미지 획득 모듈(Multi-view Temporal Image Acquisition Module), (B) 4D 장면 재구성 엔진(4D Scene Reconstruction Engine), (C) 물리 속성 추론 신경망 코어(Physics Inference Neural Core), (D) 행동 계획기 연동 모듈(Action Planner Integration Module)입니다.
(A) 다중 시점 시계열 이미지 획득 모듈은 테슬라 차량의 8개 이상의 카메라 또는 옵티머스 로봇의 스테레오 비전 헤드와 같은 하드웨어 시스템에 해당합니다. 이 모듈의 핵심 요구사항은 모든 카메라 간의 정밀한 시간 동기화(sub-millisecond)와 정확한 외부/내부 파라미터 보정(extrinsic/intrinsic calibration)입니다. 시간 동기화 오차는 동적 분석의 정확도를 치명적으로 저하시키므로, 시스템은 PTP(Precision Time Protocol) 등을 활용하여 모든 이미지 프레임에 고정밀 타임스탬프를 부여합니다.
(B) 4D 장면 재구성 엔진은 획득된 2D 이미지 스트림을 입력받아 시공간적으로 일관된 3D 표현으로 변환합니다. 초기에는 전통적인 Structure-from-Motion(SfM)과 Multi-View Stereo(MVS) 기법이 사용될 수 있으나, 특허의 진정한 잠재력은 NeRF(Neural Radiance Fields)나 3D Gaussian Splatting과 같은 최신 신경망 기반 렌더링 기술을 활용하는 데 있습니다. 이 엔진은 단순히 포인트 클라우드를 생성하는 것을 넘어, 시간에 따라 변화하는 객체의 표면, 질감, 심지어 투명도와 반사율까지 포함하는 고밀도 복셀(voxel) 또는 가우시안 집합(Gaussian set)을 생성합니다. 결과물은 특정 시간 에서의 각 점 의 위치뿐만 아니라, 그 점의 속도 벡터 와 가속도 벡터 까지 포함하는 4D 동적 장면 표현입니다. 이 단계에서 데이터의 정밀도가 후속 물리 추론의 성패를 좌우합니다.