전체 글101 Video2Sim | RGB-D 영상만 보고 물리 Simulator를 만들 수 있을까? RGB 또는 RGB-D 영상으로부터 3D Scene을 복원하는 연구를 넘어, Scene 안의 물체가 어떻게 움직일 수 있는지까지 추론하는 연구가 활발하게 진행되고 있습니다. 예를 들어 서랍을 관찰한다고 해보겠습니다.단순한 3D Reconstruction에서는 서랍의 Geometry를 복원하는 것으로 충분합니다. 하지만 로봇이 이 서랍과 상호작용하려면 더 많은 정보를 알아야 합니다.어떤 부분이 움직이는가?어떤 방향으로 움직이는가?Revolute Joint인가, Prismatic Joint인가?Joint Axis는 어디에 있는가?물체의 질량은 얼마인가?마찰이나 관성은 어느 정도인가?결국 실제 세계와 비슷하게 행동하는 Digital Twin을 만들기 위해서는 Geometry뿐 아니라 Kinematics와 Dy.. 2026. 9. 22. Ditto | 물체를 한번 움직여서 articulated objects 만들기 로봇이 현실의 물체와 상호작용하려면 단순히 물체의 3D Geometry만 복원하는 것으로는 부족합니다.예를 들어 서랍을 3D Mesh로 잘 복원했다고 해보겠습니다. 겉모습은 현실과 비슷할 수 있지만,어느 부분이 움직이는지어떤 방향으로 움직이는지회전하는지, 직선으로 움직이는지회전축은 어디에 있는지를 알지 못한다면 로봇이 사용할 수 있는 Interactive Digital Twin이라고 하기는 어렵습니다.이번에 살펴볼 Ditto: Building Digital Twins of Articulated Objects from Interaction은 이러한 문제를 재미있는 방법으로 접근합니다.https://arxiv.org/pdf/2202.08227 물체를 그냥 바라보는 것이 아니라,한번 움직여봅니다.그리고 물체를.. 2026. 9. 21. C2F2NeUS | MVS의 정밀함과 Neural SDF의 매끄러움을 모두 가져오다 여러 장의 이미지로부터 3D Scene을 복원하는 방법은 크게 두 가지 흐름으로 나누어 볼 수 있습니다.하나는 Multi-View Stereo(MVS)를 이용해 각 이미지의 Depth를 추정한 뒤 이를 합쳐 3D Point Cloud나 Mesh를 만드는 방법이고,다른 하나는 NeUS와 같은 Neural Implicit Surface를 이용해 공간 자체를 SDF로 표현하는 방법입니다. 두 방식은 각각 장단점이 있습니다.MVS는 이미지의 pixel-level 정보를 활용하기 때문에 비교적 정밀한 geometry를 얻을 수 있지만,Image ↓Depth Map ↓Depth Filtering ↓Depth Fusion ↓Point Cloud ↓Mesh Reconstruction처럼 여러 후처리 .. 2026. 9. 21. iTACO | 영상 하나로 상호작용 가능한 3D Object 만들기 최근 3D reconstruction 기술을 이용하면 현실의 물체를 상당히 정교하게 3D 공간으로 복원할 수 있습니다.NeRF나 3D Gaussian Splatting을 이용하면 물체의 appearance까지 사실적으로 재현할 수 있고, RGB-D camera를 이용하면 비교적 쉽게 geometry를 얻을 수도 있습니다. 그런데 로봇 시뮬레이션 관점에서는 물체의 모양만 복원하는 것만으로는 충분하지 않습니다.예를 들어 현실의 전자레인지를 3D로 복원했다고 해보겠습니다.Mesh가 아무리 정교하더라도,문이 어디에 붙어 있고, 어느 축을 중심으로 회전하며, 어느 부분이 움직이는지알 수 없다면 로봇은 이 전자레인지 문을 제대로 열 수 없습니다. 즉, robotics에서 필요한 Digital Twin은 단순한 3D.. 2026. 9. 21. SceneSplat | 3D Gaussian Splatting에 의미를 부여하다 최근 3D Gaussian Splatting(3DGS)은 빠른 렌더링 속도와 높은 reconstruction 품질을 바탕으로 3D scene representation의 대표적인 방법 중 하나로 자리 잡고 있습니다. 하지만 3DGS가 만들어낸 scene을 보면 한 가지 아쉬운 점이 있습니다.사람이 보기에는여기는 의자이고, 여기는 테이블이고, 저쪽에는 문이 있다.라고 쉽게 이해할 수 있지만, 기본적인 3DGS 자체에는 이러한 semantic information이 포함되어 있지 않습니다. 이를 해결하기 위해 최근에는 CLIP과 같은 Vision-Language Model의 feature를 3D Gaussian에 연결하여"chair"와 같은 자연어 query로 원하는 영역을 찾을 수 있는 Language G.. 2026. 9. 20. SimRecon | 실제 영상을 Isaac Sim에서 사용할 수 있는 3D Scene으로 만들 수 있을까? SimRecon: SimReady Compositional Scene Reconstruction from Real Videoshttps://arxiv.org/pdf/2603.02133v1 최근 3D reconstruction 기술을 보면 하나의 영상이나 여러 장의 이미지로부터 꽤 그럴듯한 3D 공간을 복원할 수 있습니다.NeRF나 3D Gaussian Splatting처럼 장면 자체를 복원하는 기술도 빠르게 발전하고 있는데요. 하지만 로봇 시뮬레이션 관점에서는 한 가지 문제가 있습니다.보기 좋은 3D Scene을 만들었다고 해서, 바로 로봇이 상호작용할 수 있는 것은 아닙니다.예를 들어 방 하나를 3D Gaussian Splatting으로 정교하게 복원했다고 해도,어느 부분이 책상인지어느 부분이 의자인지.. 2026. 9. 20. 이전 1 2 3 4 ··· 17 다음