본문 바로가기

전체 글75

RunPod에서 LeRobot으로 SmolVLA + LIBERO 테스트 환경 구축하기 이번 글에서는 RunPod 환경에서 LeRobot을 설치하고, SmolVLA를 LIBERO 벤치마크에서 테스트하기 위한 환경을 구성해보겠습니다. RunPod 서버 생성 및 VS Code 연결 방법은 이전 글에서 다뤘으니, 서버 준비가 필요한 경우 아래 링크의 글을 먼저 참고해주세요.RunPod를 VS Code와 연결해서 GPU 서버 사용하기 RunPod를 VS Code와 연결해서 GPU 서버 사용하기고성능 GPU를 비교적 저렴한 가격에 사용할 수 있는 RunPod를 사용해봤습니다.이번 글에서는 VS Code와 연결해 편하게 개발 환경을 구성하는 방법을 정리해보겠습니다. 아래 링크는 레퍼럴 링크이며grow-up-by-coding.tistory.com 테스트 환경 아래 환경을 기준으로 진행합니다.Python.. 2026. 9. 10.
RunPod를 VS Code와 연결해서 GPU 서버 사용하기 고성능 GPU를 비교적 저렴한 가격에 사용할 수 있는 RunPod를 사용해봤습니다.이번 글에서는 VS Code와 연결해 편하게 개발 환경을 구성하는 방법을 정리해보겠습니다. 아래 링크는 레퍼럴 링크이며, 링크를 통해 가입 후 처음 $10를 충전하면 $5~$500의 일회성 크레딧을 받을 수 있습니다.https://runpod.io?ref=uzxsivz1 The AI Developer Cloud | RunpodAI infrastructure with on-demand GPUs and serverless compute. Run training, inference, and batch workloads on the cloud with Runpod.www.runpod.io 회원가입하시고 로그인하시면 왼쪽에 sett.. 2026. 9. 10.
AdaIN Style Transfer 정리 및 코드 StyleTransfer 방법 중 하나인 AdaIN에 대해 정리하고 코드를 공유해 보도록 하겠습니다.IntroductionLossCodeResultsIntroductionStyleTransfer는 source image의 content는 유지하면서 target image의 style로 변경하는 기법을 의미합니다.AdaIN 논문 바로가기: https://arxiv.org/pdf/1703.06868 기존의 StyleTransfer (14초)에 비해 매우 빠른 속도로 스타일 변환이 가능합니다. 약 0.018초 VGG를 사용하는 것은 유사하나 다음과 같은 식을 이용해서 이미지 특징의 평균과 분산을 바꿈으로써 스타일 변환을 시도합니다.$$ \text{AdaIN}(x,y) = \sigma(y) \Big( \frac.. 2025. 3. 23.
Variational Autoencoder (VAE)와 ELBO, KL Divergence 이해하기 Variational Autoencoder(VAE)는 생성 모델 중 하나로, 데이터의 잠재 표현(latent representation)을 학습하면서 데이터를 재구성하는 모델입니다. VAE를 학습하기 위해 중요한 개념인 Evidence Lower Bound (ELBO)와 KL Divergence에 대해 자세히 알아보겠습니다. 목록1. VAE의 기본 개념2. Evidence Lower Bound (ELBO)3. KL Divergence의 형태 유도4. MNIST 데이터를 활용한 VAE 구현 예제 (PyTorch)5. 결론  1. VAE의 기본 개념VAE는 두 가지 네트워크로 구성됩니다.인코더(Encoder): 입력 데이터 $x$로부터 잠재 변수 $z$의 근사 분포 $q(z|x)$ (보통 정규 분포의 평균 .. 2025. 2. 13.
[논문 리뷰] StructuredField: Unifying Structured Geometry and Radiance Field 정리 StructuredField: Unifying Structured Geometry and Radiance Field라는 논문을 정리하겠습니다.[논문 바로가기] 목차배경방법실험배경기존의 3D Gaussian splatting(3DGS)과 같은 point-based 접근법은 구조적(structured)이지 않습니다. 그래서 편집과 시뮬레이션에는 적절하지 않습니다. 이를 해결하기 위해, StructuredField라는 것을 제안했고, 이것은 기존의 3DGS와 달리 구조적이며 3DGS의 특징인 고해상도의 빠른 렌더링도 할 수 있습니다.방법StructureField는 3DGS를 표현하기 위해 Tetrahedral mesh(사면체 메시)를 이용합니다. 전반적인 방법입니다. 주어진 여러 장의 multi-view 이미.. 2025. 2. 2.
[논문 리뷰] BLIP2, Q-Former 요약 정리 Q-Former는 Querying Transformer의 약자로 BLIP-2 (BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models) 논문에서 처음 소개되었습니다.논문 바로가기: https://arxiv.org/abs/2301.12597목차Q-Former 제안 배경Q-Former 동작 과정Vision-and-Language Representation LearningVision-to-Language Generative Learning결과Q-Former 제안 배경기존의 LLM은 텍스트 입력만을 받기 때문에 이미지를 입력할 수 없습니다. 이미지를 LLM에 입력하여 이미지에 대해서 .. 2025. 1. 28.