[VLM 운영] 이미지·영상 입력 예산으로 OOM을 막는 법 — vLLM 멀티모달 제한 설계
멀티모달 입력의 개수, 프레임 수, 해상도를 제한하고 품질과 지연을 함께 검증하는 운영 절차입니다.
멀티모달 입력의 개수, 프레임 수, 해상도를 제한하고 품질과 지연을 함께 검증하는 운영 절차입니다.
vLLM에서 PyNvVideoCodec과 DeepStream을 선택하고 디코딩 VRAM 예산을 검증하는 운영 절차를 정리합니다.
LAG, 이동평균, 누적합을 SQL 윈도우 함수로 한 번에 계산하는 법을 정리합니다. 같은 계산을 pandas로 했을 때 답이 달라지는 원인과, SQLite·DuckDB·pandas 실행 시간 실측을 함께 담았습니다.
TensorRT의 min/opt/max profile을 실제 요청 분포에 맞춰 설계하고 trtexec로 검증하는 운영 절차를 정리합니다.
Qwen3-VL의 DeepStack이 여러 ViT 층의 특징을 초기 LLM 층에 주입하는 구조와 처리 순서, 실무 적용 시 주의사항을 정리합니다.
학습 없이 예측한다는 시계열 파운데이션 모델을 노트북 CPU에서 실제로 돌려 나이브 기준선과 비교했습니다. 어떤 데이터에서 이기고 어디서 지는지, 속도와 한계를 실측으로 정리합니다.
TensorRT Weight Streaming으로 일부 가중치를 호스트 메모리에 두어 VRAM 사용량을 줄이고, 상주 예산과 성능을 검증하는 방법을 정리합니다.
SigLIP 2의 학습 목표와 NaFlex가 원본 종횡비를 보존하는 방식, 고밀도 특징 활용과 실무 적용 시 주의사항을 정리합니다.
Muon 옵티마이저가 행렬 업데이트를 직교화하는 이유와 Newton–Schulz 반복, AdamW와의 혼합 구성 및 적용 시 주의사항을 정리합니다.
CUDA Graphs가 반복 GPU 추론의 커널 실행 오버헤드를 줄이는 원리와 캡처·재실행 흐름, 적용 조건과 주의사항을 정리합니다.