[TensorRT] 멀티 GPU 서버에서 엉뚱한 GPU를 잡는 문제 진단하기
GPU UUID와 논리 번호를 확인하고 TensorRT 객체, 스트림, 버퍼를 같은 CUDA 컨텍스트에 만드는 운영 절차를 정리합니다.
GPU UUID와 논리 번호를 확인하고 TensorRT 객체, 스트림, 버퍼를 같은 CUDA 컨텍스트에 만드는 운영 절차를 정리합니다.
이동평균 3σ, MAD, IsolationForest, Chronos-2 예측오차를 실제 고장이 라벨된 데이터 7종에 붙여 비교했습니다. 같은 알람 예산에서 몇 개를 잡고 몇 번 헛울리는지 실측으로 정리합니다.
멀티모달 입력의 개수, 프레임 수, 해상도를 제한하고 품질과 지연을 함께 검증하는 운영 절차입니다.
vLLM에서 PyNvVideoCodec과 DeepStream을 선택하고 디코딩 VRAM 예산을 검증하는 운영 절차를 정리합니다.
LAG, 이동평균, 누적합을 SQL 윈도우 함수로 한 번에 계산하는 법을 정리합니다. 같은 계산을 pandas로 했을 때 답이 달라지는 원인과, SQLite·DuckDB·pandas 실행 시간 실측을 함께 담았습니다.
TensorRT의 min/opt/max profile을 실제 요청 분포에 맞춰 설계하고 trtexec로 검증하는 운영 절차를 정리합니다.
Qwen3-VL의 DeepStack이 여러 ViT 층의 특징을 초기 LLM 층에 주입하는 구조와 처리 순서, 실무 적용 시 주의사항을 정리합니다.
학습 없이 예측한다는 시계열 파운데이션 모델을 노트북 CPU에서 실제로 돌려 나이브 기준선과 비교했습니다. 어떤 데이터에서 이기고 어디서 지는지, 속도와 한계를 실측으로 정리합니다.
TensorRT Weight Streaming으로 일부 가중치를 호스트 메모리에 두어 VRAM 사용량을 줄이고, 상주 예산과 성능을 검증하는 방법을 정리합니다.
SigLIP 2의 학습 목표와 NaFlex가 원본 종횡비를 보존하는 방식, 고밀도 특징 활용과 실무 적용 시 주의사항을 정리합니다.