[NVIDIA] TensorRT-LLM으로 VLM 추론 서버 구성하기
TensorRT-LLM의 최신 멀티모달 추론 구조와 PyTorch 백엔드 기반 trtllm-serve 실행 방법, 최적화와 운영 시 주의사항을 정리합니다.
TensorRT-LLM의 최신 멀티모달 추론 구조와 PyTorch 백엔드 기반 trtllm-serve 실행 방법, 최적화와 운영 시 주의사항을 정리합니다.
Prime Agent는 내장 도구가 ipython 하나뿐인 코딩 에이전트입니다. 컨텍스트를 변수에 담는 RLM 구조와, 에이전트가 자기 하네스를 고치는 Continual Harness를 정리합니다.
에이전트를 감싸는 프롬프트·스킬·메모리를 사람이 아니라 에이전트가 직접 고치게 한 논문입니다. 포켓몬을 벤치마크로 삼은 이유와, 리셋 없이 온라인으로 개선한다는 것의 의미를 정리합니다.
LLM의 토큰이 글자 수와 어떻게 다른지, 한글이 토큰을 더 많이 쓰는 이유와 토큰을 아끼는 여섯 가지 방법을 정리합니다.
LLM이 긴 대화에서 앞부분을 잊는 이유를 컨텍스트 윈도우 구조로 설명하고, 비용과 답변 품질을 지키는 실전 대처법을 정리합니다.
여러 서버의 리소스를 한 화면에서 모니터링하기 위해 Zabbix 서버를 설치하고 agent2를 설정하는 과정을 정리합니다.
CLIP의 대조학습을 비디오로 확장한 VideoCLIP 논문 리뷰. 이미지-텍스트 정렬 방식이 영상 데이터에 적용되는 과정을 정리합니다.
지능형 CCTV에서 관측 피로도를 줄이는 두 가지 접근인 Video Summary와 Video Synopsis가 어떻게 다른지 비교합니다.
학습 없이 CLIP의 분류 성능을 높이는 Tip-Adapter 논문 리뷰. Zero-Shot 분류의 한계와 캐시 기반 접근 방식을 정리합니다.
Cursor AI를 실행할 때마다 Vim insert 모드로 진입하는 문제를 설정 변경으로 해결하는 방법입니다.