1 min read
... 수 있음으로 딥러닝 모델 사용시에 매우 유효한 최적화 전략 중 하나입니다. Kernel Fusion 을 수행하는 방법으로는 직접 Kernel 을 CUDA C++ 로 작성하는 방법이 있고, TensorRT 와 같이 자동으로 Kernel Fusion 을 지원하는 툴들을 이용하여 학습된 모델을 최적화 하는 방법도 있습니다. C) Related D) References 새로운 루다를 지탱하는 모델...
Triton Triton Inference Server 는 딥러닝 모델을 높은 성능으로 서빙을 할 수 있는 오픈소스 추론서버입니다. ONNX, TensorFlow, PyTorch, TensorRT 와 같은 다양한 딥러닝 프레임워크를 지원하며 다양한 모델 실행과 효율적인 배치 전략을 통해 하드웨어 활용도를 극대화할 수 있도록 최적화 설계되었습니다 (C++ base). B) Reposi...
Triton Triton Inference Server 는 딥러닝 모델을 높은 성능으로 서빙을 할 수 있는 오픈소스 추론서버입니다.
Kernel Fusion GPU 는 Kernel 단위로 연산이 이루어 지게 됩니다. 예를 들어 우리가 두개의 텐서를 서로 MatMul 후에 Add 하는 연산을 수행할 때, Matmul Kernel, Add Kernel 이렇게 두개의 커널을 실행하게 됩니다.
Megatron-LM B) Related C) References.
DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale DeepSpeed-MoE 란, an end-to-end MoE training and inference solution as part...
GPT B) Related C) References.
Resilient Distributed Datasets RDD 는 스파크 내에 저장된 데이타를 의미하며, 여러 분산 노드에 걸쳐서 저장되는 변경이 불가능한 데이타 (객체) 의 집합이다. 각각의 RDD 는 여러개의 파티션으로 분리가 된다.
RankNet B) Related C) References.
Adam B) Related C) References.
N-gram B) Related C) References.
ArgoCD ArgoCD 는 GitOps 방식으로 관리되는 Manifest(yaml) 파일의 변경사항을 감시하며, 현재 배포된 환경의 상태와 Github Manifest 파일에 정의된 상태를 동일하게 유지하는 역할을 수행한다.