Stable Diffusion fine-tuning
키워드 광고
1 min read
Stable Diffusion fine-tuning
키워드 광고
2406.18790 MUMU: BOOTSTRAPPING MULTIMODAL IMAGE GENERATION FROM TEXT-TO-IMAGE DATA.
History comfyUI workflow 셋팅이 필요하다 후보 모델들 Mochi 1: genmo/mochi-1-preview · Hugging Face HunyuanVideo LTX Video: GitHub - Lightricks/LTX-Video: Official repository for LTX-Video...
GAN Generative Adversarial Network 의 RL/value function \displaystyle\min {G}\max {D}V(D,G)=\mathbb{E} {x\sim\operatorname{P {data(x)}}}[\log D(x)]+\mathbb{E} {z\sim P...
SFT 모델과 너무 멀어지면 SFT 에서 학습한 능력이 소실.
Multimodal Learning Multimodal learning은 text, image, audio, video, tabular feature처럼 서로 다른 modality의 정보를 함께 사용하는 학습 설정이다.
CLIP(Contrastive Language-Image Pre-training)은 image encoder 와 text encoder 를 함께 학습해서, 이미지와 텍스트를 같은 embedding space 에 맞추는 multimodal model 이다.
GitHub - cybertronai/gradient-checkpointing: Make huge neural nets fit in memory.
LLM API 콜 할때 시간/비용이 많이 요구되는 이슈를 해결하기 위해 사용하는 방법 일종의 프롬프트 엔지니어링 처럼 해결하는 것으로 보임 PROMPT = """\ 다양한 작업에 대한 답변을 생성해주세요, 이러한 작업 지침은 ChatGPT 모델에 주어지며, ChatGPT 모델이 지침을...
References medium.com/data-breach/introduction-to-sift-scale-invariant-feature-transform-65d7f3a72d40.
Refer link statproofbook.github.io/D/gm generative model 이란 training data 가 주어졌을 때, 이 training data 에 대한 분포와 같은 분포에서 sampling 하는 Machine Learning Model 을 의미한다.