1 min read
한국어 모델 Eos Token 이슈 한글 LLM 맛보기 : 네이버 블로그.
Fine-tuning 파인 튜닝 방식은 모델의 모든 parameter 를 학습시키는 방법이다. 해당 학습과 다른 방식으로는 linear probing 방식이 있다.
NVIDIA 가 만든 대형 transformer 학습 프레임워크다. 한 장의 GPU 에 올라가지 않는 모델을 여러 GPU 에 쪼개 학습시키기 위한 tensor-slicing model parallelism 을 제안한 것으로 알려져 있다.
ShareGPT 에서 모은 약 125K 개의 사용자 대화 데이터를 기반으로 파인튜닝한 Llama 기반 모델 Training 데이터셋 ShareGPT 데이터셋은 공개하지 않음 Preprocessing To ensure data quality, we convert the HTML back to markdown and...
Rotary Positional Embedding (RoPE) 는 절대적 방식과 상대적 방식을 통합한 새로운 Positional Encoding 방식입니다.
LLM API 콜 할때 시간/비용이 많이 요구되는 이슈를 해결하기 위해 사용하는 방법 일종의 프롬프트 엔지니어링 처럼 해결하는 것으로 보임 PROMPT = """\ 다양한 작업에 대한 답변을 생성해주세요, 이러한 작업 지침은 ChatGPT 모델에 주어지며, ChatGPT 모델이 지침을...
언어 모델을 학습하기 위해 사용하는 허깅페이스 클래스. 주로 LLM 을 학습할때 사용한다. Training Arguments steps: 데이터셋에 포함된 배치 개수를 의미.
배경 Qwen2.5 의 72b 급 대용량 모델을 학습하는 방법에 대해 조사해보자.
왜 전통적인 분류 모델을 사용하지 않고, LLM 을 통해 분류 문제를 해결하려 할까? LLM 만의 장점 학습 데이터셋이 많지 않은 경우, 빅 모델이 성능 면에서 더 효율적일 수 있다. 클래스가 자주 바뀌는 경우, LLM 은 자주 재학습시킬 필요가 없다.
Let’s reproduce GPT-2 (124M) - YouTube Questions dropout 은 왜 softmax 이후에 적용하는 걸까? GPT 모델에서 cheating 방지를 위해 masking 하는 방식은 아직도 이해를 잘 못하겠음.