Zzong's Notes

Home

❯

papers

❯

language_model

❯

Do not Stop Pretraining - Adapt Language Models to Domains and Tasks

Do not Stop Pretraining - Adapt Language Models to Domains and Tasks

2026년 8월 29일1 min read

References

  • LangCon 2023 - 특정 도메인에 맞는 언어모델은 어떻게 만들까?

함께 보면 좋은 글

MPNet

MPNet - Masked and Permuted Pre-training for Language Understanding Abstract BERT 과 XLNet 의 장점을 가지면서 단점을 극복한 pre-training 학습 모델.

RoBERTa

Pretrained model on English language using a masked language modeling (MLM) objective. Vs.

Self-Rewarding Language Models

Self-Rewarding Language Models, where the language model itself is used via LLM-as-a-Judge prompting to provide its own rewards during training.

LIMA

특정 태스크 수행 능력을 위해 소량의 잘 검수된 데이터가 조금이라도 들어가면 도움이 된다는것이지만, 질이 떨어지는 데이터도 대량으로 있으면 역시 성능 향상에 도움이 된다는점인것 같습니다.

Bidirectional Encoder Representations from Transformers

BERT Google 에서 만든 language representation model. BERT 는 미리 학습된 (pre-trained) 언어 모델이다.

Distributed representations of words and phrases and their compositionality

paper link Abstract skip-gram 모델의 extension 을 제안함으로써 학습 속도와 vector quality 상승을 보였다.

Chain of Hindsight Aligns Language Models with Feedback

SFT 사전 학습된 언어 모델을 미세 조정하는 데 사용됩니다. 인간이 주석을 달아준 데이터와 긍정적으로 평가된 모델 생성에 의존합니다. 문제점 이 접근 방식은 레이블이 지정된 데이터의 가용성에 크게 의존하며, 이는 상당한 비용과 시간 투자를 필요로 할 수 있습니다.

DialogLM

DialogLM이란 DialogLM은 긴 대화를 이해하고 요약하기 위해 사전 학습된 인코더-디코더 기반 신경망 모델입니다. 기존 연구의 한계 지금까지의 연구는 주로 짧은 길이의 1:1 대화 상황에 집중되어 있었습니다.

Attention Is All You Need

Abstract transformer 구조를 제안: attention 메커니즘에 기반한 구조로, convolution 또는 recurrence 에 적용 가능 Introduction 기존 Gated Recurrent Unit, Long Short-Term Memory 같은 recurrent model 은...

Compact Language Models via Pruning andKnowledge Distillation

NVIDIA 의 Pruning 과 Knowledge Distillation 을 통한 언어 모델 압축 최근 NVIDIA 연구진은 structured weight pruning 과 knowledge distillation 을 결합한 방법이, 대형 언어 모델을 점차적으로 더 작은 모델로 압축하는 데 매우 효과적이라는...