내부적으로는 생성될 토큰의 확률(logit)을 조정하여 스키마에 맞는 토큰만 샘플링하도록 유도하는 방식으로 동작하는 것
1 min read
내부적으로는 생성될 토큰의 확률(logit)을 조정하여 스키마에 맞는 토큰만 샘플링하도록 유도하는 방식으로 동작하는 것
LLM의 추론 과정은 크게 두 단계로 나뉩니다. Prefill(프리필) 단계 이 단계에서는 사용자가 입력한 프롬프트(문장)를 처음으로 처리합니다.
한줄 요약 Prefill은 LLM이 사용자의 prompt를 처음 한 번 읽는 단계다. 이때 모델은 prompt token 전체를 Transformer에 통과시키고, 이후 decode에서 재사용할 KV Cache를 만든다.
Batch Decoding LLM API 콜 할때 시간/비용이 많이 요구되는 이슈를 해결하기 위해 사용하는 방법 일종의 프롬프트 엔지니어링 처럼 해결하는 것으로 보임 PROMPT = """\ 다양한 작업에 대한 답변을 생성해주세요, 이러한 작업 지침은 ChatGPT 모델에 주어지며,...
한줄 요약 LLMLingua 는 긴 prompt에서 덜 중요한 token을 제거해 LLM 입력을 짧게 만드는 prompt compression 계열 방법이다.
Prompt 종류 A.1) Instruction Prompt Extract the name of the author from the quotation below.
General LVLMs 학습 방법 Visual-encoder → cross-modal connector → LLM Vision Transformer (ViT) Component Image-text pairs 를 이용해서 학습 수행 주로 CLIP 모델을 인코더로 활용한다.
한줄 요약 2026년 7월 기준으로 “문장 압축”은 예전처럼 사람이 읽기 좋은 짧은 문장을 만드는 기술이라기보다, LLM이 답하는 데 필요한 정보만 남겨 context budget, Prefill latency, input token 비용, KV Cache memory를 관리하는 기술 로 발전하고 있다.
배경 Qwen2.5 의 72b 급 대용량 모델을 학습하는 방법에 대해 조사해보자.
Vicuna ShareGPT 에서 모은 약 125K 개의 사용자 대화 데이터를 기반으로 파인튜닝한 Llama 기반 모델 B) Training B.1) 데이터셋 ShareGPT 데이터셋은 공개하지 않음 B.1.1) Preprocessing To ensure data quality, we convert the...