내부적으로는 생성될 토큰의 확률(logit)을 조정하여 스키마에 맞는 토큰만 샘플링하도록 유도하는 방식으로 동작하는 것
1 min read
내부적으로는 생성될 토큰의 확률(logit)을 조정하여 스키마에 맞는 토큰만 샘플링하도록 유도하는 방식으로 동작하는 것
LLM API 콜 할때 시간/비용이 많이 요구되는 이슈를 해결하기 위해 사용하는 방법 일종의 프롬프트 엔지니어링 처럼 해결하는 것으로 보임 PROMPT = """\ 다양한 작업에 대한 답변을 생성해주세요, 이러한 작업 지침은 ChatGPT 모델에 주어지며, ChatGPT 모델이 지침을...
LLM의 추론 과정은 크게 두 단계로 나뉩니다. Prefill(프리필) 단계 이 단계에서는 사용자가 입력한 프롬프트(문장)를 처음으로 처리합니다.
빔 서치(Beam Search) Beam search 빔 서치는 매 시점마다 가장 확률이 높은 단어 하나만을 선택하는 그리디 서치(Greedy Search)와 달리, 확률이 높은 상위 k개의 후보(빔)를 동시에 유지하면서 문장을 생성하는 방식입니다.
KV Cache는 Transformer decoder가 autoregressive generation을 할 때 이전 token들의 key/value tensor를 저장해두는 cache다.
한줄 요약 Prefill은 LLM이 사용자의 prompt를 처음 한 번 읽는 단계다. 이때 모델은 prompt token 전체를 Transformer에 통과시키고, 이후 decode에서 재사용할 KV Cache를 만든다.
한줄 요약 Prompt Compression은 LLM에 넣는 prompt를 더 짧게 줄이되, 답변에 필요한 정보는 최대한 남기려는 input 최적화 방법이다.
한줄 요약 LLMLingua 는 긴 prompt에서 덜 중요한 token을 제거해 LLM 입력을 짧게 만드는 prompt compression 계열 방법이다.
Prompt 종류 Instruction Prompt Extract the name of the author from the quotation below.
General LVLMs 학습 방법 Visual-encoder → cross-modal connector → LLM Vision Transformer (ViT) Component Image-text pairs 를 이용해서 학습 수행 주로 CLIP 모델을 인코더로 활용한다.
한줄 요약 2026년 7월 기준으로 “문장 압축”은 예전처럼 사람이 읽기 좋은 짧은 문장을 만드는 기술이라기보다, LLM이 답하는 데 필요한 정보만 남겨 context budget, Prefill latency, input token 비용, KV Cache memory를 관리하는 기술 로 발전하고 있다.