내부적으로는 생성될 토큰의 확률(logit)을 조정하여 스키마에 맞는 토큰만 샘플링하도록 유도하는 방식으로 동작하는 것.
Batch Decoding LLM API 콜 할때 시간/비용이 많이 요구되는 이슈를 해결하기 위해 사용하는 방법 일종의 프롬프트 엔지니어링 처럼 해결하는 것으로 보임 PROMPT = """\ 다양한 작업에 대한 답변을 생성해주세요, 이러한 작업 지침은 ChatGPT 모델에 주어지며,...
한줄 요약 Prompt Compression은 LLM에 넣는 prompt를 더 짧게 줄이되, 답변에 필요한 정보는 최대한 남기려는 input 최적화 방법이다.
LLM의 추론 과정은 크게 두 단계로 나뉩니다. Prefill(프리필) 단계 이 단계에서는 사용자가 입력한 프롬프트(문장)를 처음으로 처리합니다.
Prompt Engineering Related References.
Gradient Checkpoint GitHub - cybertronai/gradient-checkpointing: Make huge neural nets fit in memory.
Trainer(huggingface) 언어 모델을 학습하기 위해 사용하는 허깅페이스 클래스. 주로 LLM 을 학습할때 사용한다. 2. Training Arguments steps: 데이터셋에 포함된 배치 개수를 의미.
한줄 요약 Prefill은 LLM이 사용자의 prompt를 처음 한 번 읽는 단계다. 이때 모델은 prompt token 전체를 Transformer에 통과시키고, 이후 decode에서 재사용할 KV Cache를 만든다.
LLM에서의 ‘채널’이란 결론부터 말하면, LLM, 특히 트랜스포머(Transformer) 아키텍처에서 ‘채널’은 주로 피드 포워드 신경망(Feed-Forward Network, FFN)의 중간 확장 계층(intermediate expansion layer)의 차원(dimension)을 의미합니다.
패치 단위 텐서 Qwen3-VL 비전 백본은 이미지를 바로 픽셀 단위로 쓰지 않고, 먼저 일정한 크기의 격자(패치)로 잘라서 각 패치를 하나의 벡터로 바꿉니다.