KSS 피드백
- Keep: 계속 유지했으면 하는 점
- Start: 개선했으면 하는 점
- Stop: 그만해줬으면 하는 점
1 min read
KSS 피드백
Korean Models GitHub - seujung/KoBART-summarization: Summarization module based on KoBART Survey Abstractive Meeting Summarization: A Survey | Transactions of the Association...
LLM 파인 튜닝 용 라이브러리 Arguments Description tf32 .
sentence embedding 의 품질을 측정하는 라이브러리 STS Benchmark (code review) 논문 “Improved Semantic Representations From Tree-Structured Long Short-Term Memory Networks” 을 참고한 벤치마크 방식이다.
카카오 브레인에서 만든 자연어 처리 모델 SentenceFactory sentence transformers 라이브러리 사용 한국어 모델의 경우 brainsbert.base.ko.kornli.korsts 를 사용중임 brainsbert 의 경우 사용가능한 모델은 RoBERTa 밖에 없음 References...
The Korean Question Answering Dataset github site: korquad.github.io/ KorQuAD 2.0 은 KorQuAD 1.0 에서 질문답변 20,000+ 쌍을 포함하여 총 100,000+ 쌍으로 구성된 한국어 Machine Reading Comprehension...
한국어 모델 Eos Token 이슈 한글 LLM 맛보기 : 네이버 블로그.
Application of seq2seq Model Translation Image captioning: Example of the Alexnet 일반적인 Language 모델과의 비교 일반적인 language 모델과 달리, 주어진 입력이 zero vector 가 아니라, encoder 의 output...
Gensim 은 문서를 semantic vector 로 효율적으로 표현하기 위한 파이썬 라이브러리이다. Gensim 은 구조화 되어있지 않은 plain text 를 unsupervised learning 알고리즘을 통해 처리한다.
문서 내 단어를 벡터로 임베딩하는 Word2Vec 과 달리, 전체 문서를 벡터로 임베딩하는 모델이다. 일반적으로 Paragraph Vector model 이라 불리며, Word2Vec 에서 얻어지는 벡터를 평균내는 방식보다 효과가 좋다고 알려져있다.
한국어 자연어 처리에 대한 모델을 정리한다. KcELECTRA 공개된 한국어 Transformer 계열 모델들은 대부분 한국어 위키, 뉴스 기사, 책 등 잘 정제된 데이터를 기반으로 학습한 모델입니다.