본문 바로가기

요약1

[LLM] LLM 텍스트 요약 평가 관련 + 논문 리뷰 최근 LLM 모델을 활용한 요약이 BART나 T5 등 기존의 생성 요약 모델을 파인튜닝한 것보다, 심지어 사람이 요약한 것보다 더 좋다는 연구 결과가 나왔습니다. 그런데 이런 요약 모델의 성능 평가는 어떻게 해야 할까요? 기존에 텍스트 요약 과제에서, 모델 셀렉션이나 성능 평가 부분이 가장 어려웠는데요. 사실 요약이 잘되었다고 판단하는 부분이 지극히 주관적인 영역이라, 인간이 요약한 문장도 어떤 문장이 요약을 잘 한 것인지를 판단하기가 어렵기 때문입니다. 정통적으로 NLP나 summarization 부분에서 사용하는 ROUGE 같은 정량적인 스코어도 있지만 별 의미가 없어서... 결국 휴먼 피드백이나 보팅으로 해결하곤 했습니다. AI 모델이 요약한 문장은 어떻게 평가할 수 있을지, 평가방법에 대한 연구가.. 2023. 9. 26.

이전 1 다음

티스토리툴바