Skip to content

2주차: 언어와 말뭉치, 텍스트 전처리와 단어 분포

언어와 말뭉치, 텍스트 전처리와 단어 분포

말뭉치 개념, 토큰화·불용어 제거 등 전처리 기법, Zipf 법칙 강의 및 코드 데모 / 학습활동 - 제공된 한국어 텍스트에서 가장 많이 나온 단어 10개를 눈으로 세어 보고 예상 작성

데모 따라하기 실습 - 파이썬으로 단어 빈도 집계, 단어 분포 시각화

[이론] 소수 단어가 대부분의 빈도를 차지하는 분포를 직접 센 결과와 대조해 확인

[구현] 단어 빈도 집계와 시각화 코드를 데모 따라 작성. 한국어 띄어쓰기·조사 처리를 영어 예제와 대비

[실무] 제주 지역 텍스트를 말뭉치로 써서 실제 데이터가 교과서 예제와 어떻게 다른지 확인. AI Hub 「한국어 방언 발화(제주도)」의 방언·표준어 대응쌍을 소개 수준으로 함께 열어보고, 같은 뜻이 표기에 따라 어떻게 달라지는지 눈으로 확인 〔지역 텍스트는 제주데이터허브에서 확보, 개강 전 확인〕

준비 중입니다. 올라오면 이 자리에 Colab 링크가 표시됩니다.