2주차: 언어와 말뭉치, 텍스트 전처리와 단어 분포
언어와 말뭉치, 텍스트 전처리와 단어 분포
온라인 (2시수)
Section titled “온라인 (2시수)”말뭉치 개념, 토큰화·불용어 제거 등 전처리 기법, Zipf 법칙 강의 및 코드 데모 / 학습활동 - 제공된 한국어 텍스트에서 가장 많이 나온 단어 10개를 눈으로 세어 보고 예상 작성
대면 (1시수)
Section titled “대면 (1시수)”데모 따라하기 실습 - 파이썬으로 단어 빈도 집계, 단어 분포 시각화
[이론] 소수 단어가 대부분의 빈도를 차지하는 분포를 직접 센 결과와 대조해 확인
[구현] 단어 빈도 집계와 시각화 코드를 데모 따라 작성. 한국어 띄어쓰기·조사 처리를 영어 예제와 대비
[실무] 제주 지역 텍스트를 말뭉치로 써서 실제 데이터가 교과서 예제와 어떻게 다른지 확인. AI Hub 「한국어 방언 발화(제주도)」의 방언·표준어 대응쌍을 소개 수준으로 함께 열어보고, 같은 뜻이 표기에 따라 어떻게 달라지는지 눈으로 확인 〔지역 텍스트는 제주데이터허브에서 확보, 개강 전 확인〕
실습 노트북
Section titled “실습 노트북”준비 중입니다. 올라오면 이 자리에 Colab 링크가 표시됩니다.