AI 인공지능9 yelp 리뷰 감성 분류 (1) 이 글은 파이토치로 배우는 자연어처리(O'REILLY, 한빛미디어)를 공부한 내용을 바탕으로 작성하였습니다. yelp 레스토랑 리뷰 데이터셋 리뷰 텍스트(review)와 그에 맞는 평가 레이블(rating)를 준비하고, train, valid, test (0.7, 0.15, 0.15)로 분류 from argparse import Namespace from collections import Counter import json import os import re import string import numpy as np import pandas as pd import torch import torch.nn as nn import torch.nn.functional as F import torch.optim .. 2023. 3. 30. 파이토치 신경망 구성하기 이 글은 파이토치로 배우는 자연어처리(O'REILLY, 한빛미디어)를 공부한 내용을 바탕으로 작성하였습니다. 1. 퍼셉트론 구현 y = f(wx + b) x : 입력 w : 가중치 b : 편향, 절편 y : 출력 f(): 활성화 함수 선형 함수 표현인 wx + b 는 아핀 변환(affine transform)이라고 불린다. class Perceptron(nn.Module): """ 퍼셉트론은 하나의 선형 층입니다 """ def __init__(self, input_dim): """ 매개변수: input_dim (int): 입력 특성의 크기 """ super(Perceptron, self).__init__() self.fc1 = nn.Linear(input_dim, 1) def forward(self, x.. 2023. 3. 24. 자연어처리(NLP) 기본 용어 정리 이 글은 파이토치로 배우는 자연어처리(O'REILLY, 한빛미디어)를 공부한 내용을 바탕으로 작성하였습니다. 1. 말뭉치(corpus) : 텍스트 데이터와 그와 연관된 메타데이터를 원소로 하는 집합 2. 메타데이터: 식별자, 레이블, 타임스탬프 등 텍스트와 관련된 부가정보 3. 샘플, 데이터 포인트: 메타데이터가 붙은 텍스트 4. 샘플의 모음: 말뭉치, 데이터셋 5. 토큰화: 텍스트를 토큰으로 나누는 과정. 의미있는 단위로 토큰을 설정하고 토큰을 기준으로 corpus를 나눈다. ex) Tweet 텍스트 토큰화 하기 from nltk.tokenize import TweetTokenizer tweet = u"Snow White and the Seven Degrees #MakeMovieCold@midnight.. 2023. 3. 21. 이전 1 2 다음