티스토리 뷰

4. DB 개괄

데이터베이스는 Index라는 순서로 데이터들이 정렬되어 있으며, 필요할 때 잘 뽑아 쓰기 위해서 정리하는 것.

DB는 데이터를 잘 쌓고, 잘 추출하기 위한 프로그램(컴퓨터에도 깔 수 있으나 최근에는 클라우드를 사용)

 

[DB의 두 가지 종류]

1) RDBMS(SQL): 행/열의 생김새가 정해진 엑셀에 데이터를 저장하는 것과 유사

정형화되어 있기 때문에 데이터의 일관성, 분석에 용이하나 유연한 대처가 어려움(중간에 데이터 추가 등)

ex) MS-SQL, My-SQL 등

2) NoSQL(Not only SQL): 딕셔너리 형태로 데이터를 저장, 자유로운 형태의 데이터 적재

일관성이 부족하나 유연한 대처가 가능함

ex) MongoDB Atlas

 

5. MongoDB 사용하기

(1) MongboDB 회원가입

https://account.mongodb.com/account/register

 

(2) PyCharm에서 패키지 설치하기

pymongo, dnspython

설정 > + > pymongo, dnspython 패키지 설치

 

(3) pymongo 코드 요약

 

 

[ 기본코드 ]

from pymongo import MongoClient
client = MongoClient('mongodb+srv://test:sparta@cluster0.dgc9mi9.mongodb.net/Cluster0?retryWrites=true&w=majority')
db = client.dbsparta

from pymongo import MongoClient
client = MongoClient('여기에 URL 입력')
db = client.dbsparta

 

1) 저장
doc = {'name':'bobby','age':21}
db.users.insert_one(doc)

2) 한 개 찾기
user = db.users.find_one({'name':'bobby'})

print(user)

만약, 찾은 데이터의 이름(name)만 나타내고 싶으면, print(user['name'])

3) 여러 개 찾기 ( _id 값은 제외하고 출력)
all_users = list(db.users.find({},{'_id':False}))
print(all_users)


4) 바꾸기 
db.users.update_one({'name':'bobby'},{'$set':{'age':19}})
'users 폴더에서 name이 bobby인 것을 찾아서 age를 19로 업데이트하라.'

 

5) 지우기
db.users.delete_one({'name':'bobby'})

'name이 bobby인 항목을 찾아서 삭제하라.'


(예시 1) 데이터 업로드

import requests
from bs4 import BeautifulSoup

from pymongo import MongoClient
client = MongoClient('mongodb+srv://test:sparta@cluster0.dgc9mi9.mongodb.net/Cluster0?retryWrites=true&w=majority')
db = client.dbsparta

headers = {'User-Agent' : 'Mozilla/5.0 (Windows NT 10.0; Win64; x64)AppleWebKit/537.36 (KHTML, like Gecko) Chrome/73.0.3683.86 Safari/537.36'}
data = requests.get('https://movie.naver.com/movie/sdb/rank/rmovie.naver?sel=pnt&date=20210829',headers=headers)

soup = BeautifulSoup(data.text, 'html.parser')

movies=soup.select('#old_content > table > tbody > tr')

for movie in movies:
    a = movie.select_one('td.title > div > a')
    if a is not None:
        title=a.text
        rank = movie.select_one('td:nth-child(1) > img')['alt']
        star = movie.select_one('td.point').text
        doc={
            'title':title,
            'rank':rank,
            'star':star
        }
        db.movies.insert_one(doc)

doc={}, db.movies.insert_one(doc) 사용하여 항목들 업로드


(예시 2) 가버나움과 같은 평점의 영화 찾기

from pymongo import MongoClient
client = MongoClient('mongodb+srv://test:sparta@cluster0.dgc9mi9.mongodb.net/Cluster0?retryWrites=true&w=majority')
db = client.dbsparta

m = db.movies.find_one({'title':'가버나움'})
star = m['star']

all_movies = list(db.movies.find({'star':star},{'_id':False}))
for m in all_movies:
    print(m['title'])

all_movies=list(db.movies.find({'star':star},{'_id':False}))

for m in all_movies:

이때, 'star'는 movies라는 폴더의 DB 중 star라는 항목 전체를 의미하는 것이고,

star는 위에서 정의한 star=m['star'] 즉, 가버나움의 star 값을 의미한다.


+ 추가) 파이썬 내장함수

앞에서 두 글자만 끊기: text[0:2]

양쪽 여백 없애기: strip()

댓글