2025/07 16

250730_태블로 기초, 파이썬(pop())

요약/나만의 인사이트while문을 써서 정답을 맞추더라도 인덱스 과정의 문제나 시간지연되면 오답처리 될 수 있다.pop()은 리스트의 맨 마지막 요소를 빼와서 반환하는 함수이다.for _ in range(m)은 0부터 m-1까지 반복하되, 따로 변수는 없는 것을 뜻한다. 따라서 동작을 여러번 수행해야 할 때 쓰인다. 예를 들어 pop()처럼 원본 리스트에서 요소를 반복해서 빼내어야 할 때새롭게 알게 된 것태블로 데이터 결합데이터 원본로지컬 레이어 - 관계데이터가 실제로 결합한 것은 아님table A, table B를 관계를 맺게 만들어 뷰에만 보이게 하는 것피지컬 레이어 - 조인 유니온실제로 결합하는 형태로컬의 데이터 데이터 원본1, 데이터 원본2를 결합할 때 ⇒ 블렌딩데이터 원본을 건드릴 수 없을 때무..

시각화 2025.07.30

250729_태블로 기초, SQL(윈도우 함수 관련 문제), 파이썬(인덱스 관련 문제)

요약/나만의 인사이트SQL ⇒ 각 가격에 판매량을 곱해서 더한 값을 전체 판매량으로 나눈 것으로 가중평균이라고 한다. 가중평균은 AVG()함수를 쓸 수 없다. 왜냐하면 AVG()는 단순히 모든수를 더한값에 개수로 나눠주기 때문이다.가중평균은 다음과 같다. SUM(가격 × 판매량) / SUM(판매량) 즉 각 상품별 판매량을 고려AVG는 다음과 같다. AVG(price) (100+200) /2윈도우 함수는 행마다 도는 함수이다.rank over() row_number() 모두 순위를 구하는 윈도우 함수이다.rank over()은 공동순위면 같은 랭킹 번호 부여 1 2 2 4row_number()은 공동순위 일자라도 무조건 고유 랭킹 번호 부여한다. 1 2 3 4 이때 랭킹순서는 먼저 등장한 순서이다.새롭게 ..

시각화 2025.07.29

250728_파이썬(무슨요일인지 맞추기), 태블로 기초

요약/나만의 인사이트태블로 로그인 절차가 까다로운 것 같다. 그만큼 보안에 각별히 신경쓰는 듯 하다.drill and drop down 하는 형태로 태블로의 기능은 그렇게 어려운 것 같진않다. 굉장히 직관적이고 간편하다.중요한 건 이것을 통해 내가 보고 싶은것, 파악해야 할 것 즉 목표이고 그것을 어떻게 구현할 수 있을까라는 관점이다.따라서 튜터님의 강의를 들을 때 이 시각화 자료를 통해서 무엇을 알고 싶은것일까? 무엇을 해결하고 싶은 것일까? 등의 자세로 수업에 임해야겠다.새롭게 알게 된 것태블로테이블 구분 : 차원 / 측정값차원은 구분된 항목이고측정값은 순익, 매출 등 숫자 값차원 → 측정값으로 사용할 수 있다.e.g. 마우스 우클릭 후 마크의 텍스트로 끌고오면 카운트, 최대값등의 수치를 사용할 수 ..

기타/Python 2025.07.28

250726_에어비앤비 가격예측 모델 (회귀) Weekly I learned

🟢 Keep (유지할 것)문제정의를 위해 데이터셋을 탐구하고 궁금한 점(가설)을 직접 확인해 보았다.나의 의견을 잘 정돈하여 개진하려고 노력했다.규제라는 외부요인을 토대로 생존/중단으로 그룹핑 해 봤다.그것들의 특징을 알아내기 위해 관련된 시각화를 여러번 하였다.회귀계수(회귀식의 기울기, 1증가할 때 얼만큼 커지거나 작아지는지), 상관계수(두 변수와의 관계, 방향과 강도를 결정), 독립표본 T검정(독립된 두표본의 평균이 통계적으로 유의미한지 비교, 이때 정규성, 등분산성 가정), 카이제곱 검정(범주형 변수의 관계 검정) 등등 익숙치 않았던 개념의 이해도를 높였다.이상치 제거를 위해선 히스토그램 , 박스플롯을 그리고 실제 이상치가 비즈니스 적으로 현실 불가능한 수치인지 확인하는 것을 알게 되었다.🔴 P..

250725_파이썬(표준 라이브브러리), 태블로(기본개념)

요약/나만의 인사이트파이썬 구조파일 → 모듈 → 패키지 → 라이브러리파일 : py모듈 : 특정 주제에 대한 정의들 e.g. 수학 모듈 과학모듈패키지 : 모듈들이 합쳐진 것 e.g. 이과 패키지 문과 패키지라이브러리 : 패키지가 합쳐진 것 e.g. 고등학생 라이브러리from utils.file_utils import read_file 형식으로 가져옴파이썬 문제 해석의 흐름1️⃣문제가 요구하는 게 뭐야 (목표)2️⃣우리의 데이터는 어떤지? (확인)3️⃣ 어떤 로직, 함수가 필요할까? (처리)새롭게 알게 된 것파이썬 체계 파일.py 확장자를 가진 Python 스크립트 파일폴더(디렉토리)여러 파일을 모아놓은 구조 (모듈/패키지의 기본 단위)모듈(Module)변수, 함수, 클래스 등을 담은 .py 파일패키지(P..

기타/Python 2025.07.25

250715_파이썬(enumerate 코드타카 풀이)

오늘은 어려웠던 코드타카 문제 위주로 TIL을 작성해본다.코드타카 enumerate(인덱스와 값을 같이 출력해주는 문제)문제나의 풀이앞에 같은 문자가 있으면 얼만큼 떨어져 있는지, 인덱스라는 개념을 통해 깨달았지만 그걸 어떻게 구현할지 헤맸다.가령 “banana”일 때 두번째 ‘a’의 경우 인덱스 3-1하면 된다.즉 두번째 ‘a’ 인덱스 3 - 첫번째 ‘a’ 인덱스 1 = 2 이이다.def solution(s): answer = [] #숫자(값)을 담을 리스트 words = [] #문자 값을 담을 리스트 for w in s: if w not in words: answer.append(-1) words.append(w) elif w in words..

기타/Python 2025.07.15

250714_통계복습(t분포, 이항분포, t검정, 비모수검정)

요약/나만의 인사이트데이터는 크게 수치형(양적), 범주형으로 나뉠 수 있다.수치형 데이터는 연속형(ex 나이, 키 - 소수점 자리까지 숫자가쭉이어짐), 이산형(ex 시험 응시자 수, 판매자 수, 페이지 뷰 수 - 뚝뚝 끊어지는 수)데이터로 나눌 수 있다.범주형 데이터는 명목형(ex 성별), 순서형(ex 사이즈, 등급)데이터로 나뉠 수 있다.t분포는 표본수가 작을 때 평균 비교 시 사용되는 분포이다.이항분포는 비율 비교 시 사용된다. (ex 생존비율 vs 사망비율)t검정은 두 그룹간 평균비교할 시 사용된다. (ex 생존자 평균나이 vs 사망자 평균나이)t검정시 정규성, 등분산성을 만족해야한다.정규성 만족하나 이분산성(분산이 다를) 경우 Welch’s t-test로 검정한다.정규성을 불만족하나 충분한 표본의..

250711_파이썬(순열과 조합), 데이터분석의 흐름

요약/나만의 인사이트지도학습(선형회귀) : 몸무게를 통해 키 예측하기 (숫자예측)회귀분석의 평가지표 : MSE(실제값과 예측값의 차이를 제곱해 데이터 개수로 나눈것), RMSE(MSE에 루트 씌운것), R2 square(결정계수, 회귀모델이 데이터를 얼마나 잘 설명하고 있는가. EX 0.8이다 => X변수로 Y를 80% 예측할 수 있다.)선형회귀의 가정선형성등분산성(오차(=잔차)의 크기가 일정하다.)정규성(오차항은 정규분포를 따른다.)독립성(X변수는 서로 독립적이어야 한다.)다중공선성 : 상관관계가 높은 변수들로 인해 예측이나 해석력이 떨어지는 문제가 발생하는 것해결하는 방법서로 상관관계가 높은 변수 중 하나만 선택차원축소로지스틱회귀(분류) 시그모이드함수를 이용해 확률값을 알아내어 분류하는 것새롭게 알게..

기타/Python 2025.07.11

250710_파이썬(표준라이브러리), 머신러닝(선형회귀, 랜덤포레스트 복습)

요약/나만의 인사이트.split() : 문자열을 구분자로 나눠 리스트에 하나씩 담기text = 'banana apple kiwi pineapple orange'answer = text.split() #()안에 아무것도 없으면 공백 기준으로 나눠서 리스트에 담음print(answer) #['banana', 'apple', 'kiwi', 'pineapple', 'orange']머신러닝 순서라이브러리 import변수선언(X - 다차원(df)) (y -1차원(serise))학습예측평가머신러닝을 하려면 모든 문자는 숫자로 변환시켜줘야 한다. (컴퓨터가 읽을 수 있도록)새롭게 알게 된 것SOL MOD 함수개념: 두 숫자를 나누었을 때 발생하는 나머지를 반환하는 함수 MOD(10, 3) = 1활용: 홀수인 아이디만 ..

기타/Python 2025.07.10

250709_머신러닝(클러스터링, 이상탐지)

요약/나만의 인사이트비지도 학습은 정답값을 알려주지 않고 머신러닝을 학습시키는 것이다. 이중에 클러스터링(군집)이 있다.군집은 비슷한 특성을 가진 데이터를 묶는다. 이때 군집내유사도 최대화, 군집간 차이도 최대화하도록 한다.클러스터링 종류에는 K-Means, DBSCAN, 계층적 클러스터링이 있다.군집 분석 평가 시 실루엣 계수(군집내거리는 가깝니?, 군집간 거리는 머니?), Davies-Bouldin Index(군집끼리 얼마나 겹치니) 등을 통해 파악한다.새롭게 알게 된 것 비지도학습 비지도학습이란❓ 정답값(레이블) 없이 데이터의 패턴이나 구조를 찾는 머신러닝 기법 클러스터링(군집화) 차원 축소 이상치 탐지 클러스터링 종류 k-means 클러스터링 _ ..