전체 글 76

250725_파이썬(표준 라이브브러리), 태블로(기본개념)

요약/나만의 인사이트파이썬 구조파일 → 모듈 → 패키지 → 라이브러리파일 : py모듈 : 특정 주제에 대한 정의들 e.g. 수학 모듈 과학모듈패키지 : 모듈들이 합쳐진 것 e.g. 이과 패키지 문과 패키지라이브러리 : 패키지가 합쳐진 것 e.g. 고등학생 라이브러리from utils.file_utils import read_file 형식으로 가져옴파이썬 문제 해석의 흐름1️⃣문제가 요구하는 게 뭐야 (목표)2️⃣우리의 데이터는 어떤지? (확인)3️⃣ 어떤 로직, 함수가 필요할까? (처리)새롭게 알게 된 것파이썬 체계 파일.py 확장자를 가진 Python 스크립트 파일폴더(디렉토리)여러 파일을 모아놓은 구조 (모듈/패키지의 기본 단위)모듈(Module)변수, 함수, 클래스 등을 담은 .py 파일패키지(P..

기타/Python 2025.07.25

250715_파이썬(enumerate 코드타카 풀이)

오늘은 어려웠던 코드타카 문제 위주로 TIL을 작성해본다.코드타카 enumerate(인덱스와 값을 같이 출력해주는 문제)문제나의 풀이앞에 같은 문자가 있으면 얼만큼 떨어져 있는지, 인덱스라는 개념을 통해 깨달았지만 그걸 어떻게 구현할지 헤맸다.가령 “banana”일 때 두번째 ‘a’의 경우 인덱스 3-1하면 된다.즉 두번째 ‘a’ 인덱스 3 - 첫번째 ‘a’ 인덱스 1 = 2 이이다.def solution(s): answer = [] #숫자(값)을 담을 리스트 words = [] #문자 값을 담을 리스트 for w in s: if w not in words: answer.append(-1) words.append(w) elif w in words..

기타/Python 2025.07.15

250714_통계복습(t분포, 이항분포, t검정, 비모수검정)

요약/나만의 인사이트데이터는 크게 수치형(양적), 범주형으로 나뉠 수 있다.수치형 데이터는 연속형(ex 나이, 키 - 소수점 자리까지 숫자가쭉이어짐), 이산형(ex 시험 응시자 수, 판매자 수, 페이지 뷰 수 - 뚝뚝 끊어지는 수)데이터로 나눌 수 있다.범주형 데이터는 명목형(ex 성별), 순서형(ex 사이즈, 등급)데이터로 나뉠 수 있다.t분포는 표본수가 작을 때 평균 비교 시 사용되는 분포이다.이항분포는 비율 비교 시 사용된다. (ex 생존비율 vs 사망비율)t검정은 두 그룹간 평균비교할 시 사용된다. (ex 생존자 평균나이 vs 사망자 평균나이)t검정시 정규성, 등분산성을 만족해야한다.정규성 만족하나 이분산성(분산이 다를) 경우 Welch’s t-test로 검정한다.정규성을 불만족하나 충분한 표본의..

250711_파이썬(순열과 조합), 데이터분석의 흐름

요약/나만의 인사이트지도학습(선형회귀) : 몸무게를 통해 키 예측하기 (숫자예측)회귀분석의 평가지표 : MSE(실제값과 예측값의 차이를 제곱해 데이터 개수로 나눈것), RMSE(MSE에 루트 씌운것), R2 square(결정계수, 회귀모델이 데이터를 얼마나 잘 설명하고 있는가. EX 0.8이다 => X변수로 Y를 80% 예측할 수 있다.)선형회귀의 가정선형성등분산성(오차(=잔차)의 크기가 일정하다.)정규성(오차항은 정규분포를 따른다.)독립성(X변수는 서로 독립적이어야 한다.)다중공선성 : 상관관계가 높은 변수들로 인해 예측이나 해석력이 떨어지는 문제가 발생하는 것해결하는 방법서로 상관관계가 높은 변수 중 하나만 선택차원축소로지스틱회귀(분류) 시그모이드함수를 이용해 확률값을 알아내어 분류하는 것새롭게 알게..

기타/Python 2025.07.11

250710_파이썬(표준라이브러리), 머신러닝(선형회귀, 랜덤포레스트 복습)

요약/나만의 인사이트.split() : 문자열을 구분자로 나눠 리스트에 하나씩 담기text = 'banana apple kiwi pineapple orange'answer = text.split() #()안에 아무것도 없으면 공백 기준으로 나눠서 리스트에 담음print(answer) #['banana', 'apple', 'kiwi', 'pineapple', 'orange']머신러닝 순서라이브러리 import변수선언(X - 다차원(df)) (y -1차원(serise))학습예측평가머신러닝을 하려면 모든 문자는 숫자로 변환시켜줘야 한다. (컴퓨터가 읽을 수 있도록)새롭게 알게 된 것SOL MOD 함수개념: 두 숫자를 나누었을 때 발생하는 나머지를 반환하는 함수 MOD(10, 3) = 1활용: 홀수인 아이디만 ..

기타/Python 2025.07.10

250709_머신러닝(클러스터링, 이상탐지)

요약/나만의 인사이트비지도 학습은 정답값을 알려주지 않고 머신러닝을 학습시키는 것이다. 이중에 클러스터링(군집)이 있다.군집은 비슷한 특성을 가진 데이터를 묶는다. 이때 군집내유사도 최대화, 군집간 차이도 최대화하도록 한다.클러스터링 종류에는 K-Means, DBSCAN, 계층적 클러스터링이 있다.군집 분석 평가 시 실루엣 계수(군집내거리는 가깝니?, 군집간 거리는 머니?), Davies-Bouldin Index(군집끼리 얼마나 겹치니) 등을 통해 파악한다.새롭게 알게 된 것 비지도학습 비지도학습이란❓ 정답값(레이블) 없이 데이터의 패턴이나 구조를 찾는 머신러닝 기법 클러스터링(군집화) 차원 축소 이상치 탐지 클러스터링 종류 k-means 클러스터링 _ ..